HeadlinesBriefing favicon HeadlinesBriefing.com

Intelligence Index v4.2 Dirilis

Hacker News •
×

Artificial Analysis telah merilis Intelligence Index v4.2, sebuah pembaruan sementara yang mempercepat elemen-elemen rilis v5 yang direncanakan untuk tetap sejalan dengan kemajuan model frontier yang cepat. Pembaruan ini memperkenalkan tugas yang lebih kompleks dan realistis, dan meningkatkan test set pribadi yang disimpan hingga 40% dari bobot Index — dua kali lipat dari angka v4.1 — untuk mencegah kecurangan. Dua evaluasi utama ditambahkan: AA-Briefcase, sebuah benchmark pekerjaan pengetahuan berbasis agen yang dikembangkan secara internal dengan test set pribadi yang menguji proyek mingguan melintasi ribuan file sumber, dan GDP.pdf dari Surge AI, yang mengevaluasi penalaran dokumen konteks panjang di seluruh 4.592 halaman PDF dengan 1.275 kriteria atomik yang ditulis oleh para ahli.

Peningkatan infrastruktur penilaian termasuk akurasi skor yang lebih baik di AA-LCR v1.1, rating Elo yang stabil untuk GDPval-AA v2 dan AA-Briefcase, dan sandbox penilaian yang lebih tangguh untuk Sci Code. Hasil utama menunjukkan bahwa Claude Fable 5.1 dari Anthropic memimpin Index, diikuti oleh GPT-6 Astra dari Open AI dengan peningkatan 4 poin dibandingkan GPT-5.6 Sol. Meta menduduki peringkat ketiga, diikuti oleh Space XAI, Moonshot/Kimi, Z. AI, dan Google.

Batas Pareto Cost per Task dibagi oleh Anthropic, Open AI, Meta, dan Z. AI, sementara GPT-6 Astra mendominasi batas efisiensi token keluaran di dekat batas kecerdasan.