HeadlinesBriefing favicon HeadlinesBriefing.com

Analisis Indeks Kecerdasan AI v4.3

Hacker News •
×

Indeks kecerdasan AI v4.3 dari Artificial Analysis menggabungkan 10 evaluasi: AA-Briefcase, GDPval-AA v2, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Lihat metodologi Indeks Kecerdasan untuk detail lebih lanjut, termasuk pemecahan setiap evaluasi dan cara kita menjalankannya.

Menunjukkan apakah bobot model tersedia. Model diberi label "Commercial Use Restricted" jika penggunaan komersial dibatasi oleh kondisi, dan "Non-commercial" jika lisensi melarang penggunaan komersial.

Indeks Kemampuan Mengukur kinerja model pada kemampuan dan industri tertentu.

Evaluasi kecerdasan diukur secara independen oleh Artificial Analysis · Semakin tinggi, semakin baik.

Coding agen dan penggunaan terminal Penalaran dokumen profesional Semua lulus medis Penalaran konteks panjang dalam medis Meskipun kecerdasan model secara umum sering diterjemahkan ke dalam kasus penggunaan, evaluasi tertentu mungkin lebih relevan untuk beberapa kasus penggunaan tertentu.

AA-Briefcase Elo adalah metrik gabungan yang mengagregasi tingkat penyelesaian rubrik, kualitas analitik Elo, dan Elo presentasi. Elo dan batas interval kepercayaan 95% dibatasi di 0.

Indeks AA-Omniscience (semakin tinggi, semakin baik) mengukur keandalan pengetahuan dan hallucinasi. Ia memberi penghargaan pada jawaban yang benar, menghukum hallucinasi, dan tidak memberi penalti untuk menolak untuk menjawab. Skor berkisar dari -100 hingga 100.

Entitas Kunci: Perusahaan: Artificial Analysis