HeadlinesBriefing favicon HeadlinesBriefing.com

Analisis Kecerdasan, Kinerja, dan Harga Merkurius 2.5

Hacker News •
×

Indeks Kecerdasan Analisis Buatan v4.3.2 mencakup 10 evaluasi: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Indeks mengukur model terbuka versus model proprietari, dengan label untuk pembatasan penggunaan komersial. AA-Briefcase v1.1 adalah benchmark pengetahuan agent yang menggabungkan tingkat lulus rubrik, kualitas analitis Elo, dan kualitas presentasi Elo.

Nilai Indeks AA-Omniscience berkisar dari -100 hingga 100, mengukur keandalan pengetahuan dan halusinasi tanpa penalti untuk penolakan. Indeks Biaya per Tugas Kecerdasan menghitung rata-rata tertimbang dalam USD dari biaya input, cache hit, cache write, reasoning, dan harga token jawaban dibagi dengan jumlah tugas. Kecerdasan model umumnya dapat ditransfer antar kasus penggunaan, meskipun evaluasi tertentu mungkin lebih relevan untuk aplikasi tertentu.

Metodologi mencakup penjelasan masing-masing evaluasi dan cara pelaksanaannya.