HeadlinesBriefing favicon HeadlinesBriefing.com

Analisis Claude Opus 5.5: Kecerdasan, Kinerja & Harga

Hacker News •
×

Artificial Analysis Intelligence Index v4.3.2 mencakup 10 evaluasi: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Lihat metodologi Intelligence Index untuk detail lebih lanjut, termasuk rincian setiap evaluasi dan bagaimana kami menjalankannya.

AA-Briefcase v1.1 adalah benchmark kerja pengetahuan agentik yang dikembangkan oleh Artificial Analysis. AA-Briefcase Elo adalah metrik gabungan yang menggabungkan tingkat kelulusan rubrik, Elo kualitas analitis, dan Elo presentasi · Lebih tinggi lebih baik. Indeks AA-Omniscience mengukur keandalan pengetahuan dan halusinasi. Ini memberi penghargaan pada jawaban yang benar, menghukum halusinasi, dan tidak ada hukuman untuk menolak menjawab. Skor berkisar dari -100 hingga 100, di mana 0 berarti jumlah jawaban benar sama dengan yang salah.

Perbandingan Intelligence Index: Intelligence Index vs. Biaya per Tugas Intelligence Index. Biaya rata-rata tertimbang per tugas Intelligence Index. Biaya setiap evaluasi dihitung dari harga token input, cache hit, cache write, penalaran, dan jawaban, dibagi dengan jumlah tugas, dan ditimbang berdasarkan bobot Intelligence Index-nya.

Entitas Utama: Perusahaan: Artificial Analysis