HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash: analisis kecerdasan dan harga

Hacker News •
×

Artificial Analysis menyajikan analisis model GLM-5.3-Flash. Indeks Kecerdasan Artificial Analysis v4.1.1 mencakup 9 evaluasi: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, Sci Code, Humanity's Last Exam, GPQA Diamond, Crit Pt, AA-Omniscience, AA-LCR. Model penalaran ditandai dengan ikon bola lampu.

Indeks Kecerdasan mencakup evaluasi-evaluasi ini, dengan detail metodologi tersedia. Model diberi label 'Penggunaan Komersial Dibatasi' jika penggunaan komersial dibatasi, atau 'Non-komersial' jika lisensi melarang penggunaan komersial. Evaluasi kecerdasan diukur secara independen oleh Artificial Analysis, dengan skor lebih tinggi lebih baik.

Indeks AA-Omniscience mengukur keandalan pengetahuan dan halusinasi. Ini memberi penghargaan pada jawaban yang benar, menghukum halusinasi, dan tidak ada penalti untuk menolak menjawab. Skor berkisar dari -100 hingga 100, di mana 0 berarti jumlah jawaban benar sama dengan salah, dan skor negatif berarti lebih banyak salah daripada benar.

Perbandingan mencakup Indeks Kecerdasan versus biaya per tugas, menggunakan biaya rata-rata tertimbang dari harga token input, cache hit, cache write, penalaran, dan jawaban. Penggunaan token diukur sebagai token output per tugas Indeks Kecerdasan, dihitung dengan mengalikan token output per evaluasi dengan bobot benchmark.

Entitas Kunci: Perusahaan: Artificial Analysis