HeadlinesBriefing favicon HeadlinesBriefing.com

MiMo-V2.6-Pro - Analisis Kecerdasan, Kinerja & Harga | Analisis Buatan

Hacker News •
×

Analisis Buatan merilis Indeks Kecerdasan v4.3.2 yang mencakup sepuluh evaluasi termasuk AA-Briefcase v1.1, GDPval-AA v2.1, Benchmark Otomatisasi-AA, Terminal-Bench 4.0, Kode Ilmiah, Ujian Akhir Manusia, GDP.pdf, Titik Kritis, AA-Kuatirsains, dan AA-LCR v1.1. Benchmark yang diperbarui mengukur kinerja model dalam kerja pengetahuan agen, coding, dan penalaran dokumen. Indeks Kecerdasan membandingkan biaya rata-rata tertimbang per tugas dalam USD dengan skor kemampuan.

Model diberi label 'Penggunaan Komersial Terbatas' atau 'Non-komersial' berdasarkan persyaratan lisensi. Benchmark AA-Briefcase v1.1 menggabungkan tingkat lulus rubrik, kualitas analitis Elo, dan presentasi Elo. Indeks AA-Kuatirsains mengukur keandalan pengetahuan dan halusinasi pada skala dari -100 hingga 100.

Indeks Keterbukaan menilai keterbukaan model dari 0 hingga 100. Metrik standar ini memungkinkan perbandingan langsung kapasitas AI di berbagai kasus penggunaan dan titik harga.