HeadlinesBriefing favicon HeadlinesBriefing.com

MiMo-V2.6-Pro - Intelligenz, Leistung & Preisanalyse | Künstliche Analyse

Hacker News •
×

Künstliche Analyse hat den Intelligenz-Index v4.3.2 veröffentlicht, der zehn Bewertungen umfasst einschließlich AA-Briefcase v1.1, GDPval-AA v2.1, Automatisierungs-Benchmark-AA, Terminal-Bench 4.0, Wissenschaftlicher Code, Die letzte Prüfung der Menschheit, GDP.pdf, Kritischer Punkt, AA-Allwissenheit und AA-LCR v1.1. Der aktualisierte Benchmark misst die Modellleistung in agentenbasiertem Wissensarbeit, Codierung und Dokumentenreasoning. Der Intelligenz-Index vergleicht den gewichteten Durchschnittskosten pro Aufgabe in USD mit den Fähigkeitswerten.

Modelle werden basierend auf Lizenzbedingungen als 'Kommerzielle Nutzung eingeschränkt' oder 'Nicht-kommerziell' gekennzeichnet. Der AA-Briefcase v1.1-Benchmark fasst die Rubrik-Bestehensrate, analytische Qualität Elo und Präsentations-Elo zusammen. Der AA-Allwissenheit-Index misst die Zuverlässigkeit von Wissen und Halluzinationen auf einer Skala von -100 bis 100.

Der Offenheitsindex bewertet die Offenheit des Modells von 0 bis 100. Diese standardisierten Metriken ermöglichen einen direkten Vergleich von KI-Fähigkeiten über verschiedene Anwendungsfälle und Preispunkte hinweg.