HeadlinesBriefing favicon HeadlinesBriefing.com

MiMo-V2.6-Pro - Анализ интеллекта, производительности и цены | Искусственный анализ

Hacker News •
×

Искусственный анализ выпустил Индекс интеллекта v4.3.2, включающий десять оценок включая AA-Briefcase v1.1, GDPval-AA v2.1, Бенчмарк автоматизации-AA, Терминал-Бенч 4.0, Научный код, Последний экзамен человечества, GDP.pdf, Критическая точка, AA-Всезнание и AA-LCR v1.1. Обновленный бенчмарк измеряет производительность моделей в агентной работе с знаниями, программировании и рассуждении с документами. Индекс интеллекта сравнивает средневзвешенную стоимость за задачу в долларах США с баллами способности. Модели помечаются как 'Коммерческое использование ограничено' или 'Некоммерческое' в зависимости от условий лицензирования. Бенчмарк AA-Briefcase v1.1 объединяет проходной показатель по рубрике, аналитическое качество Elo и презентационное Elo. Индекс AA-Всезнание измеряет надежность знаний и галлюцинации по шкале от -100 до 100. Индекс открытости оценивает открытость модели от 0 до 100. Эти стандартизированные метрики позволяют напрямую сравнивать возможности ИИ в различных сценариях использования и ценовых точках.