HeadlinesBriefing favicon HeadlinesBriefing.com

Intelligence Index v4.2 выпущен

Hacker News •
×

Artificial Analysis выпустила Intelligence Index v4.2, это промежуточное обновление, ускоряющее элементы запланированного выпуска v5, чтобы сохранить темпы с быстрыми достижениями передовых моделей. Обновление вводит более сложные и реалистичные задачи, и увеличивает закрытые частные тестовые наборы до 40% от веса Index — вдвое больше, чем в v4.1 — чтобы предотвратить накрутку. Добавлены два ключевых оценивания: AA-Briefcase, внутренний эталон знаний на основе агентов с частными тестовыми наборами, проверяющими мненедельные проекты по тысячам исходных файлов, и GDP.pdf от Surge AI, оценивающий рассуждение о длинных документах по 4 592 страницам PDF с 1 275 атомарными критериями, созданными экспертами. Улучшения инфраструктуры оценивания включают повышенную точность оценки в AA-LCR v1.1, стабилизированные рейтинги Elo для GDPval-AA v2 и AA-Briefcase, и более надёжные песочницы для Sci Code. Ключевые результаты показывают, что Claude Fable 5.1 от Anthropic лидирует в Index, за ним следует GPT-6 Astra от Open AI, набрав 4 пункта больше, чем GPT-5.6 Sol. Meta занимает третье место, за ней следуют Space XAI, Moonshot/Kimi, Z.AI и Google. Парето-граница стоимости задачи разделена между Anthropic, Open AI, Meta и Z.AI, в то время как GPT-6 Astra доминирует на границе эффективности выходных токенов близко к границе интеллекта.