HeadlinesBriefing favicon HeadlinesBriefing.com

Анализ интеллекта, производительности и цены Меркурия 2.5

Hacker News •
×

Индекс интеллекта искусственного анализа v4.3.2 включает 10 оценок: AA-Брифкейс v1.1, GDPval-AA v2.1, Бенчмарк автоматизации-AA, Терминал-Бенч 4.0, Научный код, Последний экзамен человечества, GDP.pdf, Критическая точка, AA-Всезнание, AA-LCR v1.1. Индекс измеряет открытые веса по сравнению с проприетарными моделями, с метками для ограничений коммерческого использования. AA-Брифкейс v1.1 — это бенчмарк агентной работы с знаниями, объединяющий процент прохождения рубрики, аналитическое качество Эло и качество презентации Эло. Оценки индекса AA-Всезнание варьируются от -100 до 100, измеряя надежность знаний и галлюцинации без штрафа за отказ. Индекс стоимости задачи интеллекта рассчитывает средневзвешенную стоимость в USD от ввода, попадания в кэш, записи в кэш, рассуждений и цены токенов ответа, деленную на количество задач. Интеллект модели обычно переносится между случаями использования, хотя определенные оценки могут быть более релевантны для определенных приложений. Методология включает разбивку каждой оценки и того, как они выполняются.