HeadlinesBriefing favicon HeadlinesBriefing.com

Анализ Claude Opus 5.5: интеллект, производительность и цена

Hacker News •
×

Индекс интеллекта v4.3.2 от Artificial Analysis включает 10 оценок: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Подробнее см. методологию Индекса интеллекта, включая разбивку каждой оценки и то, как мы их проводим.

AA-Briefcase v1.1 — это агентный бенчмарк интеллектуальной работы, разработанный Artificial Analysis. AA-Briefcase Elo — это комбинированная метрика, объединяющая процент прохождения рубрик, Elo аналитического качества и Elo презентации · Чем выше, тем лучше. Индекс AA-Omniscience измеряет надёжность знаний и галлюцинации. Он вознаграждает правильные ответы, наказывает за галлюцинации и не имеет штрафа за отказ отвечать. Оценки варьируются от -100 до 100, где 0 означает столько же правильных, сколько и неправильных ответов.

Сравнения Индекса интеллекта: Индекс интеллекта против стоимости за задачу Индекса интеллекта. Взвешенная средняя стоимость за задачу Индекса интеллекта. Стоимость каждой оценки рассчитывается из цен на входные токены, попадание в кэш, запись в кэш, рассуждение и ответ, делится на количество задач и взвешивается по её весу в Индексе интеллекта.

Ключевые сущности: Компании: Artificial Analysis