HeadlinesBriefing favicon HeadlinesBriefing.com

Анализ индекса интеллекта ИИ v4.3

Hacker News •
×

Индекс интеллекта ИИ v4.3 от Artificial Analysis включает 10 оценок: AA-Briefcase, GDPval-AA v2, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. См. методологию индекса интеллекта для получения дополнительной информации, включая разбивку на каждую оценку и то, как мы их проводим.

Указывает, доступны ли веса модели. Модели помечаются как "Коммерческое использование ограничено", если коммерческое использование ограничено условиями, и как "Некоммерческое", если лицензия запрещает коммерческое использование.

Индексы возможностей измеряют производительность моделей на конкретных возможностях и отраслях.

Оценки интеллекта измеряются независимо Artificial Analysis · Чем выше, тем лучше.

Агентное кодирование и использование терминала Профессиональное рассуждение по документам Все пройдены медицинский долгий контекст рассуждения В то время как интеллект модели обычно переводится между случаями использования, конкретные оценки могут быть более релевантны для определенных случаев использования.

AA-Briefcase Elo — это комбинируемая метрика, которая агрегирует процент прохождения рубрики, аналитическое качество Elo и презентационный Elo. Elo и границы 95% доверительного интервала ограничены 0.

Индекс AA-Omniscience (чем выше, тем лучше) измеряет надежность знаний и галлюцинации. Он вознаграждает правильные ответы, наказывает галлюцинации и не налагает штраф за отказ ответить. Оценки находятся в диапазоне от -100 до 100.

Ключевые сущности: Компании: Artificial Analysis