HeadlinesBriefing favicon HeadlinesBriefing.com

Claude Opus 5.5 分析:智能、性能与价格

Hacker News •
×

Artificial Analysis 智能指数 v4.3.2 包含 10 项评估:AA-Briefcase v1.1、GDPval-AA v2.1、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括每项评估的细分以及我们如何运行它们,请参阅智能指数方法论。

AA-Briefcase v1.1 是由 Artificial Analysis 开发的代理式知识工作基准测试。AA-Briefcase Elo 是一项综合指标,汇总了评分标准通过率、分析质量 Elo 和演示 Elo · 越高越好。AA-Omniscience 指数衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,并且对拒绝回答不施加惩罚。分数范围为 -100 到 100,其中 0 表示正确答案与错误答案数量相同。

智能指数比较:智能指数 vs. 每项智能指数任务成本。每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和答案 token 价格计算,除以任务数量,并按其智能指数权重加权。

关键实体:公司:Artificial Analysis

FAQ:什么是 Artificial Analysis 智能指数?

Artificial Analysis 智能指数 v4.3.2 包含 10 项评估:AA-Briefcase v1.1、GDPval-AA v2.1、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。

FAQ 问:什么是 Artificial Analysis 智能指数?

FAQ 答:Artificial Analysis 智能指数 v4.3.2 包含 10 项评估:AA-Briefcase v1.1、GDPval-AA v2.1、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。