HeadlinesBriefing favicon HeadlinesBriefing.com

水星 2.5 智能、性能与价格分析

Hacker News •
×

人工分析智能指数 v4.3.2 包含 10 项评估:AA-Briefcase v1.1,GDPval-AA v2.1,自动化基准-AA,终端基准 4.0,科学代码,人类最后考试,GDP.pdf,临界点,AA-全知,AA-LCR v1.1。该指数衡量开放权重与专有模型,并标注商业使用限制。AA-Briefcase v1.1 是一种结合通过率、分析质量 Elo 和展示质量 Elo 的代理性知识工作基准。AA-全知指数得分范围为 -100 到 100,衡量知识可靠性和幻觉,拒绝回答不受惩罚。每项智能任务的成本指数计算方式为:输入、缓存命中、缓存写入、推理和答案令牌价格的加权平均美元成本除以任务数量。模型智能通常可跨用例迁移,尽管特定评估可能对某些应用更相关。方法论包括每项评估的细分及其运行方式。