HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash 智能性能价格分析

Hacker News •
×

Artificial Analysis 推出 GLM-5.3-Flash 模型分析。Artificial Analysis 智能指数 v4.1.1 包含 9 项评估:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、Sci Code、Humanity's Last Exam、GPQA Diamond、Crit Pt、AA-Omniscience、AA-LCR。推理模型以灯泡图标标示。

智能指数包含这些评估,方法论细节可查阅。若商业使用受限,模型标记为“商业使用受限”;若许可证禁止商业使用,则标记为“非商业”。智能评估由 Artificial Analysis 独立测量,分数越高越好。

AA-Omniscience 指数衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对拒绝回答不设惩罚。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相当,负分表示错误答案多于正确答案。

比较包括智能指数与每任务成本,使用输入、缓存命中、缓存写入、推理和答案 token 价格的加权平均成本。Token 使用量按每个智能指数任务的输出 token 数衡量,通过将每个评估的输出 token 数乘以基准权重计算。

关键实体:公司:Artificial Analysis