HeadlinesBriefing favicon HeadlinesBriefing.com

消费者推理系统:移动 AI 基准测试

Hacker News •
×

Artificial Analysis 发布 消费者推理系统 基准测试,评估 AI 模型在移动硬件上的性能,具体是 iPhone 17 Pro。该研究使用五项评估的简单平均值 — — BFCL(子集)、IFBenchAA-OmniscienceGPQA DiamondMATH-500 — — 选取以代表真实世界移动设备使用。上下文限制为 16K tokens 最大。

智能得分衡量模型在工具调用、指令遵循、知识准确性、非幻觉率、科学推理和定量推理方面的能力。得分越高表示性能越好。

端到端生成时间追踪处理 1,024-token 提示 并生成 256-token 响应 的总墙钟秒数。时间越短越好。结果反映基本硬件和架构限制,不包括冗长效应。

令牌效率追踪上下文预算超限 — — 生成在达到 16K-token 限制时停止而不是完成。对于设备过大或超过时间限制的模型将从性能测量中排除。

关键实体:公司:Artificial Analysis