HeadlinesBriefing HeadlinesBriefing.com

Jevman:吃豆人决策模型基准测试

Hacker News •
×

OpenAI 刚刚推出了其决策端点,Cloudflare 近期也发布了 Clef,而且还有更多 jev 替代方案陆续问世。为了比较这些热门选项,Opper AI 团队决定用吃豆人来测试它们,这是一个衡量快速决策能力的简单基准。

团队让 jev 1.13、kev、clef、clef flash、GPT-6 Luna 和 Laya 与经典机器人幽灵进行吃豆人对战。这些模型的低延迟使实时游戏成为可能。每个模型进行了 100 场游戏,结果发布在排行榜上。该代码仓库是开源的,因此任何人都可以运行自己的模型并加入排名。

每局游戏大约花费 2 美分,所有模型均通过该团队的初创公司 Opper 运行。访客也可以亲自扮演吃豆人,幽灵则由多个模型组合或由单一模型(如 jev)控制。我们还提供了免费额度,供所有人体验。

任何部署在 HTTP 端点后的模型都可以参与,无论是托管模型、微调模型还是运行在笔记本电脑上的模型。每局游戏都会被记录并可精确回放,因此结果可以验证。分数采用均值并给出 95% 的误差范围,当前领先者 jev 1.13 保持着最高分纪录。团队正在征求社区的反馈意见。

来源: Hacker News · 由HeadlinesBriefing整理摘要