HeadlinesBriefing favicon HeadlinesBriefing.com

Pac-Bench:一次性 Pac-Man 模型基准测试

Hacker News •
×

Hacker News 用户 jonclegg 启动了 Pac-Bench,以评估 AI 模型在单个提示下生成可玩 Pac-Man 克隆版的效果。该挑战要求模型在一次尝试中创建一个完整的 HTML 页面,不允许使用后续提示或修正。结果显示性能差异显著,有些模型能够生成功能性游戏,而另一些模型则在基本机制上遇到困难。该基准测试追踪成功率、代码效率和对严格一次性约束的遵守情况,提供对当前 AI 编码能力的洞察。组织者收集了有关标记使用量、生成时间和 HTML 输出大小的数据,以衡量实际可行性。项目页面托管了各个模型的尝试和详细指标,供社区分析。