HeadlinesBriefing favicon HeadlinesBriefing.com

AI模型《星际争霸》测试:Codex Astra领先

Hacker News •
×

Brood War Bench在《星际争霸:母巢之战》中测试了AI模型。没有模型能超越新手水平。Codex Astra是明显的领导者,持续击败所有其他模型。Grok模型尚不够聪明,无法进行游戏。

旧模型将RTS视为回合制,在思考时被摧毁。新模型更清楚思考成本,尽管某些低投入设置表现更好。

Codex最强的反复思路是骚扰,派遣探针攻击工人。它经常为经济、军队生产和控制创建独立的子代理,但它们之间沟通不畅。Grok 4.6花费大量时间推理,却发出极少指令批次——一次运行记录了11,138个token,但在43分钟内仅发出六批指令,且没有任何作战单位。

Claude Fable认真尝试游戏,建立经济并攀登科技树。它达到了飞龙、巢穴、尖塔和高级科技建筑,并在一些游戏中获胜。

关键实体:公司:OpenAI、Anthropic、xAI