HeadlinesBriefing favicon HeadlinesBriefing.com

AI 模型在智力测试中表现不佳

MIT Technology Review AI •
×

谜题和游戏自人工智能发展之初就一直是其核心。正如人类喜欢通过十字绣或逻辑谜题测试自己的聪明,开发者可以通过游戏考验来评估模型进步的程度。1959 年,IBM 计算机科学家 Arthur Samuel 在一篇文章中将“机器学习”一词流行起来,他描述了一个能学会下棋的算法。国际象棋和中国象棋等著名的 AI 测试场景也屡见不鲜。

仅凭其解谜能力来看,AI 进步巨大且迅速。2024 年底,来自哥伦比亚大学的科学家团队展示,即使是最佳模型也只能解出 18% 的《纽约时报 Connections 谜题》;到 2025 年初,部分模型已能几乎每次完美解题。但谜题不仅仅用来彰显 AI 能力的无限前进。

当前模型仍显不足:细微的经典谜题变体常常让它们失误,尤其是视觉谜题是其明显弱点。本文给出机会让你在曾让模型困扰的谜题上试试自己的智慧。每个谜题都至少体现了机器与人类认知的不同之处。

空间推理仍是人类拥有巨大优势的领域。当谜题要求判断不同图像是否展示同一物体的不同视角时,尽管当今语言模型通常具备分析视觉输入的能力,它们在空间推理谜题上仍然表现得可怜。尽管人们常说世界模型能帮助 AI 理解物理环境,但大语言模型(LLM)仍无法像空间思维者 — — 如建筑师和机械工程师 — — 一样操控三维物体。

关键实体:公司:IBM | 人物:Vincent Kilbride, Arthur Samuel | 地点:哥伦比亚大学, 《纽约时报》, Google, 伊利诺伊大学乌尔巴纳-尚佩恩分校