HeadlinesBriefing favicon HeadlinesBriefing.com

AIモデルがインテリジェンステストで失敗

MIT Technology Review AI •
×

パズルとゲームはAI開発の始まりから中心的役割を果たしてきました。人間が十字謎やロジックパズルで知性を試すのと同じように、開発者はゲームの難関を通じてモデルの進歩を評価できます。1959年にIBMのコンピューター科学者アーサー・サミュエルが「機械学習」という用語を広めた記事では、チェスを学習するアルゴリズムが紹介されています。チェスと中国のボードゲームゴも有名なAIテストベッドです。

パズルの腕前だけで見ると、AIは大きく進歩し、速くなっています。2024年末、コロンビア大学の研究チームは、最良のモデルでさえニューヨークタイムズのConnections謎を18%しか解けないことを示しました。2025年初め、一部のモデルはほぼ完璧に解くことができるようになりました。しかしパズルはAIの能力の無限の進歩を示すだけに留まらず、

現代のモデルはまだつまずきます:微妙な変更のあるクラシックな謎がしばしば彼らを混乱させ、ビジュアルパズルは特に弱点です。ここでは、かつてモデルを悩ませてきたパズルに挑戦できるチャンスがあります。各パズルは、機械と人間の認知の違いを示す少なくとも1つの点を強調します。

空間的推論は依然として人間が大きな優位を持つ分野です。パズルが異なる角度から同じ物体を示すかどうか判断させる場合、現代の言語モデルは視覚入力を分析できる能力を持っていますが、空間推論パズルでは悲惨に失敗します。世界モデルがAIに物理環境を理解させるという話はたくさんありますが、LLMは建築家や機械エンジニアのような空間思考者が3Dオブジェクトを操作するのと同じようには動作しません。

主要実体:企業:IBM | 人物:Vincent Kilbride, Arthur Samuel | 場所:コロンビア大学, ニューヨークタイムズ, Google, イリノイ大学アーバナ・チャンパン校