HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra、ループ型トランスフォーマー、隠された推論

Hacker News •
×

ここ数週間で多くのことが起こりました。Open AIのGPT-6 Astraが今、誰の心にも一番にあることは間違いありません。特に、その性能、ループ型トランスフォーマー/再帰的深さの側面、そしてAstraが推論トレース(つまり思考連鎖)を「隠している」という噂についての考えです。そこで、この記事では、まずAstraについての簡単な印象と、これがどこに向かっているのかについてのいくつかの考えから始めたいと思います。次に、「ループ型トランスフォーマー」とは何か、そしてそれが思考連鎖を隠すこととどのように(あるいはむしろ、もし)関連するのかについて詳しく説明します。最後に、ループ型トランスフォーマーの基本を説明した後、このトピックに関する最近の研究論文からのいくつかの新しい洞察を強調したいと思います。

まず最初に。アーキテクチャの噂や関連する研究文献に入る前に、GPT-6 Astraに関するいくつかの観察と小話を簡単に要約させてください。先週、Open AIの新しいGPT-6 Astraが大きな宣伝とともにリリースされました。私はここ数日それを使用しましたが、それは非常に優れたモデルであり、おそらくこの記事を書いている時点で私が使用した中で最高のものです。しかし、具体的に何が改善されたのでしょうか、そしてどのように?Astraは私がこれまでに使用した中で最高のモデルであり、3Dレンダリングとアニメーションタスク(他のモデルと比較して)に不釣り合いに優れています。つまり、それはGPT-5.6の前身を実質的にすべてのカテゴリ(ライティング、数学、コーディングなど)で飛び越えますが、特にグラフィカルなデモに関してはその傾向が強いです。これはベンチマークにも反映されています。例えば、GPT-6 Astraは数学とコーディングに非常に優れており、以下に示すとおりです。ハイライトの1つ(図には示されていません)は、AstraがARC-AGI-3ベンチマークで99.9%を達成していることです(GPT-5.6 Solはわずか7.8%)。これは論理パズルの解決と一般化の混合を測定します。しかし、数学、コーディング、コンピュータ使用のベンチマークは、実際の使用に近いため、より興味深いものです。

Artificial Analysisコーディングエージェントインデックスv1.4(前の図の右下)に戻ると、これはいくつかのエージェントコーディングタスクをブレンドしたもので、GPT-6 Astraは明らかにフロンティアにありますが、飛躍的に先を行くわけではありません。これは、以下に示す一般的なArtificial Analysisインテリジェンスインデックスにも見られます。これはコーディングタスクだけでなく、さまざまなタイプのタスクをブレンドしています。さて、Artificial Analysisベンチマークの大きな利点は、それらが独立しているため、モデル開発者による自己評価ベンチマークよりも少し信頼できる可能性があることです。ハーネスのセットアップはベンチマークによって異なります。例えば、GDPval-AAとAA-Briefcaseは、比較するさまざまなLLMにわたって、オープンソースの最小限のStirrupハーネスを使用します。上記のインテリジェンスインデックスv4.2では、Terminal-Bench v2.1はTerminus 2を使用し、τ³-Bankingはτ-Benchハーネスを使用します。別のコーディングエージェントインデックスも、さまざまなコーディングエージェントハーネスを比較しています。共有ハーネスを使用する評価では、これはよりアップルツーアップルの比較になります。同時に、モデルトレーニング中、モデルは通常、1つの主要なハーネスを念頭に置いて開発され(他のハーネスではあまりファインチューニングされません)。さらに、主要なハーネスは、モデルの強みに適合し、増幅するように開発されることがよくあります。したがって、一部のエージェント評価は、Astraが主要なハーネスでどれだけうまく機能するかを過小評価する可能性があります。これがインテリジェンスインデックスのスコアにどれだけ影響するかは、同じタスクでハーネス間でAstraを比較してテストする必要があります。余談ですが、同僚が最近私に提案したように(Claude Codeリードも推奨)、既存のAGENTS.mdコンテンツとSKILL.mdファイルの一部を削除(/アーカイブ)することは悪い考えではないかもしれません。新しいLLMはプロンプトを理解し、目前の問題を解決するのにより効率的になっているからです。余分な手取り足取りは、新しいモデルを不必要に制限し、より悪い解決策につながる可能性があります。もちろん、SKILL.mdファイルを二度と使用しないことを提案しているわけではありませんが、一部のワークフローでは、再利用時に効率を向上させることができるため、もし...