HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps:監視スタックが破綻する理由

Towards Data Science •
×

従来の MLOps 監視は、ステートレス推論で実行間の出力が比較可能、単一の決定境界、タイムリーなグランドトゥルース、人間の監視を前提としています。これらの前提は、エージェントがループしツールを呼び出すと破綻します。ほとんどのチームは追加による移行を行い、既存スタックに新しいエージェントスパンを重ね、ドリフトモニターと再訓練トリガーを変更しません。結果:失敗した実行でグリーントレースが表示されます。OpenTelemetry の Gen AI セマンティック規約は create_agent、invoke_agent、execute_tool、plan スパンを定義し、Langfuse、LangSmith、Arize Phoenix、W&B Weave、Agent Ops がバージョンを提供しています。しかし、継承されたシグナルは依然として誤って健全と報告します。同一入力が数日で異なる結果を出すと比較可能な出力が破綻します。初期の誤ステップがループを通じてカスケードするとステートレス推論が破綻します。単一の決定境界はエージェントシステムで消失します。グランドトゥルースの遅延とヒューマンインザループ前提が崩壊します。Tau-bench は pass^k 信頼性を明らかにします:gpt-4o は小売タスクの 61% を 1 回でクリアしますが、8 回試行で成功率は 25% 未満に低下します。監視スタックはグリーンのままシステム的問題を隠蔽することで機能不全に陥ります。