HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps:监控栈为何失效

Towards Data Science •
×

传统 MLOps 监控假设无状态推理,且跨运行输出可比、单一决策边界、及时地面真值和人工监督。当 Agent 循环并调用工具时,这些假设会失效。大多数团队通过叠加迁移——在现有栈上添加新的 Agent span——而保持漂移监控器和重新训练触发器不变。结果:失败运行上显示绿色追踪。OpenTelemetry 的 Gen AI 语义约定定义了 create_agent、invoke_agent、execute_tool 和 plan span,Langfuse、LangSmith、Arize Phoenix、W&B Weave 和 Agent Ops 均发布了相应版本。然而,继承的信号仍会错误地报告健康。当相同输入在几天内产生不同结果时,可比输出失效。当早期失误通过循环级联放大时,无状态推理失效。单一决策边界在 Agent 系统中消失。地面真值延迟和人工介入假设崩塌。Tau-bench 揭示了 pass^k 可靠性:gpt-4o 一次性通过 61% 的零售任务,但 8 次尝试成功率降至 25% 以下。监控栈因保持绿色而掩盖系统性问题而失效。