HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps: Почему сбой мониторинга

Towards Data Science •
×

Традиционный мониторинг MLOps предполагает бесстостоянный вывод с сравнимыми результатами между запусками, едиными границами принятия решений, своевременной истиной и человеческим надзором. Эти предположения ломаются, когда агенты зацикливаются и вызывают инструменты. Большинство команд мигрируют путем добавления — накладывая новые спаны агентов на существующие стеки — оставляя мониторы дрифта и триггеры переобучения неизменными. Результат: зеленые трассы на неудачных запусках. Семантические соглашения Gen AI OpenTelemetry определяют спаны create_agent, invoke_agent, execute_tool и plan, с Langfuse, LangSmith, Arize Phoenix, W&B Weave и Agent Ops выпускающими версии. Однако унаследованные сигналы по-прежнему ложно срабатывают как здоровые. Сравнимые выходы ломаются, когда идентичные входы дают разные результаты в течение дней. Бесстостоянный вывод ломается, когда ранние ошибки каскадируются через циклы. Единые границы решений исчезают в агентских системах. Задержки истины и предположения human-in-the-loop рушатся. Tau-bench раскрывает надежность pass^k: gpt-4o проходит 61% розничных задач за раз, но 8 попыток дают менее 25% успеха. Стеки мониторинга терпят неудачу, оставаясь зелеными, пока маскируют системные проблемы.