HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps: Por qué falla el monitoreo

Towards Data Science •
×

El monitoreo tradicional de MLOps asume inferencia sin estado con salidas comparables entre ejecuciones, límites de decisión únicos, verdad fundamental oportuna y supervisión humana. Estos supuestos se rompen cuando los agentes buclan y llaman herramientas. La mayoría de los equipos migran por adición —añadiendo nuevos spans de agente a las pilas existentes— dejando monitores de deriva y disparadores de reentrenamiento sin cambios.

El resultado: trazas verdes en ejecuciones fallidas. Las convenciones semánticas Gen AI de OpenTelemetry definen spans create_agent, invoke_agent, execute_tool y plan, con Langfuse, LangSmith, Arize Phoenix, W&B Weave y Agent Ops emitiendo versiones. Sin embargo, las señales heredadas aún disparan falsamente como saludables.

Las salidas comparables fallan cuando entradas idénticas producen resultados diferentes en días. La inferencia sin estado se rompe cuando los errores tempranos se cascada a través de bucles. Los límites de decisión únicos desaparecen en sistemas agenticos.

Los retrasos de verdad fundamental y los supuestos de humano en el bucle colapsan. Tau-bench revela fiabilidad pass^k: gpt-4o supera el 61% de tareas minoristas una vez, pero 8 intentos rinden menos del 25% de éxito. Las pilas de monitoreo fallan al permanecer verdes mientras enmascaran problemas sistémicos.