HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps : Pourquoi la surveillance échoue

Towards Data Science •
×

La surveillance MLOps traditionnelle suppose une inférence sans état avec des sorties comparables entre exécutions, des frontières de décision uniques, une vérité terrain opportune et une supervision humaine. Ces hypothèses s'effondrent lorsque les agents bouclent et appellent des outils. La plupart des équipes migrent par addition — superposant de nouveaux spans d'agent sur les piles existantes — laissant les moniteurs de dérive et les déclencheurs de réentraînement inchangés.

Résultat : traces vertes sur des exécutions échouées. Les conventions sémantiques Gen AI d'OpenTelemetry définissent les spans create_agent, invoke_agent, execute_tool et plan, avec Langfuse, LangSmith, Arize Phoenix, W&B Weave et Agent Ops publiant des versions. Cependant, les signaux hérités déclenchent encore faussement un état sain.

Les sorties comparables échouent lorsque des entrées identiques produisent des résultats différents en quelques jours. L'inférence sans état se brise lorsque les erreurs initiales se propagent en cascade dans les boucles. Les frontières de décision uniques disparaissent dans les systèmes agentiques.

Les délais de vérité terrain et les hypothèses human-in-the-loop s'effondrent. Tau-bench révèle la fiabilité pass^k : gpt-4o réussit 61 % des tâches retail en une fois, mais 8 tentatives donnent moins de 25 % de succès. Les piles de surveillance échouent en restant vertes tout en masquant des problèmes systémiques.