HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps: मॉनिटरिंग स्टैक विफलता

Towards Data Science •
×

पारंपरिक MLOps मॉनिटरिंग स्टेटलेस इन्फ्रेंस मानता है जिसमें रन में तुलनीय आउटपुट, सिंगल डिसीजन बाउंड्री, समय पर ग्राउंड ट्रुथ और मानव निरीक्षण होता है। ये धारणाएं तब टूटती हैं जब एजेंट लूप करते हैं और टूल्स कॉल करते हैं। अधिकांश टीमें एडिशन द्वारा माइग्रेट करती हैं — मौजूदा स्टैक पर नए एजेंट स्पैन लेयर करती हैं — ड्रिफ्ट मॉनिटर और रीट्रेनिंग ट्रिगर को अपरिवर्तित छोड़ देती हैं। परिणाम: विफल रन पर हरी ट्रेस। OpenTelemetry के Gen AI सेमेंटिक कन्वेंशन create_agent, invoke_agent, execute_tool, और प्लान स्पैन को परिभाषित करते हैं, जिसमें Langfuse, LangSmith, Arize Phoenix, W&B Weave, और Agent Ops संस्करण जारी करते हैं। हालांकि, विरासत सिग्नल अभी भी झूठे स्वस्थ फायर करते हैं। तुलनीय आउटपुट तब विफल होते हैं जब समान इनपुट दिनों के भीतर अलग परिणाम देते हैं। स्टेटलेस इन्फ्रेंस तब टूटती है जब शुरुआती गलत कदम लूप के माध्यम से कैस्केड करते हैं। सिंगल डिसीजन बाउंड्री एजेंटिक सिस्टम में गायब हो जाती है। ग्राउंड ट्रुथ देरी और मानव-इन-द-लूप धारणाएं ढह जाती हैं। Tau-bench pass^k विश्वसनीयता प्रकट करता है: gpt-4o एक बार में 61% रिटेल टास्क क्लियर करता है, लेकिन 8 प्रयास 25% से कम सफलता देते हैं। मॉनिटरिंग स्टैक हरे रहकर प्रणालीगत मुद्दों को छिपाते हुए विफल होते हैं।