HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps: سبب فشل مكدس المراقبة

Towards Data Science •
×

تفترض مراقبة MLOps التقليدية الاستدلال بدون حالة مع مخرجات قابلة للمقارنة عبر العمليات، وحدود قرار فردية، والحقيقة الأساسية في الوقت المناسب، والإشراف البشري. تنكسر هذه الافتراضات عندما تدور الوكلاء وتستدعي الأدوات. تهاجر معظم الفرق بالإضافة — وضع نطاقات الوكلاء الجدد فوق المكدسات الحالية — تاركة أجهزة مراقبة الانجراف ومحفزات إعادة التدريب دون تغيير. النتيجة: آثار خضراء على عمليات فاشلة. تحدد اتفاقيات OpenTelemetry الدلالية لـ Gen AI نطاقات create_agent، و invoke_agent، و execute_tool، و plan، مع إصدار Langfuse، و LangSmith، و Arize Phoenix، و W&B Weave، و Agent Ops للإصدارات. ومع ذلك، لا تزال الإشارات الموروثة تطلق إنذارات كاذبة بالصحة. تفشل المخرجات القابلة للمقارنة عندما تنتج مدخلات متطابقة نتائج مختلفة خلال أيام. ينكسر الاستدلال بدون حالة عندما تتعثر الأخطاء المبكرة عبر الحلقات. تختفي حدود القرار الفردية في الأنظمة الوكيلة. تنهار تأخيرات الحقيقة الأساسية وافتراضات الإنسان في الحلقة. يكشف Tau-bench عن موثوقية pass^k: يجتاز gpt-4o 61% من مهام التجزئة مرة واحدة، لكن 8 محاولات تحقق أقل من 25% نجاح. تفشل مكدسات المراقبة بالبقاء خضراء بينما تخفي المشكلات المنهجية.