HeadlinesBriefing favicon HeadlinesBriefing.com

AgentOps vs MLOps: মনিটরিং স্ট্যাক ব্যর্থতা

Towards Data Science •
×

পারম্পরিক MLOps মনিটরিং স্টেটলেস ইনফারেন্স অনুমান করে যেখানে রান জুড়ে তুলনাযোগ্য আউটপুট, একক সিদ্ধান্ত সীমা, সময়মতো গ্রাউন্ড ট্রুথ এবং মানব পর্যবেক্ষণ থাকে। এই অনুমানগুলি টूटে যায় যখন এজেন্টরা লুপ করে এবং টুল কল করে। অধিকাংশ টিম যোগ করে মাইগ্রেট করে — বিদ্যমান স্ট্যাকের উপরে নতুন এজেন্ট স্প্যান লেয়ার করে — ড্রিফ্ট মনিটর এবং রি-ট্রেনিং ট্রিগার অপরিবর্তিত রেখে দেয়। ফলাফল: ব্যর্থ রানে সবুজ ট্রেস। OpenTelemetry-এর Gen AI সিম্যান্টিক কনভেনশন create_agent, invoke_agent, execute_tool, এবং plan স্প্যান সংজ্ঞায়িত করে, যেখানে Langfuse, LangSmith, Arize Phoenix, W&B Weave, এবং Agent Ops সংস্করণ প্রকাশ করে। যাইহোক, উত্তরাধিকার সিগন্যালগুলি এখনও মিথ্যা স্বাস্থ্যকর ফায়ার করে। তুলনাযোগ্য আউটপুট ব্যর্থ হয় যখন একই ইনপুট দিনের মধ্যে ভিন্ন ফলাফল দেয়। স্টেটলেস ইনফারেন্স টूटে যায় যখন প্রাথমিক ভুল ধাপ লুপের মাধ্যমে ক্যাসকেড করে। একক সিদ্ধান্ত সীমা এজেন্টিক সিস্টেমে অদৃশ্য হয়ে যায়। গ্রাউন্ড ট্রুথ বিলম্ব এবং হিউম্যান-ইন-দ-লুপ অনুমান ধ্বংস হয়। Tau-bench pass^k নির্ভরযোগ্যতা প্রকাশ করে: gpt-4o একবারেই ৬১% রিটেল টাস্ক ক্লিয়ার করে, কিন্তু ৮বার চেষ্টা ২৫% এর নিচে সাফল্য দেয়। মনিটরিং স্ট্যাক সবুজ থাকাই সিস্টেমিক সমস্যাগুলো লুকিয়ে রাখে।