जब पहली बार मैंने कोडिंग एजेंट का इस्तेमाल किया, तो मैं मंत्रमुग्ध हो गया। एजेंट से पहले, मैं अपने IDE और एक AI चैट इंटरफ़ेस के बीच कॉपी-पेस्ट करता था। किसी एजेंट को सीधे फ़ाइलें बदलते और रीयल टाइम में अपनी गलतियाँ सुधारते देखना अद्भुत था। कुछ दिनों बाद, यह उत्साह ठंडा पड़ गया, क्योंकि बार-बार बग आने लगे। एजेंट मेरे उसे दोबारा शुरू करने तक पूरी तरह प्रतिक्रिया देना बंद कर देता था, और अक्सर कार्य तब पूरा घोषित कर देता था जब काम मुश्किल से शुरू हुआ होता था।
मुझे लगा था कि छह महीने में एजेंट तकनीकी रूप से उतने ही प्रभावशाली हो जाएँगे जितने उनके अंतर्निहित LLM हैं। इसके बजाय, कोडिंग एजेंट खराब ही बने रहे। AI-सहायता प्राप्त विकास स्पष्ट रूप से आगे बढ़ा है, लेकिन भारी काम मॉडल कर रहे हैं जबकि एजेंट बाधा बने हुए हैं। यह अंतर मायने रखता है: मॉडल, जैसे GPT Astra, Claude Sonnet या GLM-5.3, टेक्स्ट और कोड तैयार करता है, जबकि एजेंट, जैसे Anthropic का Claude Code या OpenAI का Codex, वह सॉफ़्टवेयर है जो उस मॉडल को कोडबेस और कंप्यूटर सिस्टम से जोड़ता है। जैसा कि एक उपमा कहती है, मॉडल दिमाग है और एजेंट शरीर।
सबसे बड़ी शिकायत यह है कि एजेंट कार्यों का प्रबंधन कितनी खराब तरह से करते हैं। एक उदाहरण में, एक ओपन-सोर्स वेब ऐप में लगभग 1.5k लाइन का पासफ़्रेज़-सुरक्षा फ़ीचर जोड़ा जाना था। एजेंट ने काम को 10 उपकार्यों में बाँटा और फिर उन्हें एक-एक करके चलाया, जबकि उन्हें मल्टीटास्किंग के लिए बने कंप्यूटर पर समानांतर रूप से चलाया जा सकता था। Claude Code बहुत कम मल्टीटास्किंग करता है, आगे बढ़ने से पहले सब-एजेंट और एंड-टू-एंड टेस्ट पूरे होने का इंतज़ार करता है।
एजेंट कार्य को अच्छी तरह सौंप भी नहीं पाते। एक अत्याधुनिक मॉडल 50k लाइन कोड में किसी पैटर्न को खोजने में समय लगा सकता है, जबकि एक सस्ता और तेज़ मॉडल यह काम संभाल सकता था। एजेंट कभी मॉडल बदलने का सुझाव नहीं देता, जिससे उपयोगकर्ताओं को मॉडल चुनाव खुद बारीकी से संभालना पड़ता है, और लेखक का मानना है कि यह काम एक LLM कर सकता है।
स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित