HeadlinesBriefing HeadlinesBriefing 12 languages

Why Are Coding Agents So Dumb?

Hacker News ·

🇬🇧 English

The first time I used a coding agent, I was mesmerized. Before the agent, I was copy/pasting between my IDE and an AI chat interface. Watching an agent edit files directly and fix its own errors in real time was amazing. After a few days, the honeymoon wore off as I encountered frequent bugs. The agent would stop responding entirely until I restarted it, and it would often declare tasks finished when work had barely begun.

I figured that in six months, agents would be as technically impressive as the underlying LLMs. Instead, coding agents just stayed bad. AI-assisted development has clearly advanced, but the models are doing the heavy lifting while the agents remain the bottleneck. The distinction matters: the model, such as GPT Astra, Claude Sonnet, or GLM-5.3, generates the text and code, while the agent, such as Anthropic's Claude Code or OpenAI's Codex, is the software that connects that model to codebases and computer systems. As one analogy puts it, the model is the brain and the agent is the body.

The biggest complaint is how poorly agents manage tasks. In one example, an open-source web app received a passphrase-protection feature of about 1.5k lines. The agent broke the work into 10 subtasks and then ran them one at a time, even though they could have run in parallel on a computer built for multitasking. Claude Code multitasks only a little, waiting for subagents and end-to-end tests to finish before moving on.

Agents also cannot delegate well. A cutting-edge model may spend its time scanning 50k lines of code for a pattern that a cheaper, faster model could handle. The agent never suggests switching models, forcing users to micromanage model choices themselves, a job the author argues an LLM could do.

View original article →


🇸🇦 العربية

لماذا وكلاء البرمجة غبيون إلى هذا الحد؟

عندما استخدمت وكيل برمجة للمرة الأولى، أُعجبت به كثيرًا. قبل الوكيل، كنت أنسخ وألصق بين بيئة التطوير المتكاملة وواجهة الدردشة بالذكاء الاصطناعي. كان من المدهش أن أرى وكيلًا يعدّل الملفات مباشرة ويصحح أخطاءه بنفسه في الوقت الفعلي. وبعد بضعة أيام، تلاشت فترة الانبهار عندما صادفت أخطاءً متكررة. كان الوكيل يتوقف عن الاستجابة تمامًا حتى أعيد تشغيله، وكان كثيرًا ما يعلن انتهاء المهام بينما بالكاد بدأ العمل فيها.

كنت أعتقد أنه بعد ستة أشهر ستصبح الوكلاء مبهرة تقنيًا بقدر النماذج اللغوية الكبيرة التي تعمل بداخلها. لكن وكلاء البرمجة ظلوا ضعفاء. لقد تقدم التطوير المدعوم بالذكاء الاصطناعي بوضوح، لكن النماذج هي التي تتحمل العبء الأكبر، بينما يظل الوكلاء عنق الزجاجة. والفرق مهم: فالنموذج، مثل GPT Astra أو Claude Sonnet أو GLM-5.3، يولّد النص والشيفرة، أما الوكيل، مثل Claude Code من Anthropic أو Codex من OpenAI، فهو البرنامج الذي يربط ذلك النموذج بقواعد الشيفرة وأنظمة الحاسوب. وكما تقول إحدى المقارنات، فالنموذج هو الدماغ والوكيل هو الجسد.

أكبر الشكاوى تتعلق بسوء إدارة الوكلاء للمهام. في أحد الأمثلة، احتاج تطبيق ويب مفتوح المصدر إلى ميزة حماية بكلمة مرور تبلغ نحو 1.5 ألف سطر. قسّم الوكيل العمل إلى 10 مهام فرعية ثم نفذها واحدة تلو الأخرى، رغم أنه كان يمكن تشغيلها بالتوازي على حاسوب مصمم للتعدد في المهام. يؤدي Claude Code قدرًا قليلًا من تعدد المهام فقط، إذ ينتظر انتهاء الوكلاء الفرعيين واختبارات الطرف إلى الطرف قبل أن يتابع.

كما أن الوكلاء لا يحسنون التفويض. فقد يقضي نموذج متطور وقته في فحص 50 ألف سطر من الشيفرة بحثًا عن نمط معين، بينما كان بإمكان نموذج أرخص وأسرع معالجته. لا يقترح الوكيل أبدًا التبديل إلى نموذج آخر، فيضطر المستخدمون إلى إدارة اختيار النموذج بأنفسهم بتفصيل دقيق، وهي مهمة يرى الكاتب أن نموذجًا لغويًا كبيرًا يمكنه القيام بها.

لماذا تقل كفاءة وكلاء البرمجة عن النماذج التي يستخدمونها؟

يولّد النموذج النص والشيفرة، لكن الوكيل يربطها بالملفات والأوامر. ولأن الوكلاء الحاليين يتعاملون بضعف مع إدارة المهام والتنفيذ المتوازي والتفويض، فإنهم يصبحون عنق الزجاجة حتى مع تحسن النماذج الأساسية.

العربية version →


🇧🇩 বাংলা

কোডিং এজেন্টগুলো এত বোকা কেন?

প্রথমবার যখন আমি একটি কোডিং এজেন্ট ব্যবহার করি, তখন আমি মুগ্ধ হয়ে যাই। এজেন্টের আগে, আমি আমার IDE এবং একটি AI চ্যাট ইন্টারফেসের মধ্যে কপি-পেস্ট করতাম। একটি এজেন্টকে সরাসরি ফাইল সম্পাদনা করতে এবং রিয়েল টাইমে নিজের ভুল ঠিক করতে দেখা ছিল অসাধারণ। কয়েক দিন পর মুগ্ধতা কেটে যায়, কারণ ঘন ঘন বাগ দেখা দিতে থাকে। এজেন্ট আমি পুনরায় চালু না করা পর্যন্ত একেবারে সাড়া দেওয়া বন্ধ করে দিত, এবং প্রায়ই কাজ সবে শুরু হলেও সেটি শেষ হয়েছে বলে ঘোষণা করত।

আমার ধারণা ছিল যে ছয় মাসের মধ্যে এজেন্টগুলো প্রযুক্তিগতভাবে ততটাই চমকপ্রদ হবে যতটা তাদের অন্তর্নিহিত LLM গুলো। কিন্তু বাস্তবে কোডিং এজেন্টগুলো খারাপই রয়ে গেছে। AI-সহায়তায় উন্নয়ন স্পষ্টভাবে এগিয়েছে, কিন্তু ভারী কাজটি করছে মডেলগুলো, আর এজেন্টগুলো এখনও বাধা হয়ে আছে। এই পার্থক্যটি গুরুত্বপূর্ণ: GPT Astra, Claude Sonnet বা GLM-5.3-এর মতো মডেল টেক্সট ও কোড তৈরি করে, আর Anthropic-এর Claude Code বা OpenAI-এর Codex-এর মতো এজেন্ট হলো সেই সফটওয়্যার যা মডেলটিকে কোডবেস ও কম্পিউটার সিস্টেমের সঙ্গে যুক্ত করে। একটি তুলনা অনুযায়ী, মডেল হলো মস্তিষ্ক এবং এজেন্ট হলো শরীর।

সবচেয়ে বড় অভিযোগ হলো এজেন্টগুলো কতটা খারাপভাবে কাজ পরিচালনা করে। একটি উদাহরণে, একটি ওপেন-সোর্স ওয়েব অ্যাপে প্রায় ১.৫ হাজার লাইনের একটি পাসফ্রেজ-সুরক্ষা ফিচার যুক্ত করার কথা ছিল। এজেন্ট কাজটিকে ১০টি সাবটাস্কে ভাগ করে একে একে চালায়, অথচ সেগুলো মাল্টিটাস্কিংয়ের জন্য তৈরি কম্পিউটারে একসঙ্গে চালানো যেত। Claude Code খুব সামান্যই মাল্টিটাস্ক করে; সাব-এজেন্ট ও এন্ড-টু-এন্ড টেস্ট শেষ না হওয়া পর্যন্ত সে অপেক্ষা করে।

এজেন্টগুলো কাজ বণ্টনেও ভালো নয়। একটি অত্যাধুনিক মডেল ৫০ হাজার লাইন কোডে একটি প্যাটার্ন খুঁজতে সময় নষ্ট করতে পারে, অথচ একটি সস্তা ও দ্রুত মডেল কাজটি সামলাতে পারত। এজেন্ট কখনো মডেল বদলানোর পরামর্শ দেয় না, ফলে ব্যবহারকারীদের নিজেদেরই মডেল পছন্দ খুঁটিনাটি করে সামলাতে হয়, যা লেখকের মতে একটি LLM-এর কাজ হওয়া উচিত।

কোডিং এজেন্টগুলো যে মডেল ব্যবহার করে, তার তুলনায় কম কার্যকর কেন?

মডেল টেক্সট ও কোড তৈরি করে, কিন্তু এজেন্ট সেটিকে ফাইল ও কমান্ডের সঙ্গে যুক্ত করে। বর্তমানে এজেন্টগুলো টাস্ক ব্যবস্থাপনা, সমান্তরাল কাজ ও কাজ বণ্টন ভালোভাবে করতে পারে না, তাই অন্তর্নিহিত মডেল উন্নত হলেও এরা বাধা হয়ে থাকে।

বাংলা version →


🇩🇪 Deutsch

Warum sind Coding-Agenten so dumm?

Als ich zum ersten Mal einen Coding-Agenten benutzte, war ich fasziniert. Vorher kopierte ich ständig Code zwischen meiner IDE und einer KI-Chatoberfläche hin und her. Zu sehen, wie ein Agent Dateien direkt bearbeitete und seine eigenen Fehler in Echtzeit korrigierte, war beeindruckend. Nach ein paar Tagen ließ die Begeisterung nach, denn ich stieß auf häufige Bugs. Der Agent reagierte manchmal gar nicht mehr, bis ich ihn neu startete, und er erklärte Aufgaben oft als erledigt, obwohl die Arbeit kaum begonnen hatte.

Ich dachte, dass Agenten in sechs Monaten technisch genauso beeindruckend sein würden wie die zugrunde liegenden LLMs. Stattdessen blieben Coding-Agenten schlecht. Die KI-gestützte Softwareentwicklung ist deutlich vorangekommen, doch die Modelle leisten die schwere Arbeit, während die Agenten der Engpass bleiben. Die Unterscheidung ist wichtig: Das Modell, etwa GPT Astra, Claude Sonnet oder GLM-5.3, erzeugt Text und Code, während der Agent, etwa Claude Code von Anthropic oder Codex von OpenAI, die Software ist, die dieses Modell mit Codebasen und Computersystemen verbindet. Einer Analogie zufolge ist das Modell das Gehirn und der Agent der Körper.

Die größte Kritik betrifft die schlechte Aufgabenverwaltung. In einem Beispiel sollte einer Open-Source-Webanwendung eine Passwortschutz-Funktion mit rund 1,5 Tausend Zeilen Code hinzugefügt werden. Der Agent zerlegte die Arbeit in zehn Teilaufgaben und arbeitete sie nacheinander ab, obwohl sie auf einem für Multitasking gebauten Rechner parallel hätten laufen können. Claude Code multitaskt nur wenig und wartet, bis Subagenten und End-to-End-Tests abgeschlossen sind, bevor es weitermacht.

Agenten können zudem schlecht delegieren. Ein modernes Modell verbringt womöglich Zeit damit, 50.000 Zeilen Code nach einem Muster zu durchsuchen, das ein günstigeres und schnelleres Modell erledigen könnte. Der Agent schlägt nie vor, das Modell zu wechseln, sodass Nutzer die Modellwahl selbst kleinteilig steuern müssen, eine Aufgabe, die nach Ansicht des Autors ein LLM übernehmen könnte.

Warum schneiden Coding-Agenten schlechter ab als die Modelle, die sie nutzen?

Das Modell erzeugt Text und Code, der Agent verbindet ihn jedoch mit Dateien und Befehlen. Derzeit bewältigen Agenten Aufgabenverwaltung, Parallelverarbeitung und Delegation nur schlecht, weshalb sie selbst dann zum Engpass werden, wenn die zugrunde liegenden Modelle besser werden.

Deutsch version →


🇪🇸 Español

¿Por qué los agentes de programación son tan torpes?

La primera vez que usé un agente de programación, me quedé fascinado. Antes del agente, copiaba y pegaba entre mi IDE y una interfaz de chat de IA. Ver cómo un agente editaba archivos directamente y corregía sus propios errores en tiempo real era asombroso. Pasados unos días, la luna de miel terminó cuando empecé a encontrarme con fallos frecuentes. El agente dejaba de responder por completo hasta que lo reiniciaba, y a menudo declaraba terminadas las tareas cuando apenas había empezado el trabajo.

Pensé que, en seis meses, los agentes serían tan impresionantes técnicamente como los LLM subyacentes. En cambio, los agentes de programación siguieron siendo malos. El desarrollo asistido por IA ha avanzado claramente, pero son los modelos los que hacen el trabajo pesado, mientras que los agentes siguen siendo el cuello de botella. La distinción importa: el modelo, como GPT Astra, Claude Sonnet o GLM-5.3, genera el texto y el código, mientras que el agente, como Claude Code de Anthropic o Codex de OpenAI, es el software que conecta ese modelo con las bases de código y los sistemas informáticos. Como dice una analogía, el modelo es el cerebro y el agente es el cuerpo.

La queja más importante es lo mal que los agentes gestionan las tareas. En un ejemplo, a una aplicación web de código abierto se le añadió una función de protección con contraseña de unas 1.5k líneas. El agente dividió el trabajo en 10 subtareas y luego las ejecutó una por una, aunque podrían haberse ejecutado en paralelo en un equipo diseñado para el multitarea. Claude Code solo hace un poco de multitarea, esperando a que terminen los subagentes y las pruebas de extremo a extremo antes de continuar.

Los agentes tampoco delegan bien. Un modelo de vanguardia puede pasar su tiempo escaneando 50 000 líneas de código en busca de un patrón que un modelo más barato y rápido podría manejar. El agente nunca sugiere cambiar de modelo, lo que obliga a los usuarios a microgestionar ellos mismos la elección del modelo, una tarea que, según el autor, podría hacer un LLM.

¿Por qué los agentes de programación rinden menos que los modelos que utilizan?

El modelo genera el texto y el código, pero el agente lo conecta con archivos y comandos. Actualmente, los agentes gestionan mal las tareas, el paralelismo y la delegación, así que se convierten en el cuello de botella aunque los modelos subyacentes mejoren.

Español version →


🇫🇷 Français

Pourquoi les agents de codage sont-ils si bêtes ?

La première fois que j'ai utilisé un agent de codage, j'ai été fasciné. Avant l'agent, je copiais-collais entre mon IDE et une interface de chat IA. Voir un agent modifier directement des fichiers et corriger ses propres erreurs en temps réel était stupéfiant. Au bout de quelques jours, la lune de miel a pris fin, car les bugs étaient fréquents. L'agent cessait complètement de répondre jusqu'à ce que je le redémarre, et il déclarait souvent les tâches terminées alors que le travail venait à peine de commencer.

Je pensais qu'au bout de six mois, les agents seraient aussi impressionnants techniquement que les LLM sous-jacents. Au lieu de cela, les agents de codage sont restés médiocres. Le développement assisté par IA a nettement progressé, mais ce sont les modèles qui font le gros du travail, tandis que les agents restent le goulot d'étranglement. La distinction est importante : le modèle, comme GPT Astra, Claude Sonnet ou GLM-5.3, génère le texte et le code, alors que l'agent, comme Claude Code d'Anthropic ou Codex d'OpenAI, est le logiciel qui relie ce modèle aux bases de code et aux systèmes informatiques. Comme le dit une analogie, le modèle est le cerveau et l'agent est le corps.

Le reproche le plus fréquent concerne la gestion déplorable des tâches par les agents. Dans un exemple, une application web open source devait recevoir une fonction de protection par phrase de passe d'environ 1,5 k lignes. L'agent a découpé le travail en 10 sous-tâches, puis les a exécutées une à une, alors qu'elles auraient pu tourner en parallèle sur un ordinateur conçu pour le multitâche. Claude Code ne fait que très peu de multitâche, attendant que les sous-agents et les tests de bout en bout se terminent avant de passer à la suite.

Les agents délèguent aussi mal. Un modèle de pointe peut passer son temps à parcourir 50 000 lignes de code à la recherche d'un motif qu'un modèle moins cher et plus rapide pourrait traiter. L'agent ne suggère jamais de changer de modèle, ce qui oblige les utilisateurs à gérer eux-mêmes le choix du modèle, une tâche que l'auteur estime pouvoir être confiée à un LLM.

Pourquoi les agents de codage sont-ils moins performants que les modèles qu'ils utilisent ?

Le modèle génère le texte et le code, mais l'agent le relie aux fichiers et aux commandes. Actuellement, les agents gèrent mal la gestion des tâches, le parallélisme et la délégation, si bien qu'ils deviennent le goulot d'étranglement même lorsque les modèles sous-jacents progressent.

Français version →


🇮🇳 हिन्दी

कोडिंग एजेंट इतने बेवकूफ क्यों हैं?

जब पहली बार मैंने कोडिंग एजेंट का इस्तेमाल किया, तो मैं मंत्रमुग्ध हो गया। एजेंट से पहले, मैं अपने IDE और एक AI चैट इंटरफ़ेस के बीच कॉपी-पेस्ट करता था। किसी एजेंट को सीधे फ़ाइलें बदलते और रीयल टाइम में अपनी गलतियाँ सुधारते देखना अद्भुत था। कुछ दिनों बाद, यह उत्साह ठंडा पड़ गया, क्योंकि बार-बार बग आने लगे। एजेंट मेरे उसे दोबारा शुरू करने तक पूरी तरह प्रतिक्रिया देना बंद कर देता था, और अक्सर कार्य तब पूरा घोषित कर देता था जब काम मुश्किल से शुरू हुआ होता था।

मुझे लगा था कि छह महीने में एजेंट तकनीकी रूप से उतने ही प्रभावशाली हो जाएँगे जितने उनके अंतर्निहित LLM हैं। इसके बजाय, कोडिंग एजेंट खराब ही बने रहे। AI-सहायता प्राप्त विकास स्पष्ट रूप से आगे बढ़ा है, लेकिन भारी काम मॉडल कर रहे हैं जबकि एजेंट बाधा बने हुए हैं। यह अंतर मायने रखता है: मॉडल, जैसे GPT Astra, Claude Sonnet या GLM-5.3, टेक्स्ट और कोड तैयार करता है, जबकि एजेंट, जैसे Anthropic का Claude Code या OpenAI का Codex, वह सॉफ़्टवेयर है जो उस मॉडल को कोडबेस और कंप्यूटर सिस्टम से जोड़ता है। जैसा कि एक उपमा कहती है, मॉडल दिमाग है और एजेंट शरीर।

सबसे बड़ी शिकायत यह है कि एजेंट कार्यों का प्रबंधन कितनी खराब तरह से करते हैं। एक उदाहरण में, एक ओपन-सोर्स वेब ऐप में लगभग 1.5k लाइन का पासफ़्रेज़-सुरक्षा फ़ीचर जोड़ा जाना था। एजेंट ने काम को 10 उपकार्यों में बाँटा और फिर उन्हें एक-एक करके चलाया, जबकि उन्हें मल्टीटास्किंग के लिए बने कंप्यूटर पर समानांतर रूप से चलाया जा सकता था। Claude Code बहुत कम मल्टीटास्किंग करता है, आगे बढ़ने से पहले सब-एजेंट और एंड-टू-एंड टेस्ट पूरे होने का इंतज़ार करता है।

एजेंट कार्य को अच्छी तरह सौंप भी नहीं पाते। एक अत्याधुनिक मॉडल 50k लाइन कोड में किसी पैटर्न को खोजने में समय लगा सकता है, जबकि एक सस्ता और तेज़ मॉडल यह काम संभाल सकता था। एजेंट कभी मॉडल बदलने का सुझाव नहीं देता, जिससे उपयोगकर्ताओं को मॉडल चुनाव खुद बारीकी से संभालना पड़ता है, और लेखक का मानना है कि यह काम एक LLM कर सकता है।

कोडिंग एजेंट उन मॉडलों से कमतर प्रदर्शन क्यों करते हैं जिनका वे उपयोग करते हैं?

मॉडल टेक्स्ट और कोड तैयार करता है, लेकिन एजेंट उसे फ़ाइलों और कमांड से जोड़ता है। वर्तमान में एजेंट कार्य प्रबंधन, समानांतर प्रसंस्करण और कार्य सौंपने को ठीक से नहीं संभालते, इसलिए अंतर्निहित मॉडल सुधरने के बावजूद वे बाधा बने रहते हैं।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Mengapa Agen Pengodean Begitu Bodoh?

Pertama kali saya menggunakan agen pengodean, saya terpukau. Sebelum memakai agen, saya terus menyalin dan menempel antara IDE dan antarmuka chat AI. Melihat agen mengedit file secara langsung dan memperbaiki kesalahannya sendiri secara real time sungguh mengagumkan. Namun setelah beberapa hari, rasa antusias itu memudar karena sering muncul bug. Agen sepenuhnya berhenti merespons sampai saya memulai ulangnya, dan agen sering menyatakan tugas selesai padahal pekerjaan baru saja dimulai.

Saya mengira bahwa dalam enam bulan, agen akan sama mengesankannya secara teknis dengan LLM yang mendasarinya. Ternyata agen pengodean tetap buruk. Pengembangan berbantuan AI memang jelas maju, tetapi model yang melakukan sebagian besar pekerjaan berat, sementara agen tetap menjadi hambatan. Perbedaan ini penting: model, seperti GPT Astra, Claude Sonnet, atau GLM-5.3, menghasilkan teks dan kode, sedangkan agen, seperti Claude Code dari Anthropic atau Codex dari OpenAI, adalah perangkat lunak yang menghubungkan model itu dengan basis kode dan sistem komputer. Sebuah analogi menyebutkan bahwa model adalah otak dan agen adalah tubuh.

Keluhan terbesar adalah betapa buruknya agen dalam mengelola tugas. Dalam satu contoh, sebuah aplikasi web open-source membutuhkan fitur perlindungan kata sandi sekitar 1,5 ribu baris kode. Agen memecah pekerjaan menjadi 10 subtugas lalu menjalankannya satu per satu, padahal semuanya bisa berjalan paralel di komputer yang dirancang untuk multitasking. Claude Code hanya sedikit melakukan multitasking, menunggu subagen dan pengujian end-to-end selesai sebelum melanjutkan.

Agen juga tidak pandai mendelegasikan pekerjaan. Model canggih bisa menghabiskan waktu memindai 50 ribu baris kode untuk mencari pola tertentu, padahal model yang lebih murah dan cepat bisa menanganinya. Agen tidak pernah menyarankan pergantian model, sehingga pengguna harus mengatur pemilihan model secara manual, pekerjaan yang menurut penulis bisa dilakukan oleh LLM.

Mengapa agen pengodean berkinerja lebih rendah daripada model yang mereka gunakan?

Model menghasilkan teks dan kode, tetapi agen menghubungkannya dengan file dan perintah. Saat ini agen masih lemah dalam pengelolaan tugas, paralelisme, dan delegasi, sehingga mereka menjadi hambatan meskipun model yang mendasarinya terus membaik.

Bahasa Indonesia version →


🇯🇵 日本語

コーディングエージェントはなぜこんなに賢くないのか?

初めてコーディングエージェントを使ったとき、私はすっかり魅了されました。エージェントを使う前は、IDEとAIチャットの画面の間でコードをコピー&ペーストしていました。エージェントがファイルを直接編集し、リアルタイムで自分のエラーを修正していく様子は見事でした。しかし数日後には、頻繁なバグに遭遇して熱は冷めました。エージェントは私が再起動するまで応答を完全に止めることがあり、しばしば作業がほとんど始まっていないのにタスクの完了を宣言しました。

私は、6か月もすればエージェントは基盤となるLLMと同じくらい技術的に優れたものになるだろうと考えていました。しかし実際には、コーディングエージェントは相変わらず不出来なままでした。AI支援開発は確かに進歩しましたが、重い作業を担っているのはモデルであり、エージェントは依然としてボトルネックになっています。その違いは重要です。GPT Astra、Claude Sonnet、GLM-5.3のようなモデルはテキストとコードを生成し、Anthropicの Claude Codeや OpenAIの Codexのようなエージェントは、そのモデルをコードベースやコンピュータシステムに接続するソフトウェアです。ある例えによれば、モデルが脳でエージェントが身体なのです。

最大の不満は、エージェントがタスクを管理するのがいかに下手かという点です。ある例では、オープンソースのWebアプリに約1.5千行のパスフレーズ保護機能を追加する必要がありました。エージェントは作業を10個のサブタスクに分けましたが、それらをマルチタスクのために作られたコンピュータで並列に実行できたはずなのに、一つずつ順番に実行しました。Claude Codeのマルチタスクはごくわずかで、サブエージェントやエンドツーエンドのテストが終わるまで待ってから先に進みます。

エージェントはタスクの委任も上手くありません。最先端のモデルが5万行のコードから特定のパターンを探すのに時間を費やすことがありますが、より安価で高速なモデルでも十分対応できるはずです。エージェントがモデルの切り替えを提案することはないため、ユーザーは自分でモデルの選択を細かく管理しなければなりません。著者によれば、それはLLMが担える仕事です。

コーディングエージェントが、利用しているモデルよりも性能が劣るのはなぜですか?

テキストとコードを生成するのはモデルですが、それをファイルやコマンドにつなぐのはエージェントです。現状のエージェントはタスク管理、並列処理、タスクの委任が苦手なため、基盤モデルが進歩しても、それがボトルネックになっています。

日本語 version →


🇧🇷 Português

Por que os agentes de programação são tão burros?

Na primeira vez que usei um agente de programação, fiquei fascinado. Antes dele, eu copiava e colava entre minha IDE e uma interface de chat com IA. Ver um agente editar arquivos diretamente e corrigir os próprios erros em tempo real era incrível. Depois de alguns dias, a lua de mel acabou, pois encontrei bugs frequentes. O agente parava de responder por completo até que eu o reiniciasse, e muitas vezes declarava as tarefas concluídas quando o trabalho mal havia começado.

Eu imaginava que, em seis meses, os agentes seriam tão impressionantes tecnicamente quanto os LLMs subjacentes. Em vez disso, os agentes de programação continuaram ruins. O desenvolvimento assistido por IA avançou claramente, mas são os modelos que fazem o trabalho pesado, enquanto os agentes continuam sendo o gargalo. A distinção importa: o modelo, como GPT Astra, Claude Sonnet ou GLM-5.3, gera o texto e o código, enquanto o agente, como o Claude Code da Anthropic ou o Codex da OpenAI, é o software que conecta esse modelo às bases de código e aos sistemas do computador. Como diz uma analogia, o modelo é o cérebro e o agente é o corpo.

A maior reclamação é o quão mal os agentes gerenciam tarefas. Em um exemplo, um aplicativo web de código aberto precisava de um recurso de proteção por senha com cerca de 1,5 mil linhas. O agente dividiu o trabalho em 10 subtarefas e as executou uma a uma, embora pudessem ter rodado em paralelo em um computador feito para multitarefa. O Claude Code faz pouca multitarefa, esperando que subagentes e testes de ponta a ponta terminem antes de seguir em frente.

Os agentes também não delegam bem. Um modelo de ponta pode gastar tempo varrendo 50 mil linhas de código em busca de um padrão que um modelo mais barato e rápido resolveria. O agente nunca sugere trocar de modelo, o que obriga os usuários a microgerenciar a escolha do modelo, tarefa que, segundo o autor, um LLM poderia fazer.

Por que os agentes de programação têm desempenho inferior aos modelos que usam?

O modelo gera o texto e o código, mas o agente o conecta a arquivos e comandos. Atualmente, os agentes lidam mal com gestão de tarefas, paralelismo e delegação, então se tornam o gargalo mesmo quando os modelos subjacentes melhoram.

Português version →


🇷🇺 Русский

Почему программные агенты такие глупые?

Когда я впервые использовал программного агента, я был в восторге. До агента я копировал и вставлял код между своей IDE и интерфейсом чата с ИИ. Было потрясающе наблюдать, как агент напрямую редактирует файлы и исправляет собственные ошибки в реальном времени. Через несколько дней эйфория прошла, потому что начали часто появляться баги. Агент полностью переставал отвечать, пока я его не перезапущу, и часто объявлял задачи выполненными, когда работа едва начиналась.

Я предполагал, что через шесть месяцев агенты станут такими же технически впечатляющими, как лежащие в их основе LLM. Но программные агенты так и остались слабыми. Разработка с помощью ИИ заметно продвинулась, однако основную работу выполняют модели, тогда как агенты остаются узким местом. Это различие важно: модель, например GPT Astra, Claude Sonnet или GLM-5.3, генерирует текст и код, а агент, например Claude Code от Anthropic или Codex от OpenAI, — это программа, которая связывает модель с кодовой базой и системами компьютера. Как сказано в одной аналогии, модель — это мозг, а агент — тело.

Главная претензия связана с тем, как плохо агенты управляют задачами. В одном примере в открытое веб-приложение нужно было добавить функцию защиты паролем объёмом около 1,5 тысячи строк кода. Агент разбил работу на 10 подзадач и выполнил их последовательно, хотя их можно было бы запустить параллельно на компьютере, созданном для многозадачности. Claude Code почти не выполняет задачи параллельно, ожидая завершения субагентов и сквозных тестов, прежде чем перейти дальше.

Агенты также плохо делегируют работу. Передовая модель может тратить время на просмотр 50 тысяч строк кода в поисках определённого паттерна, хотя с этим справилась бы более дешёвая и быстрая модель. Агент никогда не предлагает сменить модель, поэтому пользователям приходится самим вручную подбирать модель для каждой задачи, и, по мнению автора, эту работу мог бы выполнить сам LLM.

Почему программные агенты работают хуже, чем модели, на которых они основаны?

Модель генерирует текст и код, а агент связывает её с файлами и командами. Сейчас агенты плохо справляются с управлением задачами, параллельной работой и делегированием, поэтому они становятся узким местом, даже когда лежащие в основе модели совершенствуются.

Русский version →


🇨🇳 简体中文

为什么编程智能体如此笨拙?

我第一次使用编程智能体时,被它深深吸引。在用智能体之前,我一直在IDE和AI聊天界面之间复制粘贴代码。看到智能体直接编辑文件并实时修复自己的错误,令人惊叹。几天后,新鲜感消退,我遇到了频繁的故障。智能体会完全停止响应,直到我重启它;而且它常常在工作刚刚开始时就宣布任务完成。

我原以为六个月后,智能体在技术上会和底层大语言模型一样令人印象深刻。结果,编程智能体依然很差。AI辅助开发确实有了明显进步,但真正承担繁重工作的是模型,而智能体仍然是瓶颈。这一区别很重要:模型(如GPT Astra、Claude Sonnet或GLM-5.3)负责生成文本和代码;智能体(如Anthropic的Claude Code或OpenAI的Codex)则是把模型连接到代码库和计算机系统的软件。正如一个比喻所说,模型是大脑,智能体是身体。

最大的抱怨在于智能体的任务管理能力很差。有一个例子中,一个开源网页应用需要添加一项约1.5千行代码的口令保护功能。智能体把工作拆成10个子任务,然后逐一执行,尽管这些任务本可以在一台为多任务而生的计算机上并行完成。Claude Code只有很有限的多任务能力,在继续下一步之前,会等待子智能体和端到端测试全部完成。

智能体也不擅长委派任务。一个顶尖模型可能花费大量时间扫描5万行代码以查找某种模式,而一个更便宜、更快的模型本可以胜任。智能体从不建议切换模型,于是用户只能自己手动管理模型选择,而作者认为这项工作本应交给大语言模型来完成。

为什么编程智能体的表现不如它们所使用的模型?

模型负责生成文本和代码,而智能体负责将其连接到文件和命令。目前,智能体在任务管理、并行处理和任务委派方面表现欠佳,因此即使底层模型不断进步,它们仍然成为瓶颈。

简体中文 version →