La première fois que j'ai utilisé un agent de codage, j'ai été fasciné. Avant l'agent, je copiais-collais entre mon IDE et une interface de chat IA. Voir un agent modifier directement des fichiers et corriger ses propres erreurs en temps réel était stupéfiant. Au bout de quelques jours, la lune de miel a pris fin, car les bugs étaient fréquents. L'agent cessait complètement de répondre jusqu'à ce que je le redémarre, et il déclarait souvent les tâches terminées alors que le travail venait à peine de commencer.
Je pensais qu'au bout de six mois, les agents seraient aussi impressionnants techniquement que les LLM sous-jacents. Au lieu de cela, les agents de codage sont restés médiocres. Le développement assisté par IA a nettement progressé, mais ce sont les modèles qui font le gros du travail, tandis que les agents restent le goulot d'étranglement. La distinction est importante : le modèle, comme GPT Astra, Claude Sonnet ou GLM-5.3, génère le texte et le code, alors que l'agent, comme Claude Code d'Anthropic ou Codex d'OpenAI, est le logiciel qui relie ce modèle aux bases de code et aux systèmes informatiques. Comme le dit une analogie, le modèle est le cerveau et l'agent est le corps.
Le reproche le plus fréquent concerne la gestion déplorable des tâches par les agents. Dans un exemple, une application web open source devait recevoir une fonction de protection par phrase de passe d'environ 1,5 k lignes. L'agent a découpé le travail en 10 sous-tâches, puis les a exécutées une à une, alors qu'elles auraient pu tourner en parallèle sur un ordinateur conçu pour le multitâche. Claude Code ne fait que très peu de multitâche, attendant que les sous-agents et les tests de bout en bout se terminent avant de passer à la suite.
Les agents délèguent aussi mal. Un modèle de pointe peut passer son temps à parcourir 50 000 lignes de code à la recherche d'un motif qu'un modèle moins cher et plus rapide pourrait traiter. L'agent ne suggère jamais de changer de modèle, ce qui oblige les utilisateurs à gérer eux-mêmes le choix du modèle, une tâche que l'auteur estime pouvoir être confiée à un LLM.
Source: Hacker News · Résumé par HeadlinesBriefing