HeadlinesBriefing HeadlinesBriefing.com

¿Por qué los agentes de programación son tan torpes?

Hacker News •
×

La primera vez que usé un agente de programación, me quedé fascinado. Antes del agente, copiaba y pegaba entre mi IDE y una interfaz de chat de IA. Ver cómo un agente editaba archivos directamente y corregía sus propios errores en tiempo real era asombroso. Pasados unos días, la luna de miel terminó cuando empecé a encontrarme con fallos frecuentes. El agente dejaba de responder por completo hasta que lo reiniciaba, y a menudo declaraba terminadas las tareas cuando apenas había empezado el trabajo.

Pensé que, en seis meses, los agentes serían tan impresionantes técnicamente como los LLM subyacentes. En cambio, los agentes de programación siguieron siendo malos. El desarrollo asistido por IA ha avanzado claramente, pero son los modelos los que hacen el trabajo pesado, mientras que los agentes siguen siendo el cuello de botella. La distinción importa: el modelo, como GPT Astra, Claude Sonnet o GLM-5.3, genera el texto y el código, mientras que el agente, como Claude Code de Anthropic o Codex de OpenAI, es el software que conecta ese modelo con las bases de código y los sistemas informáticos. Como dice una analogía, el modelo es el cerebro y el agente es el cuerpo.

La queja más importante es lo mal que los agentes gestionan las tareas. En un ejemplo, a una aplicación web de código abierto se le añadió una función de protección con contraseña de unas 1.5k líneas. El agente dividió el trabajo en 10 subtareas y luego las ejecutó una por una, aunque podrían haberse ejecutado en paralelo en un equipo diseñado para el multitarea. Claude Code solo hace un poco de multitarea, esperando a que terminen los subagentes y las pruebas de extremo a extremo antes de continuar.

Los agentes tampoco delegan bien. Un modelo de vanguardia puede pasar su tiempo escaneando 50 000 líneas de código en busca de un patrón que un modelo más barato y rápido podría manejar. El agente nunca sugiere cambiar de modelo, lo que obliga a los usuarios a microgestionar ellos mismos la elección del modelo, una tarea que, según el autor, podría hacer un LLM.

Fuente: Hacker News · Resumido por HeadlinesBriefing