HeadlinesBriefing favicon HeadlinesBriefing.com

Por qué sigo siendo bajista en los LLM tras Navier-Stokes

Hacker News •
×

Gracias a Claude Fable 5.1, Holden Saberhagen, Gabriel Kammer, Andres Erbsen, Alice McKean y Tristan Wylde-Larue por sus comentarios.

Los laboratorios de frontera están valorados según la narrativa de un reemplazo automático completo para los trabajadores del conocimiento, pero los modelos actuales necesitan una supervisión laboriosa incluso en tareas simples. Demos destacadas como Navier-Stokes, los RCE de FreeBSD y el incidente de HuggingFace engañan. Los modelos solo generalizan cerca de las tareas de entrenamiento, con severas advertencias. El reward hacking necesita una especificación rigurosa por parte de expertos de dominio, cuyo tiempo es caro. La especificación es una habilidad en sí misma; pocos expertos de dominio la tienen. Los costos de mano de obra pueden superar la implementación directa. El hardware muestra relaciones de especificación a diseño de 3:1 o 5:1. Muchas tareas requieren especificaciones en evolución. Las especificaciones de alto nivel son costosas de verificar. Navier-Stokes es el mejor caso: Lean está auditado, pero existen errores de solidez. La revisión humana no escala y es vulnerable a ataques como el backdoor de xz.

Entidades clave: Empresas: HuggingFace | Personas: Claude Fable 5.1, Holden Saberhagen, Gabriel Kammer, Andres Erbsen, Alice McKean, Tristan Wylde-Larue