HeadlinesBriefing favicon HeadlinesBriefing.com

Pourquoi je reste baissier sur les LLM après Navier-Stokes

Hacker News •
×

Merci à Claude Fable 5.1, Holden Saberhagen, Gabriel Kammer, Andres Erbsen, Alice McKean et Tristan Wylde-Larue pour leurs commentaires.

Les laboratoires de pointe sont valorisés sur le récit d'un remplacement automatique complet des travailleurs du savoir, mais les modèles actuels nécessitent une supervision laborieuse même pour des tâches simples. Les démos phares comme Navier-Stokes, les RCE FreeBSD et l'incident HuggingFace sont trompeuses. Les modèles ne généralisent que près des tâches d'entraînement, avec de sérieuses réserves. Le reward hacking nécessite une spécification rigoureuse par des experts du domaine, dont le temps est coûteux. La spécification est une compétence en soi ; peu d'experts du domaine la possèdent. Les coûts de main-d'œuvre peuvent dépasser l'implémentation directe. Le matériel montre des ratios spécification/conception de 3:1 ou 5:1. De nombreuses tâches nécessitent des spécifications évolutives. Les spécifications de haut niveau sont coûteuses à vérifier. Navier-Stokes est le meilleur cas : Lean est audité, mais des bugs de solidité existent. La revue humaine ne passe pas à l'échelle et est vulnérable à des attaques comme la porte dérobée xz.

Entités clés : Entreprises : HuggingFace | Personnes : Claude Fable 5.1, Holden Saberhagen, Gabriel Kammer, Andres Erbsen, Alice McKean, Tristan Wylde-Larue

FAQ : Pourquoi les laboratoires de pointe sont-ils surévalués selon l'auteur ?

Ils sont valorisés sur un récit d'automatisation totale, mais les modèles actuels exigent une lourde supervision et échouent sur de petites perturbations.

FAQ Q : Pourquoi les laboratoires de pointe sont-ils surévalués selon l'auteur ?

FAQ R : Ils sont valorisés sur un récit d'automatisation totale, mais les modèles actuels exigent une lourde supervision et échouent sur de petites perturbations.