HeadlinesBriefing favicon HeadlinesBriefing.com

Révolution du hardware d'inférence 2026 : IA de l'entraînement à l'inférence

Hacker News •
×

Le chip Napier de Tensordyne est conçu pour accélérer l'inférence IA. Depuis environ 2020, l'IA s'est principalement concentrée sur l'entraînement de modèles plus grands et meilleurs. Les grands modèles linguistiques (LLM) sont passés de millions de paramètres à des billions. Cela s'est révélé efficace : la plus grande version du GPT-3 d'Open AI, publiée en 2020, répondait correctement à seulement 43,9 % des questions sur une benchmark populaire de connaissance et de raisonnement. Quatre ans plus tard, GPT-4o a atteint un score de 88,7 % sur le même examen, égalant ainsi les experts humains. Les laboratoires d'IA avancés continuent d'entraîner des modèles de plus en plus grands, mais cet entraînement a légèrement reculé au second plan de la conversation sur l'IA. En 2026, l'inférence—l'utilisation de modèles entraînés pour produire du code, écrire des essais ou créer des images de nous-mêmes en elfes—est venue au premier plan.

“C'est comme si l'entraînement était la nouvelle d'hier”, déclare Matt Kimball, analyste principal centre de données chez Moor Insights & Strategy. “Tout ce que veut parler un directeur de l'information, c'est l'inférence”. Le PDG de Nvidia, Jensen Huang, lors de la conférence GTC 2026 de l'entreprise, a salué ce changement comme le “point d'inflexion de l'inférence”.

Une partie de la cause de ce changement est très simple : les LLM deviennent utiles, donc les gens les utilisent. De plus, de nombreux modèles sur le marché aujourd'hui sont des modèles de raisonnement. En réponse à une requête de l'utilisateur, ils exécutent l'inférence pas une fois mais plusieurs fois, se reprompt dans un processus appelé chaîne de pensée. Les modèles de raisonnement génèrent des sorties plus longues, et les modèles avec un effort de raisonnement élevé peuvent produire jusqu'à 20 fois plus de texte que ceux avec un effort faible ou nul.

L'explosion qui en a découlé dans la demande d'inférence a conduit à des alliances inattendues entre les géants de la technologie. Open AI et Amazon ont déployé des puces de la taille d'une plaque à dîner conçues par Cerebras, malgré le fait que Amazon possède ses propres puces Trainium. Nvidia a acheté des talents clés et de la propriété intellectuelle à la startup d'inférence IA Groq dans un accord controversyux d'une valeur de 20 milliards de dollars US. Et Anthropic paie à son concurrent LLM Space XAI plus d'un milliard de dollars par mois pour louer des ressources de calcul de secours.