HeadlinesBriefing favicon HeadlinesBriefing.com

Revolución del hardware de inferencia 2026: IA de entrenamiento a inferencia

Hacker News •
×

El chip Napier de Tensordyne está diseñado para acelerar la inferencia de IA. Desde aproximadamente 2020, la IA se ha centrado en entrenar modelos más grandes y mejores. Los modelos de lenguaje grande (LLM) aumentaron de millones de parámetros a billones. Esto demostró ser efectivo: la versión más grande del GPT-3 de Open AI, lanzada en 2020, respondió correctamente solo el 43.9% de las preguntas en un popular benchmark de conocimiento y razonamiento. Solo cuatro años después, GPT-4o alcanzó una puntuación del 88.7% en el mismo examen, igualando efectivamente a los expertos humanos. Los laboratorios de IA avanzada siguen entrenando modelos cada vez más grandes, pero ese entrenamiento ha retrocedido ligeramente al fondo de la conversación sobre IA. En 2026, la inferencia, que consiste en usar modelos entrenados para generar código, escribir ensayos o imágenes de nosotros mismos como elfos, ha llegado al primer plano.

“Es como si el entrenamiento fuera noticia de ayer”, dice Matt Kimball, analista principal de centros de datos de Moor Insights & Strategy. “Todo lo que quiere hablar un director de información es de inferencia”. El CEO de Nvidia, Jensen Huang, hablando en la conferencia GTC 2026 de la empresa, celebró este cambio como el “punto de inflexión de la inferencia”.

Parte de lo que causó el cambio es muy simple: los LLM están volviéndose útiles, así que la gente los está usando. Además, muchos modelos en el mercado actual son modelos de razonamiento. En respuesta a una consulta del usuario, ejecutan la inferencia no una sino varias veces, auto-prompteando en un proceso llamado “chain of thought”. Los modelos de razonamiento generan salidas más largas, y los modelos con alto esfuerzo de razonamiento pueden producir hasta 20 veces más texto que aquellos con bajo o ningún esfuerzo.

La explosión resultante en la demanda de inferencia ha llevado a alianzas inesperadas entre gigantes tecnológicos. Open AI y Amazon han desplegado chips del tamaño de una bandeja de cena diseñados por Cerebras, a pesar de que Amazon tiene sus propios chips Trainium. Nvidia compró talento clave y propiedad intelectual de la startup de inferencia de IA Groq en un acuerdo controvertido valorado en 20 mil millones de dólares. Y Anthropic paga a su competidor LLM Space XAI más de mil millones de dólares al mes para arrendar cómputo de respaldo.