HeadlinesBriefing favicon HeadlinesBriefing.com

TPU vs GPU vs NPU: Diferencias Clave Explicadas

Engadget •
×

La Unidad de Procesamiento de Tensor (TPU) de Google se implementó inicialmente de forma interna en 2015 como un acelerador de IA propietario para cargas de trabajo de aprendizaje automático basadas en la nube en centros de datos. A diferencia de las GPU, las TPU utilizan una arquitectura de arreglo sistólico: una cuadrícula 2D de multiplicadores que pasa los resultados de cálculo directamente a la siguiente unidad sin escribir de vuelta a la memoria, eliminando cuellos de botella para el entrenamiento masivo de modelos de lenguaje grande (LLM). Esto hace que las TPU sean más eficientes energéticamente para empresas como Anthropic y Midjourney que sirven miles de millones de solicitudes de IA diarias.

El término TPU apareció recientemente en dispositivos de consumo con el chip Google Tensor G6 del smartphone Pixel 11, que afirma tener un 50 por ciento más de capacidad de cómputo de TPU. Sin embargo, esta TPU en el dispositivo esencialmente funciona como una Unidad de Procesamiento Neural (NPU), encargándose del procesamiento de cámara y tareas de IA locales. Google afirma un hasta 3,5 veces más rápido en el procesamiento de IA mientras consume hasta 3,5 veces menos energía en comparación con generaciones anteriores.

Las GPU siguen siendo chips versátiles tipo «todo en uno» para juegos, renderizado 3D, entrenamiento de IA y minería de criptomonedas. Las NPU en smartphones modernos, Macs y PC manejan IA generativa en el dispositivo, como edición de fotos y tareas de ChatGPT. Las diferencias clave radican en la escala y el caso de uso: las TPU dominan la IA a escala de la nube, las NPU y las TPU en el dispositivo sirven a dispositivos de consumo, mientras que las GPU conectan ambos mundos con mayor flexibilidad.

Entidades clave: Empresas: Google, Anthropic, Midjourney, Apple, AMD

Preguntas frecuentes: ¿En qué difiere la arquitectura de arreglo sistólico de una TPU de la arquitectura de memoria de una GPU?

La arquitectura de arreglo sistólico de una TPU pasa los datos directamente entre las unidades multiplicadoras en una cuadrícula 2D sin escribir de vuelta a la memoria, mientras que las GPU deben ciclar los datos entre las unidades de cómputo y la memoria de alto ancho de banda, creando cuellos de botella a escala.