HeadlinesBriefing favicon HeadlinesBriefing.com

TPU vs GPU vs NPU : différences clés expliquées

Engadget •
×

L'unité de traitement tensoriel (TPU) de Google a été déployée initialement en interne en 2015 en tant qu'accélérateur d'IA propriétaire pour les charges de travail d'apprentissage automatique basées sur le cloud dans les centres de données. Contrairement aux GPU, les TPU utilisent une architecture de réseau systolique : une grille 2D de multiplicateurs qui transmet directement les résultats de calcul à l'unité suivante sans écrire en retour dans la mémoire, éliminant ainsi les goulets d'étranglement pour l'entraînement à grande échelle des grands modèles de langage (LLM). Cela rend les TPU plus efficaces sur le plan énergétique pour des entreprises comme Anthropic et Midjourney qui servent des milliards de requêtes d'IA quotidiennes.

Le terme TPU est récemment apparu dans les appareils grand public avec la puce Google Tensor G6 du smartphone Pixel 11, revendiquant 50 pour cent de capacité de calcul TPU en plus. Cependant, cette TPU intégrée à l'appareil fonctionne essentiellement comme une unité de traitement neuronal (NPU), gérant le traitement de la caméra et les tâches d'IA locales. Google affirme une jusqu'à 3,5 fois plus rapide dans le traitement de l'IA tout en consommant jusqu'à 3,5 fois moins d'énergie par rapport aux générations précédentes.

Les GPU restent des puces polyvalentes « touche-à-tout » pour les jeux, le rendu 3D, l'entraînement d'IA et le minage de cryptomonnaies. Les NPU présents dans les smartphones modernes, les Mac et les PC gèrent l'IA générative sur appareil, comme l'édition de photos et les tâches ChatGPT. Les différences clés résident dans l'échelle et le cas d'usage : les TPU dominent l'IA à l'échelle du cloud, les NPU et les TPU intégrés servent les appareils grand public, tandis que les GPU relient les deux mondes grâce à une plus grande flexibilité.

Entités clés : Entreprises : Google, Anthropic, Midjourney, Apple, AMD

FAQ : En quoi l'architecture de réseau systolique d'une TPU diffère-t-elle de l'architecture mémoire d'une GPU ?

L'architecture de réseau systolique d'une TPU transmet les données directement entre les unités de multiplication dans une grille 2D sans écrire en retour dans la mémoire, tandis que les GPU doivent faire circuler les données entre les unités de calcul et la mémoire à large bande passante, créant des goulets d'étranglement à l'échelle.