HeadlinesBriefing favicon HeadlinesBriefing.com

Optimiseur de noyau CUDA agentique avec LangGraph

Hacker News •
×

Ce projet présente un optimiseur de noyau CUDA agentique qui transforme les descriptions de charges de travail en implémentations GPU grâce à la génération automatique de code, aux vérifications de correction, aux benchmarks et à l'affinement. Alimenté par LangGraph, l'agent explore les implémentations de noyaux et les configurations de lancement, interroge les propriétés du GPU, et peut rechercher la documentation de NVIDIA pour obtenir des conseils d'optimisation. Il examine également les compteurs de Nsight Compute pour orienter son prochain expérimentation. Chaque expérimentation est enregistrée, et l'implémentation validée la plus rapide est conservée.

Le modèle peut modifier à la fois le code du noyau et les configurations de lancement par cas. Un harnais C++ autonome compile les noyaux avec NVRTC, les lance via l'API du pilote CUDA, et enregistre les sorties. Python gère la comparaison et la sélection des candidats. Le système nécessite Python 3.12+, un GPU NVIDIA, et un toolkit/pilote CUDA compatible, ainsi que CMake 3.24+ et un compilateur C++17. La configuration implique la création d'un environnement virtuel, l'installation des dépendances, et la configuration de la construction avec Visual Studio 2026.

Les utilisateurs peuvent exécuter l'optimiseur avec une description de charge de travail, telle que « GEMM en précision simple avec des matrices rectangulaires », et spécifier un nombre maximal d'itérations. Le modèle par défaut est gpt-5-mini avec un effort de raisonnement moyen, et l'utilisation de l'API est facturée sur le compte de l'utilisateur. Des drapeaux facultatifs permettent le profilage avec Nsight Compute et la récupération des conseils de recherche de NVIDIA avant la génération des noyaux.

Entités clés : Entreprises : NVIDIA, OpenAI | Lieux : Windows, RTX 3060 Laptop GPU

FAQ : Qu'est-ce que l'optimiseur de noyau CUDA agentique ?

C'est un système qui utilise des agents d'IA pour générer, tester et affiner automatiquement des noyaux CUDA en fonction des descriptions de charges de travail, en s'appuyant sur LangGraph pour la gestion des flux de travail et sur Nsight Compute pour le profilage des performances.