HeadlinesBriefing favicon HeadlinesBriefing.com

Optimizador de Núcleos CUDA Agéntico con LangGraph

Hacker News •
×

Este proyecto presenta un optimizador de núcleos CUDA agéntico que transforma descripciones de cargas de trabajo en implementaciones de GPU mediante generación automática de código, verificaciones de corrección, benchmarking y refinamiento. Impulsado por LangGraph, el agente explora implementaciones de núcleos y configuraciones de lanzamiento, consulta propiedades de la GPU y puede investigar la documentación de NVIDIA para obtener orientación de optimización. También inspecciona los contadores de Nsight Compute para informar su próximo experimento. Cada experimento se registra, y se retiene la implementación validada más rápida.

El modelo puede cambiar tanto el código del núcleo como las configuraciones de lanzamiento por caso. Un arnés C++ independiente compila núcleos con NVRTC, los lanza a través de la API de controlador de CUDA y guarda las salidas. Python maneja la comparación y la selección de candidatos. El sistema requiere Python 3.12+, una GPU de NVIDIA y un Toolkit/controlador de CUDA compatible, junto con CMake 3.24+ y un compilador C++17. La configuración implica crear un entorno virtual, instalar dependencias y configurar la construcción con Visual Studio 2026.

Los usuarios pueden ejecutar el optimizador con una descripción de carga de trabajo, como "GEMM de precisión simple con matrices rectangulares", y especificar un número máximo de iteraciones. El modelo predeterminado es gpt-5-mini con esfuerzo de razonamiento medio, y el uso de la API se factura a la cuenta del usuario. Banderas opcionales habilitan la generación de perfiles con Nsight Compute y la recuperación de orientación de investigación de NVIDIA antes de generar núcleos.

Entidades clave: Empresas: NVIDIA, OpenAI | Ubicaciones: Windows, RTX 3060 Laptop GPU

Preguntas frecuentes: ¿Qué es el optimizador de núcleos CUDA agéntico?

Es un sistema que utiliza agentes de IA para generar, probar y refinar automáticamente núcleos CUDA basados en descripciones de cargas de trabajo, aprovechando LangGraph para la gestión de flujos de trabajo y Nsight Compute para el perfilado de rendimiento.