HeadlinesBriefing favicon HeadlinesBriefing.com

Agentischer CUDA-Kernel-Optimierer mit LangGraph

Hacker News •
×

Dieses Projekt stellt einen agentischen CUDA-Kernel-Optimierer vor, der Arbeitslastbeschreibungen durch automatisierte Codegenerierung, Korrektheitsprüfungen, Benchmarking und Verfeinerung in GPU-Implementierungen umwandelt. Mit LangGraph betrieben, erkundet der Agent Kernelimplementierungen und Startkonfigurationen, fragt GPU-Eigenschaften ab und kann die NVIDIA-Dokumentation zur Optimierungsberatung durchsuchen. Außerdem überprüft er Nsight Compute-Zähler, um sein nächstes Experiment zu informieren. Jedes Experiment wird aufgezeichnet, und die schnellste validierte Implementierung wird beibehalten.

Das Modell kann sowohl den Kernelcode als auch die Startkonfigurationen pro Fall ändern. Ein eigenständiges C++-Harness kompiliert Kerne mit NVRTC, startet sie über die CUDA-Treiber-API und speichert die Ausgaben. Python übernimmt den Vergleich und die Kandidatenauswahl. Das System erfordert Python 3.12+, eine NVIDIA-GPU und einen kompatiblen CUDA-Toolkit/Treiber sowie CMake 3.24+ und einen C++17-Compiler. Die Einrichtung umfasst das Erstellen einer virtuellen Umgebung, das Installieren von Abhängigkeiten und das Konfigurieren des Builds mit Visual Studio 2026.

Benutzer können den Optimierer mit einer Arbeitslastbeschreibung ausführen, wie etwa „Single-precision GEMM mit rechteckigen Matrizen“, und eine maximale Anzahl von Iterationen angeben. Das Standardmodell ist gpt-5-mini mit mittlerem Reasoning-Aufwand, und die API-Nutzung wird dem Benutzerkonto in Rechnung gestellt. Optionale Flags ermöglichen das Profiling mit Nsight Compute und das Abrufen von NVIDIA-Forschungsleitlinien bevor Kerne generiert werden.

Wichtige Entitäten: Unternehmen: NVIDIA, OpenAI | Orte: Windows, RTX 3060 Laptop GPU

Häufig gestellte Fragen: Was ist der agentische CUDA-Kernel-Optimierer?

Es ist ein System, das KI-Agenten verwendet, um CUDA-Kerne basierend auf Arbeitslastbeschreibungen automatisch zu generieren, zu testen und zu verfeinern, wobei LangGraph für das Workflow-Management und Nsight Compute für das Leistungs-Profiling genutzt wird.