HeadlinesBriefing favicon HeadlinesBriefing.com

Oubli LLM et échéance robot 33 ms

Towards Data Science •
×

La plupart des runtimes d'inférence LLM ignorent les échéances physiques. Un nouveau runtime basé sur CUDA pour Qwen2.5-Coder-1.5B-Instruct refuse de démarrer s'il ne peut pas terminer dans un cycle de contrôle robot de 33 ms, évite le cache KV par signification (similarité cosinus) au lieu de l'âge, et utilise un double tampon sans verrou. Il évite le débordement VRAM des flux de vision continus, prévient les manquements d'échéance de la boucle de contrôle, et gère une caméra 60 Hz qui dépasse le raisonnement.

Construit entièrement en CUDA écrit à la main — sans cuBLAS ni libtorch — sur un seul GPU NVIDIA Hopper cloud (sm_90) avec un plafond VRAM de 8 Go modélisé dans le code, non mesuré sur des appareils edge comme Jetson. L'architecture sépare perception, contrôle d'admission et raisonnement : la caméra alimente un tampon sans verrou, un contrôleur d'admission vérifie la faisabilité contre l'échéance de 33 ms plus 2 ms de marge de sécurité, puis transmet les frames à un transformer écrit à la main. Le dépôt Github est https://github.com/Anubhab Banerjee/vla-edge-backend1.

La caméra fonctionne à 60 Hz (16,7 ms/image) et le modèle doit décider et agir en 33 ms — plus vite qu'un clignement humain. C'est une architecture, pas un benchmark.