HeadlinesBriefing favicon HeadlinesBriefing.com

Olvido de LLM y plazos de robot de 33 ms

Towards Data Science •
×

La mayoría de los runtimes de inferencia de LLM ignoran los plazos físicos. Un nuevo runtime basado en CUDA para Qwen2.5-Coder-1.5B-Instruct se niega a iniciar si no puede terminar dentro de un ciclo de control de robot de 33 ms, evicta la caché KV por significado (similitud del coseno) en lugar de por antigüedad, y usa un doble búfer sin bloqueos. Evita el desbordamiento de VRAM por flujos de visión continuos, previene fallos de plazo en el bucle de control y maneja una cámara de 60 Hz que supera al razonamiento.

Construido completamente en CUDA escrito a mano — sin cuBLAS ni libtorch — en una sola GPU NVIDIA Hopper en la nube (sm_90) con un techo de 8 GB de VRAM modelado en código, no medido en dispositivos edge como Jetson. La arquitectura separa percepción, control de admisión y razonamiento: la cámara alimenta un búfer sin bloqueos, un controlador de admisión verifica la factibilidad contra el plazo de 33 ms más 2 ms de margen de seguridad, y luego pasa los frames a un transformer escrito a mano. El repositorio de Github es https://github.com/Anubhab Banerjee/vla-edge-backend1.

La cámara funciona a 60 Hz (16,7 ms/frame) y el modelo debe decidir y actuar en 33 ms — más rápido que un parpadeo humano. Esto es una arquitectura, no un benchmark.