HeadlinesBriefing favicon HeadlinesBriefing.com

Esquecimento de LLM e prazo de robô de 33 ms

Towards Data Science •
×

A maioria dos runtimes de inferência de LLM ignora prazos físicos. Um novo runtime baseado em CUDA para Qwen2.5-Coder-1.5B-Instruct se recusa a iniciar se não puder terminar dentro de um ciclo de controle de robô de 33 ms, evicta o cache KV por significado (similaridade de cosseno) em vez de idade, e usa um buffer duplo sem trava. Evita overflow de VRAM de streams de visão contínuos, previne falhas de prazo no loop de controle e lida com uma câmera de 60 Hz que supera o raciocínio.

Construído inteiramente em CUDA escrito à mão — sem cuBLAS ou libtorch — em uma única GPU NVIDIA Hopper na nuvem (sm_90) com teto de 8 GB de VRAM modelado no código, não medido em dispositivos edge como Jetson. A arquitetura separa percepção, controle de admissão e raciocínio: a câmera alimenta um buffer sem trava, um controlador de admissão verifica viabilidade contra o prazo de 33 ms mais 2 ms de margem de segurança, então passa frames para um transformer escrito à mão. O repositório Github é https://github.com/Anubhab Banerjee/vla-edge-backend1.

A câmera roda a 60 Hz (16,7 ms/frame) e o modelo deve decidir e agir em 33 ms — mais rápido que um piscar humano. Isso é uma arquitetura, não um benchmark.