HeadlinesBriefing favicon HeadlinesBriefing.com

Забывание LLM и дедлайн робота 33 мс

Towards Data Science •
×

Большинство рантаймов для инференса LLM игнорируют физические дедлайны. Новый CUDA-рантайм для Qwen2.5-Coder-1.5B-Instruct отказывается запускаться, если не может завершиться в цикле управления роботом в 33 мс, вытесняет KV-кэш по смыслу (косинусное сходство), а не по возрасту, и использует lock-free двойной буфер. Он избегает переполнения VRAM от непрерывных видеопотоков, предотвращает пропуски дедлайнов цикла управления и справляется с камерой 60 Гц, опережающей рассуждение. Построен полностью на рукописном CUDA — без cuBLAS или libtorch — на одной облачной GPU NVIDIA Hopper (sm_90) с потолком VRAM 8 ГБ, смоделированным в коде, а не измеренным на пограничных устройствах вроде Jetson. Архитектура разделяет восприятие, контроль допуска и рассуждение: камера пишет в lock-free буфер, контроллер допуска проверяет выполнимость против дедлайна 33 мс плюс 2 мс запаса безопасности, затем передает кадры в рукописный трансформер. Репозиторий Github — https://github.com/Anubhab Banerjee/vla-edge-backend1. Камера работает на 60 Гц (16,7 мс/кадр), а модель должна решать и действовать за 33 мс — быстрее моргания человека. Это архитектура, а не бенчмарк.