HeadlinesBriefing favicon HeadlinesBriefing.com

LLM 遗忘机制与机器人 33ms 截止时间

Towards Data Science •
×

大多数 LLM 推理运行时忽略物理截止时间。一个面向 Qwen2.5-Coder-1.5B-Instruct 的新 CUDA 运行时,若无法在 33ms 机器人控制周期内完成则拒绝启动,按含义(余弦相似度)而非年龄驱逐 KV 缓存,并使用无锁双缓冲。它避免了持续视觉流导致的 VRAM 溢出,防止控制环截止时间错失,并能应对 60Hz 摄像头超越推理速度的情况。完全采用手写 CUDA 构建 —— 无 cuBLAS 或 libtorch —— 在单张云端 NVIDIA Hopper GPU (sm_90) 上运行,代码中建模 8GB VRAM 上限,而非在 Jetson 等边缘设备上实测。架构将感知、准入控制和推理分离:摄像头馈入无锁缓冲区,准入控制器根据 33ms 截止时间加 2ms 安全边际检查可行性,再将帧传给手写 Transformer。Github 仓库为 https://github.com/Anubhab Banerjee/vla-edge-backend1。摄像头以 60Hz 运行(16.7ms/帧),模型必须在 33ms 内决策并行动 —— 比人眨眼还快。这是一种架构,而非基准测试。