HeadlinesBriefing favicon HeadlinesBriefing.com

LLM の忘却とロボット 33ms デッドライン

Towards Data Science •
×

ほとんどの LLM 推論ランタイムは物理的なデッドラインを無視します。Qwen2.5-Coder-1.5B-Instruct 向けの新しい CUDA ベースのランタイムは、33ms のロボット制御サイクル内で完了できない場合は起動を拒否し、KV キャッシュを意味(コサイン類似度)で古さではなく削除し、ロックフリーのダブルバッファを使用します。継続的なビジョンストリームからの VRAM オーバーフローを防ぎ、制御ループのデッドラインミスを防ぎ、推論を上回る 60Hz カメラを処理します。手書き CUDA のみで構築 — cuBLAS も libtorch も不使用 — 単一のクラウド NVIDIA Hopper GPU (sm_90) 上で、コード内でモデル化された 8GB VRAM 上限で動作し、Jetson などのエッジデバイスでの実測ではありません。アーキテクチャは知覚、アミッション制御、推論を分離: カメラがロックフリーバッファに供給し、アミッションコントローラが 33ms のデッドラインに 2ms の安全マージンを加えた条件で実行可能性を検証し、フレームを手書きトランスフォーマーに渡します。GitHub リポジトリは https://github.com/Anubhab Banerjee/vla-edge-backend1 です。カメラは 60Hz (16.7ms/フレーム) で動作し、モデルは 33ms 内に判断し行動しなければなりません — 人間のまばたきより高速です。これはアーキテクチャであり、ベンチマークではありません。