HeadlinesBriefing favicon HeadlinesBriefing.com

Pelupa LLM & Deadline Robot 33 ms

Towards Data Science •
×

Sebagian besar runtime inferensi LLM mengabaikan deadline fisik. Runtime baru berbasis CUDA untuk Qwen2.5-Coder-1.5B-Instruct menolak memulai jika tidak bisa selesai dalam siklus kontrol robot 33 ms, membuang cache KV berdasarkan makna (kemiripan kosinus) bukan usia, dan menggunakan double buffer lock-free. Mencegah overflow VRAM dari aliran visi kontinu, mencegah kegagalan deadline loop kontrol, dan menangani kamera 60 Hz yang mengungguli reasoning.

Dibangun sepenuhnya dengan CUDA tangan — tanpa cuBLAS atau libtorch — pada single GPU NVIDIA Hopper cloud (sm_90) dengan batas 8 GB VRAM dimodelkan di kode, bukan diukur di edge device seperti Jetson. Arsitektur memisahkan persepsi, kontrol penerimaan, dan reasoning: kamera mengisi buffer lock-free, controller penerimaan cek kelayakan terhadap deadline 33 ms ditambah 2 ms safety margin, lalu meneruskan frame ke transformer tangan. Repo Github adalah https://github.com/Anubhab Banerjee/vla-edge-backend1.

Kamera berjalan 60 Hz (16,7 ms/frame) dan model harus putuskan dan bertindak dalam 33 ms — lebih cepat dari kedipan mata manusia. Ini arsitektur, bukan benchmark.