摘要
rMuscle 在相似的重复 VLA 执行之间缓存视觉 token 输出与神经元激活模式。作者在 RTX 4090、Jetson Thor、LIBERO、RoboTwin 与真实机械操作任务上报告推理加速 1.29 至 1.42 倍,同时保持原始真实机器人成功率。收益主要面向重复的工厂型任务,而不是通用机器人行为。
为什么重要
对轨迹重复度高的机器人团队来说,复用内部状态可在不改 VLA 模型的前提下降低延迟。论文的工作负载假设较窄,也没有公开代码。部署前应在真实摄像头、任务变化与安全边界上复现。
技术细节
| 缓存 | 视觉 token Context Cache 与激活模式 Action Cache |
|---|---|
| 硬件 | RTX 4090 与 Jetson Thor |
| 评测 | LIBERO、RoboTwin 与真实操作 |
| 加速 | 1.29 至 1.42 倍 |
| 代码 | 未公开链接 |
标签
rMuscleVLAroboticscachingedge-inference