DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation
DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作
机构 * Institute for Artificial Intelligence(人工智能研究院) ; School of Integrated Circuits, Peking University(集成电路学院,北京大学) ; Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) ; School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) ; Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO
AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。
Comments DAC 2026