EdgeVLA: Efficient Vision-Language-Action Models
机构 * K-Scale Labs(K-Scale实验室) ; McGill University(麦吉尔大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
Journal ref IROS-MoMA3 Workshop 2024
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
机构 * K-Scale Labs(K-Scale实验室) ; McGill University(麦吉尔大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
Journal ref IROS-MoMA3 Workshop 2024
机构 * Institute for AI, Peking University(人工智能研究院,北京大学) ; PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室) ; School of Computer Science, Peking University(北京大学计算机学院)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
Comments 70 pages, 5 figures
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Westlake University(西湖大学) ; Monash University(墨尔本大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO
Comments 14 pages
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Electronic Science and Technology of China(电子科学与技术大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
Comments Website: https://switchvla.github.io
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Zhangjiang Laboratory(张江实验室)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV
机构 * Huazhong University of Science and Technology(华中科技大学) ; Lehigh University(莱斯大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.AI
Comments 19 pages, 12 figures, 6 tables
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
机构 * Skoltech(斯克利切夫斯克技术大学)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);分类 cs.RO、cs.CV、cs.AI
Comments HRI 2025
机构 * University of Alberta(阿尔伯塔大学) ; The University of Tokyo(东京大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
Comments To appear in FSE '25 (Proceedings of ACM Software Engineering, Vol. 2, Issue FSE, Article FSE073), 24 pages, 7 figures
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV
Comments Accepted by Neurips 2024
TempoVLA: 学习速度可控的视觉-语言-动作策略
机构 * RUC(中国人民大学) ; FDU(福建大学) ; UNC(北卡罗来纳大学教堂山分校)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO、cs.AI
AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。
MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽
机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO、cs.AI
AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。
Comments Accepted as main conference paper at ACL 2026
ScoutVLA:面向开放世界具身问答的无人机中心主动感知双专家VLA模型
机构 * National Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(国防科技大学数字智能建模与仿真国家重点实验室) ; GigaAI
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI
AI总结 针对无人机在室外具身问答中细粒度视角调整不足的问题,提出ScoutVLA模型,采用解耦双专家架构(视觉语言专家推断语义意图,动作专家生成连续视角调整轨迹),并通过知识隔离机制平衡连续控制与语义推理,在仿真和真实实验中显著优于基线方法。
从噪声到意图:基于残差桥的生成式VLA策略锚定
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.AI
AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。
Comments Accepted to ICML 2026
VLGA:用于自动驾驶的视觉-语言-几何-动作模型
机构 * Uber AV Labs(Uber自动驾驶实验室) ; University of Virginia(弗吉尼亚大学)
专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV
AI总结 提出VLGA模型,通过引入几何作为第四模态,利用逐像素点图回归损失监督,实现密集3D世界重建,在nuScenes和Bench2Drive上达到SOTA。
Comments Project page: https://yaojin17.github.io/VLGA/
WALL-WM:在事件关节处雕刻世界动作建模
机构 * X Square Robot Team(X Square机器人团队)
专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV
AI总结 提出WALL-WM世界动作模型,通过事件级视觉-语言-动作预训练解决固定长度动作块与语言、视觉、动作之间的粒度不匹配问题,实现跨语言、场景和任务的泛化,在大规模真实世界评估中达到最先进性能。
VGAS: 价值引导的动作块选择用于少样本视觉-语言-动作适应
机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.CV、cs.AI
AI总结 提出VGAS框架,通过生成-选择范式和价值引导的动作块选择,解决少样本VLA适应中的几何歧义问题,提升成功率和鲁棒性。
Comments Preprint
EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; XPeng Motors(小鹏汽车)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。
Comments 19 pages, 5 figures, 5 tables
机构 * NVIDIA ; National Taiwan University(国立台湾大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,comments);action model(abstract);分类 cs.RO、cs.CV、cs.AI
Comments NeurIPS 2025. Project page: https://jasper0314-huang.github.io/thinkact-vla/
从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力
机构 * New York University(纽约大学) ; Reflex ; Université de Montréal(蒙特利尔大学) ; Maastricht University(马斯特里赫特大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。
Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026
BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架
机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; Li Auto Inc.(理想汽车)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。
DLAM:带时间约束的分布隐式动作模型
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。
混合专家VLA中的涌现组合技能
专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO、cs.AI、cs.LG
AI总结 研究从专家演示端到端学习组合机器人策略的问题,用简化MoE动作头训练VLA,发现其能将任务分解,学习到的专家可跨任务重用,MoE在展示专家专业化时与整体基线性能匹配,向模块化、可解释机器人策略迈进。
Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026
像飞行员一样思考:细粒度长时程无人机导航
机构 * Colab ; Beihang University(北航) ; Meituan(美团) ; National University of Singapore(新加坡国立大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。
AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI
AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。
Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA
PVI:插件式视觉注入用于视觉-语言-动作模型
机构 * Lionrock AI Lab(Lionrock人工智能实验室) ; China Merchants Group(中国商人集团)
专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出PVI模块,通过零初始化残差路径注入辅助视觉特征,提升视觉-语言-动作模型的时间信息处理能力,实验证明其在多阶段任务中优于静态图像特征。
为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估
机构 * Chosun University(全州大学) ; Seoul National University(首尔国立大学) ; Korea Institute for Curriculum and Evaluation(韩国课程评价院) ; Nanyang Technological University(南洋理工大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract)
AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。
机构 * University of Washington(华盛顿大学) ; DEVCOM ARL
专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.AI、cs.LG
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; Lambda Labs(Lambda实验室)
专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI