VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
机构 * GigaAI ; CASIA ; Tsinghua University(清华大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
机构 * GigaAI ; CASIA ; Tsinghua University(清华大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV
机构 * NICS-EFC Lab, Department of Electronic Engineering, Tsinghua University(清华大学电子工程系NICS-EFC实验室) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) ; Infinigence AI ; Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.AI、cs.LG
Comments 13 pages, 5 figures, Accepted by EMNLP 2025 (main conference)
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) ; University of Arizona(亚利桑那大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV、cs.AI
Comments 12 pages, 9 figures
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.LG
Comments 19 pages, 5 figures
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.LG
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV
Comments Accepted by ECCV2024
TORL-VLA:触觉引导的在线强化学习用于接触丰富操作
机构 * Meituan(美团) ; Beijing Institute of Technology(北京理工大学) ; Beihang University(北京航空航天大学) ; State Key Lab of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; China University of Mining and Technology (Beijing)(中国矿业大学(北京))
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出TORL-VLA框架,结合触觉反馈与在线强化学习,通过触觉导出的力矩感知VLA预测参考动作,并利用轻量在线RL模块优化动作,解决接触条件变化时的策略适应问题,在长时接触任务中提升成功率和执行效率。
Comments Project page: https://torl-vla.github.io/
HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; HKUST(GZ)(香港科技大学(广州)) ; Nanjing University(南京大学) ; Westlake Robotics(西湖机器人)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。
Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA
GeoAware-VLA: 基于隐式几何的视觉-语言-动作模型
机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 GeoAware-VLA通过整合几何先验提升视觉-语言-动作模型的视角不变性,显著提高零样本泛化能力,并在现实机器人平台中取得显著效果。
Comments Under Review, Project Page https://alisharey.github.io/GeoAware-VLA/
递归深度VLA:通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展
机构 * Stanford University(斯坦福大学) ; Technical University of Munich(慕尼黑技术大学) ; University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 RD-VLA通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展,提供恒定内存使用和高达80倍的推理加速。
Comments 11 Pages, Project page:https://rd-vla.github.io/
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; OpenHelix Team(OpenHelix团队) ; State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
Comments 28 pages; Project page: https://vla-adapter.github.io/; Github: https://github.com/OpenHelix-Team/VLA-Adapter; HuggingFace: https://huggingface.co/VLA-Adapter
机构 * Beijing Academy of Artificial Intelligence, BAAI(北京人工智能研究院) ; Institute for AI Industry Research (AIR), Tsinghua Univeristy(清华大学人工智能产业研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
Comments Accepted to CoRL 2025, project page: \url{https://zzongzheng0918.github.io/Torque-Aware-VLA.github.io/}
专题命中 VLA模型 :VLA(title,abstract);vision language action(title);action model(title);vision-language-action(abstract)
Comments Accepted to CoRL 2025; Github Page: https://long-vla.github.io
机构 * AIR, Tsinghua University(清华大學人工智能研究院) ; Bosch Research(博世研究) ; IIIS, Tsinghua University(清华大學人工智能研究院)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV
Comments Project page: https://github.com/ahydchh/Impromptu-VLA
将视觉-语言-动作模型进化为具备即时工具使用能力的智能体
机构 * Astribot(星舟机器人) ; Tsinghua University(清华大学) ; Juxi Tech(矩芯科技) ; IntelliFusion Inc.(智融公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI
AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。
Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings
DeepThinkVLA: 提升视觉-语言-动作模型的推理能力
机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) ; Gaoling School of Artificial Intelligence, Renmin University of China, China(中国人民大学 Gallagher 人工智能学院) ; Beijing Zhongguancun Academy, China(北京中关村学院)
专题命中 VLA模型 :vision-language-action(title,abstract_cn);action model(title);VLA(abstract,abstract_cn);vision language action(abstract)
AI总结 本文通过系统实验发现,Co-T推理需满足解码对齐和因果对齐两个条件,提出DeepThinkVLA模型在LIBERO等任务中取得显著提升。
Comments 26 pages, 7 figures, conference
VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架
机构 * Li Auto Inc.(理想汽车) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI
AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。
视觉语言动作模型的无验证测试时采样
机构 * KAIST(韩国科学技术院) ; Seoul National University(首尔国立大学) ; RLWRLD
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG
AI总结 针对视觉语言动作模型在高精度任务中的局限,提出无验证测试时缩放框架MG-Select,利用模型内部属性,通过参考动作令牌分布选最优动作,经联合训练改进参考分布,提升模型表现。
Comments Accepted to ICLR 2026. Project page: https://suhyeok-jang.github.io/mg-select/
视觉-语言-动作模型遇见世界模型:面向低空无线网络的具身智能体AI
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title)
AI总结 提出具身智能体无人机框架,以VLA模型为核心实现端到端决策,引入世界模型建模环境动态,通过记忆与反射机制形成闭环优化,实现低空无线网络的鲁棒自主控制。
针对视觉-语言-动作模型的成员推断攻击
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title)
AI总结 本文首次系统研究了针对视觉-语言-动作(VLA)模型的成员推断攻击(MIAs),提出了样本级和轨迹级的攻击设置,并展示了在多个VLA基准和模型上,攻击方法在黑盒环境下表现出色,揭示了VLA模型在隐私方面的高风险。
基于流的视觉-语言-动作模型的不确定性量化
机构 * TU Munich(慕尼黑工业大学) ; ETH Zurich(苏黎世联邦理工学院) ; MPI IS Tübingen(马克斯·普朗克智能系统研究所)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG
AI总结 提出利用速度场差异(VFD)量化流匹配模型中的认知不确定性,用于故障检测和主动微调,在LIBERO基准上实现高效任务适应。
Comments Project page: tum-lsy.github.io/uq_vla/. 28 pages, 12 figures
具身人工智能中视觉-语言-动作模型的综述
机构 * Chinese University of Hong Kong(香港中文大学) ; University of Bristol(布里斯托大学) ; Huawei Noah’s Ark Laboratory(华为诺亚实验室)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);language-conditioned robot(abstract)
AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。
Comments Project page: https://github.com/yueen-ma/Awesome-VLA
Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026
SSP:面向自动驾驶VLA模型的事件匹配Syn2Sim2Phy跨域评估框架
机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) ; Tongji Automotive Design & Research Institute Co., Ltd.(同济汽车设计研究院有限公司) ; Hubei Jingchu Humanoid Robot Co., Ltd.(湖北荆楚人形机器人有限公司) ; University of Chicago(芝加哥大学)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV
AI总结 本文提出SSP框架,通过锚定同一安全关键交互事件实现自动驾驶VLA模型的跨域评估,在合成、仿真、真实域中测得不同模型的性能差异,为VLA行为提供可复现的评估方法。
Deltoris:通过比特级稀疏性和推测性推理实现具身AI中的实时VLA推理
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.LG
AI总结 Deltoris作为算法-硬件协同设计框架,通过时间感知比特级稀疏性、推测性推理及定制加速器,实现具身AI中实时VLA推理,加速比显著且精度相当。
面向全身遥操作移动操作的全景感知VLA学习
机构 * Beihang University(北京航空航天大学) ; Shandong University(山东大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; Delta Intelligence(delta智能公司)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。
Comments 8 pages, 4 figures
多视图统一相机场:面向仅RGB多相机视觉-语言-动作(VLA)策略的几何形状动作表征
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 本研究针对多相机VLA策略的动作表征缺陷,提出仅训练用的MVUCF框架,通过几何相关目标优化后部署无额外推理开销,在LIBERO、RoboTwin等任务及真实人形实验中均取得显著性能提升。
Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。
Comments 13 pages, 3 figures, 4 tables
AC-VLA:通过组合学习实现稳健的分布外动作执行
机构 * Shenzhen Technology University(深圳技术大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Tongji University(同济大学) ; Great Bay University(大湾区大学)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究VLA模型在分布外泛化的问题,提出AC-VLA框架,含组合学习模块和状态条件不对称掩码策略,无需修改架构可集成到VLA主干,在LIBERO和LIBERO-OOD基准测试中,该框架在组合OOD任务上有显著改进,分布内性能良好。
Reflex:通过流推理实现实时VLA控制
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究针对流匹配VLA模型与实时机器人技术的不兼容问题,提出Reflex框架,利用时间步不变性属性实现实时流推理,通过分区缓存更新、引入自适应归一化层、异步管道和算子融合等方法,在基准测试中实现推理加速和稳定流,减少反应延迟。
Comments Accepted by ICML2026
VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA
机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) ; Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。