arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-03 至 2026-07-03 共收录 19 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 17 篇

2603.06001 2026-07-03 cs.RO cs.AI cs.CV 版本更新 91%

Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration

恢复VLA模型中的语言基础:无需训练的注意力重校准方法

Ninghao Zhang, Bin Zhu, Shijie Zhou, Jingjing Chen

机构 * Tsinghua University(清华大学) Singapore Management University(新加坡管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对VLA模型在分布外指令下出现“语言盲视”问题,提出无需训练的注意力重校准方法IGAR,通过调整注意力分布恢复语言指令影响,在LIBERO基准和真实机器人上有效减少错误执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01658 2026-07-03 cs.CV 新提交 91%

Teaching Vision-Language-Action Models What to See and Where to Look

教视觉-语言-动作模型看什么和看哪里

Yuguang Yang, Canyu Chen, Zhewen Tan, Yizhi Wang, Zichao Feng, Chunyang Liu, Kehua Sheng, Juan Zhang, Linlin Yang, Baochang Zhang, Yan Wang, Bo Zhang, Xianbin Cao

机构 * School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) DiDi(滴滴出行) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV

AI总结 提出DriveTeach-VLA框架,通过驾驶感知视觉蒸馏和2D轨迹引导提示,教VLA模型关注驾驶相关区域,实现端到端自动驾驶轨迹预测,在NAVSIM和nuScenes上达到最优性能。

Comments The paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01378 2026-07-03 cs.RO cs.SY eess.SY 新提交 91%

Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching

基于约束流匹配的视觉-语言-动作模型神经符号安全引导

William English, Hao Zheng, Rickard Ewetz

机构 * UCF. EDU(UCF教育机构)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 针对VLA模型缺乏有效安全措施的问题,提出神经符号安全引导机制,通过约束流匹配在去噪过程中修正轨迹,实现预测性避碰,在SafeLIBERO上显著提升安全性和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11891 2026-07-03 cs.RO cs.SY eess.SY 版本更新 91%

VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer

VLSA: 具有即插即用安全约束层的视觉-语言-动作模型

Songqiao Hu, Zeyi Liu, Shuang Liu, Jun Cen, Zihan Meng, Shihefeng Wang, Xiang Li, Xiao He

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能与机器人研究院) TetraBOT DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出AEGIS架构,通过控制屏障函数构建即插即用安全约束层,集成到VLA模型中保证安全性与任务性能,在SafeLIBERO基准上障碍物避免率提升超50%,任务成功率提升近10%。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01715 2026-07-03 cs.RO 版本更新 91%

Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models

传输差异作为视觉-语言-动作模型的可靠性信号

Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Yicheng Feng, Chaoyi Xu, Sipeng Zheng, Qin Jin, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出DiG模块,通过计算切片Wasserstein传输代价作为可靠性信号,利用指数门控调节特征细化和训练损失,在分布偏移和长时域任务中显著提升VLA模型成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02322 2026-07-03 cs.RO cs.CV 新提交 91%

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

移动之眼:通过混合动态数据收集增强VLA空间泛化能力

Jincheng Tang, Yilong Zhu, Zhengyuan Xie, Jiang-Jiang Liu, Jiaxing Zhang

机构 * Lion Rock AI Lab, China Merchants Research Institute of Advanced Technology(狮岩人工智能实验室,中国商人先进科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Nankai University(南开大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对VLA模型空间泛化脆弱性问题,提出混合动态数据策略,结合连续相机运动与多样静态视角,减少虚假相关性,提升对未见相机位姿和物体配置的泛化能力。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01804 2026-07-03 cs.RO 新提交 91%

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) Zhejiang University(浙江大学) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18955 2026-07-03 cs.CV cs.RO 新提交 89%

Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos

运动聚焦的潜在动作使跨实体VLA训练能从人类自我中心视频中学习

Runze Xu, Yiluo Zhang, Jian Wang, Yu Wang, Jincheng Yu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Tianfu Jiangxi Laboratory(天府江西实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出基于潜在动作的框架,利用混合解耦VQ-VAE从无标签人类视频中提取通用动作先验,通过意图-感知解耦策略减少动作幻觉,仅需50条轨迹即可适配下游任务。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02466 2026-07-03 cs.RO cs.AI 新提交 88%

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

先学移动再学做事:面向VLA的任务无关预训练

Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出任务无关预训练(TAP)框架,先通过自监督逆动力学从廉价无标签交互数据学习可迁移运动先验,再用少量专家数据将先验与语言对齐,显著降低VLA模型对专家演示的依赖。

Comments Accepted to ICML 2026, 21 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02342 2026-07-03 astro-ph.GA 88%

The VLA-COSMOS 3 GHz Large Project: Polarised source counts and catalogue

VLA-COSMOS 3GHz大型项目:极化源计数与目录

S. Ranchod, S. A. Mao, R. P. Deane, V. Smolčić, J. D. Wagenveld, M. Bondi, K. Mooley, E. Schinnerer

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 通过处理VLA-COSMOS 3GHz大型项目的极化数据,进行相关测量和搜索,给出3GHz最深极化源计数,研究极化源计数频率演化,检测到65个极化源,未发现极化恒星形成星系。

Comments 13 pages, 10 figures (main text). Accepted for publication in Astronomy and Astrophysics (A&A)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28545 2026-07-03 cs.RO cs.CV 版本更新 82%

ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation

ManipArena: 通用机器人操作的综合现实世界评估

Yu Sun, Meng Cao, Yang Ping, Kaidong Zhang, Qingxuan Chen, Rongtao Xu, Liangwang Ruan, Xuecheng Chen, Dongxiu Liu, Yunxiao Yan, Zunnan Xu, Runze Xu, Charles Yang, Peilun Zhang, Xiaofan Li, Ruyi Gan, Liang Ma, Yuehao Yin, Jincheng Yu, Lufang Chen, Yuxin Liang, Peng Zhai, Hao Wang, Ivan Laptev, Ian Reid, Qian Wang, Xiaodan Liang

机构 * SYSU(中山大学) X SQUARE ROBOT MBZUAI(穆罕默德·本·扎耶德人工智能大学) Thsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 ManipArena通过标准化框架解决现有评估不足问题,提供真实场景下的多任务测试与多级泛化能力,支持长时移动操作与传感诊断,促进视觉-语言-动作模型和世界模型的发展。

Comments Technical report for CVPR 2026 Challenge ManipArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02503 2026-07-03 cs.RO 新提交 79%

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22435 2026-07-03 cs.RO cs.AI 版本更新 79%

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

CaP-X: 用于基准测试和改进机器人操作编码智能体的框架

Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

机构 * nvidia stanford(斯坦福大学) cmu(卡内基梅隆大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01938 2026-07-03 cs.RO cs.AI cs.CL cs.CV cs.LG 新提交 70%

PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation

PhysMani:基于物理原理的动态物体操作3D世界模型

Peng Yun, Shouwang Huang, Hao Li, Jinxi Li, Jianan Wang, Bo Yang

机构 * vLAR Group, The Hong Kong Polytechnic University(香港理工大学vLAR Group) Astribot

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出PhysMani框架,结合物理原理的3D高斯世界模型与未来感知动作策略模型,通过在线优化学习无散度高斯速度场预测动态,在16个任务基准上超越基线方法。

Comments ECCV 2026. Code and data are available at: https://github.com/vLAR-group/PhysMani

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02417 2026-07-03 cs.RO cs.CV cs.LG 新提交 67%

LIME: Learning Intent-aware Camera Motion from Egocentric Video

LIME: 从自我中心视频学习意图感知的相机运动

Boyang Sun, Jiajie Li, Yung-Hsu Yang, Chenyangguang Zhang, Tim Engelbracht, Sunghwan Hong, Cesar Cadena, Marc Pollefeys, Hermann Blum

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft(微软) University of Bonn(波恩大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出LIME模型,从自我中心视频中挖掘多意图相机运动监督,结合自回归观察增益输出与连续流匹配位姿头,实现语言条件相机运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01743 2026-07-03 cs.CV 新提交 57%

InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation

InterCMDM:用于自回归人体交互生成的块因果扩散

Qing Yu, Kent Fujiwara

机构 * LY Corporation(LY公司)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出InterCMDM块因果潜扩散框架,通过双流因果扩散Transformer和多重任务注意力掩码实现自回归双人交互生成,解决因果性缺失和时间漂移问题,在InterHuman和InterX上达到最优性能。

Comments Accepted to ECCV 2026, Project website: https://yu1ut.com/InterCMDM-HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05991 2026-07-03 eess.SP 版本更新 50%

Ray-Based Simulation of Scattering from Discretized Curved Bodies for Vehicular and ISAC Applications

基于射线的曲面散射仿真用于车辆和ISAC应用

Ainur Ziganshin, Enrico M. Vitucci, Wim Kotterman, Reiner Thomae, Christian Schneider, Vittorio Degli-Esposti

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种基于射线追踪的曲面散射建模方法,结合UTD理论与顶点衍射,通过优化曲面离散化策略提升计算效率和精度,验证了其在车辆传播和ISAC通道建模中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 语言条件控制 1 篇

2607.02222 2026-07-03 cs.RO cs.AI 新提交 62%

CoFL-S: Spatially Queryable Sector Flow Fields for Local Language-Conditioned Navigation

CoFL-S: 用于局部语言条件导航的空间可查询扇区流场

Haokun Liu, Zhaoqi Ma, Yicheng Chen, Wentao Zhang, Masaki Kitagawa, Zicen Xiong, Jinjie Li, Moju Zhao

机构 * Dragon Lab, Department of Mechanical Engineering, The University of Tokyo(龙实验室,机械工程系,东京大学)

专题命中 语言条件控制 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出CoFL-S,一种低层级视觉-语言-动作框架,通过预测机器人局部可见扇区上的语言条件流场并滚动生成连续轨迹,在连续时间Habitat基准测试中优于动作令牌和动作块基线,并实现零样本真实世界部署。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2607.02195 2026-07-03 cs.RO 新提交 70%

Bridge-WA: Predicting Where and How the World Changes for Robotic Action

Bridge-WA: 预测世界变化的位置和方式以支持机器人动作

Yongjie Bai, Hanting Wang, Mingtong Dai, Qijun Zhong, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出Bridge-WA轻量框架,通过蒸馏未来变化教师模型为三个紧凑先验,引导动作生成聚焦于场景变化的位置和方式,提升机器人操作的成功率和鲁棒性。

Comments 21 pages, 8 figures, https://hcplab-sysu.github.io/BRIDGE-WA

详情

展开后加载摘要…

URL PDF HTML 收藏