arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-10 至 2026-08-10 共收录 20 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 19 篇

2512.22539 2026-08-10 cs.RO cs.CV 版本更新 94%

VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models

VLA-Arena:一个用于基准测试视觉-语言-动作模型的开源框架

Borong Zhang, Jiahao Li, Jiachen Shen, Yuhao Zhang, Yishuai Cai, Lu Liu, Hailu Ji, Yuanpei Chen, Juntao Dai, Jiaming Ji, Yaodong Yang

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出VLA-Arena基准,通过三正交轴(任务结构、语言命令、视觉观察)量化任务难度,系统评估视觉-语言-动作模型的能力边界与失败模式。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10055 2026-08-10 cs.RO 版本更新 94%

STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations

STRONG-VLA: 多模态扰动下视觉-语言-动作模型的解耦鲁棒性学习

Yuhan Xie, Yuping Yan, Yunqi Zhao, Handing Wang, Yaochu Jin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xidian University(西安电子科技大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出STRONG-VLA框架,通过解耦鲁棒性学习与任务对齐优化,提升多模态扰动下的视觉-语言-动作模型鲁棒性与任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07361 2026-08-10 cs.RO cs.CV 新提交 91%

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。

Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07314 2026-08-10 cs.RO cs.CV 新提交 91%

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

TEMPO:面向视觉-语言-动作模型的语义-动作解耦强化学习后训练

Ziheng Liu, Quantao Yang

机构 * School of Computer Science and Technology, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出TEMPO框架,通过解耦语义投影层与动作专家采用双时间尺度RL后训练,提升VLA模型在操作任务上的性能,在基准与真实任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06729 2026-08-10 cs.RO cs.CV 新提交 91%

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01035 2026-08-10 cs.RO cs.AI cs.CV 版本更新 91%

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

WAM-Diff2:面向高效自动驾驶视觉-语言-动作(VLA)的分层自回归到扩散蒸馏

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 WAM-Diff2通过三阶段分层蒸馏策略,将预训练自回归VLA模型转化为高效扩散模型,缓解暴露偏差、实现与基线相当性能,解码速度提升2.8倍,结合系统级优化后达15.1倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24485 2026-08-10 cs.RO 版本更新 91%

τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision

τ:从未来视觉监督中学习触觉增强的视觉-语言-动作模型

Ning Cheng, Jinan Xu, Wanlin Li, Yangzhi Chen, Jing Gao, Yiqun Wang, Kelan Peng, Wenjuan Han

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 研究旨在解决学习触觉表示并应用于VLA模型的挑战,提出τ框架从未来视觉监督学习动作条件时空触觉表示,结合视觉语言特征用于动作生成,引入TacAura数据集,实验证明其性能优于现有模型且能泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18112 2026-08-10 cs.RO 版本更新 91%

EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation

EchoVLA:用于VLA驱动移动操作的协同声明记忆

Min Lin, Xiwen Liang, Bingqian Lin, Jingzhi Liu, Zijian Jiao, Kehan Li, Ziang Yan, Yu Sun, Weijia Liufu, Yuhan Ma, Jiarui Hu, Yuecheng Liu, Shen Zhao, Yuzheng Zhuang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University, Shenzhen, China(中山大学深圳校区) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Huawei Noah's Ark Lab, China(华为诺亚方舟实验室)

专题命中 VLA模型 :VLA(title_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 EchoVLA通过协同声明记忆提升移动操作性能,结合场景与事件记忆,利用注意力融合指导基臂策略,实现高效导航与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06434 2026-08-10 cs.RO cs.LG 新提交 91%

Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection

快速且精准:一种通过环境感知模型选择的自适应VLA推理框架

Yuewei Sun, Lang Qin, Zechuan Tian, Jingwen Li, Guiqin Wang, Shengzeng Huo, Wenxin Ren, Tao Fang, Xiaochen Zhang, Guanqing Deng, Xiang Wang, Xiaowen Dong, Qinghai Guo, Yuxin Ma

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 本文提出环境感知模型选择(EMS)自适应VLA推理框架,通过解耦双系统与强化学习切换策略,在LIBERO基准及真实双臂任务中平衡了VLA的推理速度与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06688 2026-08-10 cs.RO 新提交 90%

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

CrossTracer:基于VLA模型推理与轨迹残差自适应的跨 embodiments 导航

Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

机构 * Peng Cheng Laboratory(鹏城实验室) Southern University of Science and Technology(南方科技大学) Innovation Investment Research Institute(创新投资研究院) Soochow University(苏州大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 本研究提出跨 embodiment 导航框架 CrossTracer,通过 VL-Tracer 和 CE-Adapter 优化轨迹,在 NaviTrace 基准得分 45.68,优于 Gemini-2.5-Pro,实际部署于轮式、腿式机器人效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06965 2026-08-10 cs.RO 新提交 85%

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

面向相机鲁棒性的视觉-语言-动作策略的跨视图动作一致性

Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

机构 * Tsinghua University(清华大学) Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学研究所) Faculty of Science, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学理学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本研究针对视觉-语言-动作策略的相机鲁棒性问题,提出跨视图动作一致性正则化方法,在LIBERO-Plus数据集及真实机器人任务上均显著提升了相机扰动下的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04527 2026-08-10 cs.RO 版本更新 84%

Retrieve in Time, Correct in Frequency

及时检索,频率校正

Yuze Fan, Yue Cao, Pengjie Gao, Haojia Gao, Guangqiu Guo, Ziyue Zhang, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

机构 * Research Institute of Tsinghua University in Shenzhen(清华大学深圳研究院) Everwise-Tech Co., Ltd.(恒智慧科技有限公司) Tongji University(同济大学) Fudan University(复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究针对冻结 VLA 策略长 horizon 操作的误差问题,提出无需训练的 RTCF 框架,通过渐进式记忆对齐和低频残差转移,在 LIBERO 实验中提升了操作成功率且延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06994 2026-08-10 cs.RO cs.AI 新提交 84%

Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models

将意图与轨迹解耦:面向世界动作模型的表示演绎框架

Xiangkai Ma, Yue Ma, Junjie Wang, Sheng Xu, Mingyang Li, Han Zhang, Yuzheng Zhuang, Wenzhong Li, Zhihao Yuan

机构 * NJU(南京大学) HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) THU(清华大学) Joy Future Academy, JD(京东探索研究院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 针对现有世界动作模型的表示纠缠问题,提出PILOT的表示演绎框架,解耦运动语义与轨迹细节,提升复杂机器人操纵任务的性能与可解释性,兼具少样本微调及架构迁移的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 84%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-10 cs.AI cs.CV cs.RO 新提交 83%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08266 2026-08-10 q-bio.QM physics.comp-ph 71%

An open-source computational framework for immersed fluid-structure interaction modeling using FEBio and MFEM

一种用于基于FEBio和MFEM的浸没流固耦合建模的开源计算框架

Ryan T. Black, Steve A. Maas, Wensi Wu, Jalaj Maheshwari, Tzanio Kolev, Jeffrey A. Weiss, Matthew A. Jolley

专题命中 VLA模型 :action model(title)

AI总结 本文提出一种开源框架,结合MFEM和FEBio实现高效流固耦合建模,用于生物力学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07123 2026-08-10 cs.HC cs.PF physics.data-an 新提交 50%

Thermodynamic Human-Computer Interaction

热力学人机交互

Uzafir Ahmad Rafaq, Muaz Hassan, Ali Muzaffar

专题命中 VLA模型 :action model(abstract)

AI总结 该研究提出一种基于热力学的人机交互统一框架,可跨交互模态扩展、无需训练数据且评估时间为O(1),在网页预取任务中取得1.37的预取点击比和98.1%的目标预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17072 2026-08-10 cond-mat.stat-mech physics.bio-ph physics.chem-ph 版本更新 50%

Floquet Driving of Enzymatic Reactions: Counting Statistics and Long-Time Currents

酶促反应的弗洛凯驱动:计数统计与长时间电流

Yuki Watanabe, Yuki Ishiguro, Takashi Oka

专题命中 VLA模型 :action model(abstract)

AI总结 研究在时变控制下化学反应动力学,通过发展弗洛凯理论计算电流及其计数统计,以离散弗洛凯驱动的环磷酸腺苷生产生化系统为例,得到相关解析表达式和数值结果,为周期性驱动化学反应的弗洛凯分析奠定基础。

Comments 13+7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10403 2026-08-10 nucl-ex nucl-th 50%

Quantifying uncertainty in physics-based predictions of rare-isotope production cross sections via Bayesian-inspired model averaging across nuclear mass tables

通过基于贝叶斯的模型平均方法量化基于物理的稀有同位素生产截面预测中的不确定性

O. B. Tarasov

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于贝叶斯的模型平均方法,通过结合多个核质量表的AA计算,量化稀有同位素生产截面预测中的不确定性。

Comments 14 pages, 4 figures; Submitted to Phys. Rev. C

Journal ref Phys. Rev. C 114, 024603 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 1 篇

2608.06165 2026-08-10 cs.SD cs.AI cs.MM 版本更新 57%

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.AI

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏