arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-11 至 2026-08-11 共收录 21 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 20 篇

2608.07621 2026-08-11 cs.AI cs.CV cs.RO 新提交 94%

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

CMU-Drive与V2V-VLA:具备推理能力的协同多智能体统一驾驶基准及车对车视觉-语言-动作模型

Hsu-kuang Chiu, Stephen F. Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出协同多智能体统一驾驶基准CMU-Drive及车对车视觉-语言-动作模型V2V-VLA,解决现有VLA模型缺乏协同能力的问题,构建了协同自动驾驶研究的首个基准并将相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07619 2026-08-11 cs.RO 新提交 92%

GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning

GWM-VLA:面向视觉-语言-动作学习的几何感知隐式世界建模

Yanping Zhao, Hang Yu, Yiwei Wang, Chen Ye, Siyu Tian, Di Zhang, Qingjun Wang, Qian Chen, Junqiao Zhao, Chen Ye, Guang Chen

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.RO

AI总结 针对VLA模型在视觉/环境变化下性能下降问题,提出GWM-VLA框架,通过几何感知多视角编码等技术提升模型鲁棒性,经仿真和真实环境实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08725 2026-08-11 cs.RO 新提交 91%

WA-SpecDec: World-Aware Speculative Decoding for Vision-Language-Action Models

WA-SpecDec:面向视觉-语言-动作模型的世界感知投机解码

Zikang Wen, Yuning Zhang, Dong Yuan

机构 * The University of Sydney(悉尼大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出WA-SpecDec框架,在VLA预填充阶段注入世界模型的物理场景感知,在不改变放宽接受规则的前提下,提升了任务成功率、实现1.5倍匹配成功率加速并降低近接触失败率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 89%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.CV

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08904 2026-08-11 cs.CV cs.AI cs.LG 新提交 88%

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交 86%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 VLA模型 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);action model(abstract,abstract_cn);分类 cs.RO

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09381 2026-08-11 cs.RO 新提交 85%

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

JEPA-WAM:基于联合嵌入世界建模的视觉-语言-动作策略学习

Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

机构 * XYZ Embodied AI(XYZ具身智能)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO

AI总结 该研究提出JEPA-WAM,一种构建于预训练V-JEPA空间的隐式WAM,通过共享预测器耦合隐式转移预测与动作生成,在LIBERO-Plus等数据集上取得优异的机器人操作策略性能,且泛化能力强。

Comments 22 pages, 7 figures. Project page: https://spritewithoutice.github.io/JEPA_WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 84%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09125 2026-08-11 cs.RO 新提交 84%

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation

可靠双臂手术子任务操作的轨迹发散 horizon 决策

Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren

机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学) Huawei Technologies Co. Ltd.(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现有VLA策略在手术操作中易累积误差的问题,提出TDHD机制,构建双臂手术基准并收集600个演示,实验显示其可提升器械和组织操作的成功率。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08839 2026-08-11 cs.RO cs.CV 新提交 84%

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ola Dimensions(奥拉维度公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09516 2026-08-11 cs.RO 新提交 83%

HarnessWAM: Bridging Prediction and Deliberation in World Action Models

HarnessWAM:弥合世界动作模型中的预测与审议差距

Zhaopeng Gu, Bingke Zhu, Tianxi Lin, Guibo Zhu, Yingying Chen, Kai Wang, Tingyu Yuan, Chaoyang Zhao, Zhaowen Li, Peng Su, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司) Beijing Institute of Technology(北京理工大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对世界动作模型的预测-审议差距,提出HarnessWAM框架,通过双时间尺度反馈环等机制,在两个基准数据集上取得最优任务成功率,扩展了WAMs的具身任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09492 2026-08-11 cs.RO 新提交 83%

Rethink Before You Execute: Adaptive Execution for World Action Models

执行前再思考:世界动作模型的自适应执行

Feng Ye, Yiming Zhao, Yong Yu, Hongxu Zhou, Yong Pan, Yuan Xue, Peng Jia, Chuanmin Jia

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文针对世界动作模型(WAMs)的固定执行 horizon 缺陷,提出自适应执行方案TempoWAM,经实验可改善WAM执行的效率-成功率权衡,在真实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 83%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08749 2026-08-11 cs.RO 新提交 81%

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

OnEvoMemory:通过机器人在线试跑演化预训练机器人策略的记忆机制

Zhongxi Chen, Shenqi Zong

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 针对现有机器人记忆机制依赖外部模型的问题,提出OnEvoMemory价值引导记忆模块,结合离线初始化与在线试跑优化记忆选择,提升了基础VLA策略在长时程机器人操作中的性能。

Comments 6 pages, 1 figure. Accepted as a poster at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09896 2026-08-11 astro-ph.SR astro-ph.EP 新提交 80%

Nascent Embedded-protostar Survey in Taurus (NEST) II: Measuring Dust Mass, Disk Size, and Gas Mass

金牛座新生原恒星包层嵌入调查(NEST)II:测量尘埃质量、盘大小与气体质量

Noshin Yesmin, Patrick Sheehan, John Tobin, Aislinn Coleman-Plante, Nicholas P. Ballering, Tyler L. Bourke, Josh Eisner, Hauyu Baobab Liu, Zhi-Yun Li

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究针对金牛座26个原恒星盘系统,利用ALMA与VLA观测及CO同位素体建模,测量了不同波段下的尘埃、气体质量与盘尺寸,明确了金牛座原恒星盘的相关特性及气体尘埃比范围。

Comments 31 pages, 11 Figures, Figure 10 and 11 are figure sets with 28 figures and 58 figures respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08275 2026-08-11 astro-ph.GA 新提交 80%

The Quasar Feedback Survey: Ionised Outflows in type 2 QSOs with MUSE data

类星体反馈巡天:利用MUSE数据研究2型类星体中的电离外流

M. Bianchin, C. M. Harrison, T. Costa, V. Mainieri, R. A. Riffel, G. Venturi, D. Kakkad, C. Ramos Almeida, P. H. Cezar, S. Ward, A. Girdhar, S. Molyneux, L. Ulivi, E. P. Farina, J. Mullaney, F. Arrigoni Battaia

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究利用VLT/MUSE及VLA数据,研究18个高光度2型类星体的电离外流,发现电子密度与外流速度正相关,强调准确电子密度测定对提升外流参数精度的重要性,为外流模拟提供参考。

Comments 23 pages, 23 figures (16 on the appendix), submitted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交 57%

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08632 2026-08-11 cs.AI 新提交 57%

A QUBO-Inspired Computational Framework for Airport Landside Bottleneck Diagnosis and Dynamic Dispatch Optimization

一种受QUBO启发的机场陆侧瓶颈诊断与动态调度优化计算框架

Wuming Lei, Xiaobin Li, Mingyan Sun, Jianing Long, Yulin Tong, Yanbin Gao

机构 * East China Jiaotong University(华东交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本研究针对机场陆侧高峰耦合拥堵问题,提出受QUBO启发的计算框架,通过5分钟状态模型与多指标诊断瓶颈,采用两种调度方案优化,在两大机场测试中显著缩减旅客队列,且具备鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07979 2026-08-11 stat.ME math.ST stat.TH 新提交 50%

Sparse departures from independence in two-way tables: a heteroscedasticity profile and detection boundary, an adaptive higher-criticism gate, and an assumption-lean exact anchor

双向表中独立性的稀疏偏离:异方差轮廓与检测边界、自适应高阶批评门限及假设宽松的精确锚点

William J. Dwyer

专题命中 VLA模型 :action model(abstract)

AI总结 本文针对双向表独立性的稀疏偏离问题,提出含异方差轮廓与检测边界的理论,给出自适应高阶批评门限及精确锚点检验,验证了5543个表格语料库中三分之二采用精确锚点的结论。

Comments 29 pages, 11 figures, 4 tables. Reproducibility package: doi:10.5281/zenodo.21844797

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2608.07895 2026-08-11 cs.RO cs.LG 新提交 62%

Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations

多模态机器人演示中指令-轨迹不匹配的审计

Simon Holk, Ryosuke Takanami, Tatsuya Matsushima, Yusuke Iwasawa, Yutaka Matsuo, Yueh-Hua Wu, Kei Ota

机构 * AI Robot Association (AIRoA)(人工智能机器人协会(AIRoA)) The University of Tokyo(东京大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 针对多模态机器人演示中指令-轨迹不匹配问题,提出无需训练的MMPF审计框架,在LIBERO基准及真实机器人数据上实现最优ITM检测与标签修正,可提升下游策略学习性能并展示过滤演示的权衡。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏