arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-17 至 2026-06-17 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2606.18043 2026-06-17 cs.RO cs.LG 新提交 91%

Uncertainty Quantification for Flow-Based Vision-Language-Action Models

基于流的视觉-语言-动作模型的不确定性量化

Ralf Römer, Maximilian Seeliger, Saida Liu, Ben Sturgis, Marco Bagatella, Daniel Marta, Andreas Krause, Angela P. Schoellig

机构 * TU Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院) MPI IS Tübingen(马克斯·普朗克智能系统研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 提出利用速度场差异(VFD)量化流匹配模型中的认知不确定性,用于故障检测和主动微调,在LIBERO基准上实现高效任务适应。

Comments Project page: tum-lsy.github.io/uq_vla/. 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17200 2026-06-17 cs.RO 新提交 91%

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

ACE-Ego-0:统一第一人称人类与机器人数据用于VLA预训练

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye, Tongyan Fang, Chunxiao Liu, Siyuan Huang, Jianbo Liu, Xiaogang Wang, Hongsheng Li

机构 * ACE Robotics CUHK MMLab(香港中文大学多媒体实验室) CUHK, Shenzhen(香港中文大学(深圳)) SJTU(上海交通大学) THU(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出ACE-EGO-0框架,通过可扩展的第一人称视频到动作管道和可靠性感知训练目标,统一人类与机器人数据用于VLA预训练,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17463 2026-06-17 cs.CV cs.RO 新提交 85%

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation

WeaveLA: 面向重复机器人操作的基于事件驱动的跨子任务潜在记忆编织

Shoujing Zhu, Zhenyang Liu, Fungmiu Wang, Jiafeng Wang, Bo Yue, Guiliang Liu, Simo Wu, Xiangyang Xue, Taiping Zeng

机构 * Fudan University(复旦大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shanghai Innovation Institute(上海创新研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对短窗口VLA策略缺乏跨子任务信息传递的问题,提出WeaveLA,通过事件触发将完成子任务压缩为潜在令牌并注入下一子任务的动作生成路径,在保持基础策略短窗口接口的同时实现轻量级跨子任务通道,在困难重复任务上成功率从0%提升至47.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 79%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17924 2026-06-17 cs.RO cs.AI 新提交 79%

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

PearlVLA:潜在空间中的渐进式具身动作计划精炼

Bochen Yang, Lianlei Shan

机构 * Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。

Comments 21 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17937 2026-06-17 cs.RO 新提交 77%

ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

ThinkingVLA:用于机器人操作的交叉视觉与语言推理

Tianyi Lu, Hui Zhang, Zijie Diao, Junke Wang, Shengqi Xu, Xingyao Lin, Guojin Zhong, Ziyi Ye, Peng Wang, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出ThinkingVLA,通过统一的多Transformer架构实现前向与逆向推理交织,显著提升长时域操作任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17210 2026-06-17 astro-ph.GA astro-ph.CO 新提交 67%

Testing masking effectiveness using multi-line image cubes based on COSMOS2020 for [CII] line intensity mapping at $z_{[CII]} > 3.5$

基于COSMOS2020的多线图像立方体测试掩膜有效性用于$z_{[CII]} > 3.5$的[CII]谱线强度映射

J. Clarke, C. Karoumpis, A. Dev, D. Riechers, T. Oak, Y. Okada, K. Narita, F. Bertoldi

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用COSMOS2020星系目录构建CO和[CII]发射线的强度映射立方体,通过掩膜技术恢复高红移[CII]信号,并评估噪声影响。

Comments 23 pages, 22 figures, submitted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17480 2026-06-17 cs.CV cs.RO 新提交 62%

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) CASIA(中国科学院自动化研究所) AI 2 Robotics

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人规划中3D物体重建幻觉和记忆质量不可控的问题,提出GeoFuse-MV3D几何先验引导重建分支和受控长期记忆系统,在GSO-30和Terminal-Bench等基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18154 2026-06-17 cs.AI 新提交 57%

Learning Cardiac Electrophysiology Digital Twins Through Agentic Discovery of Hybrid Structure

通过智能体发现混合结构学习心脏电生理数字孪生

Ziqi Zhou, Yubo Ye, Sumeet Atul Vadhavka, Linwei Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 提出LEADS框架,利用LLM智能体在结构化动作空间中迭代发现混合物理-神经模型,实现个性化心脏电生理数字孪生构建,优于人工设计和其他LLM方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18087 2026-06-17 econ.GN q-fin.EC 新提交 50%

Environmental Threat and the Nation: Earthquake Risk, Distributive Priority, and Expressive Attachment

环境威胁与国家:地震风险、分配优先级与表达性依恋

Hector Galindo-Silva

专题命中 VLA模型 :action model(abstract)

AI总结 利用全球63个国家494个地区的数据,研究发现长期地震风险增强国家认同,主要通过表达性渠道(自豪感、战斗意愿)而非分配性渠道,且该效应在宗教象征基础设施完备的地区更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 1 篇

2606.18097 2026-06-17 cs.RO 新提交 77%

WireCraft: A Simulation Benchmark for Industrial DLO Manipulation

WireCraft:工业DLO操作仿真基准

Chongyu Zhu, Ramy ElMallah, Hyegang Kim, Zachary Tang, Jiachen Rao, Artem Arutyunov, Seungyeon Ha, Chi-Guhn Lee

机构 * Department of Mechanical and Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) CREFLE Inc.(CREFLE公司)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对工业中可变形线性物体(DLO)操作缺乏统一基准的问题,提出WireCraft仿真基准,支持可配置难度和资产,涵盖三种任务族,并评估强化学习、模仿学习和视觉-语言-动作策略。

详情

展开后加载摘要…

URL PDF HTML 收藏