arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-10 至 2026-07-10 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2607.08375 2026-07-10 cs.CV cs.AI 新提交 94%

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.AI

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06655 2026-07-10 cs.RO cs.LG 新提交 90%

Pelican-VLA 0.5: Attending Before Acting Benefits Generalization

Pelican-VLA 0.5:行动前关注有益于泛化

Zeyuan Ding, Wenhai Liu, Yang Xu, Jiayu Hu, Yinda Chen, Yi Zhang, Yong Dai, Jian Tang, Xiaozhu Ju

机构 * Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心(X-人形机器人))

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.LG

AI总结 研究展示了Pelican-VLA 0.5统一VLA模型,无需特定注释或微调就能实现注意力级泛化。其动作路径聚焦指令相关对象和区域,能力源于感知与动作间的可学习推理插槽,在不同场景和架构中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08182 2026-07-10 cs.CV cs.AI 新提交 86%

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08436 2026-07-10 cs.RO cs.AI 新提交 81%

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM:利用野外自我中心人类数据超越像素的世界行动模型

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究利用野外自我中心人类数据训练机器人操纵模型,引入EgoWAM框架,固定部分设置仅改变世界预测目标,比较不同方法。结果表明WAM协同训练更有效,DINO和3D流提升显著,为机器人操纵提供新训练思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07287 2026-07-10 cs.RO 新提交 70%

TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation

TouchWorld:一种用于灵巧操作的预测性和反应性触觉基础模型

Jianyi Zhou, Feiyang Hong, Yunhao Li, Yicheng Zhao, Yongjue Cen, Zirui Liu, Jiakang Huang, Zirui Chen, Ruiyang Zhang, Weizhuo Zhu, Xuhua Song, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) PHANES AI(PHANES人工智能公司)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究针对日常环境中灵巧操作需预测与反应的问题,提出TouchWorld模型。该模型采用分层策略,分离多项任务。通过将触摸用于预测和反馈,提升局部接触适应性。在六个相关任务中表现出色,超越最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11408 2026-07-10 cs.RO 新提交 70%

Dynamic Execution Horizon Prediction for Chunk-based Robot Policies

基于分块的机器人策略的动态执行视界预测

Yuchi Zhao, Miroslav Bogdanovic, Arjun Sohal, Liyu Tao, Kourosh Darvish, Alán Aspuru-Guzik, Florian Shkurti, Animesh Garg

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Acceleration Consortium(加速联盟) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出DEHP方法,通过在线强化学习训练轻量级执行视界预测分支,在冻结预训练分块策略的情况下动态调整执行步数,显著提升高精度和长时域操作任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08502 2026-07-10 nucl-th astro-ph.SR nucl-ex 新提交 50%

Microscopic description of $^{12}$C+$^{12,13}$C fusion reactions at nuclear astrophysical energies

核天体物理能量下$^{12}$C+$^{12,13}$C聚变反应的微观描述

K. Nagao, K. Hagino, K. Uzawa

专题命中 VLA模型 :action model(abstract)

AI总结 研究核天体物理能量下$^{12}$C+$^{12,13}$C聚变反应,开发结合离散基模型与壳模型的反应模型,成功再现了两系统聚变截面显著不同的行为。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 1 篇

2607.08127 2026-07-10 cs.CV cs.RO 新提交 62%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏