arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-29 至 2026-07-29 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2607.25487 2026-07-29 cs.AI cs.CV 新提交 92%

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA:用于十亿参数以下视觉-语言-动作模型的思维链蒸馏

Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

机构 * Chung-Ang University(韩国中央大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对VLA模型内存需求大问题,提出CoTinyVLA模型。通过双视图时间输入、分层思维链蒸馏、释义增强三个组件,在LIBERO-Plus基准测试中取得优异成绩,证明结构化监督可让小参数主干超越其他模型。

Comments 22 pages, 2 figures, 20 tables. Code at https://github.com/BrainJellyPie/CoTinyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12109 2026-07-29 cs.RO cs.AI 版本更新 91%

InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation

弥合形态差距:通过意图条件微调使VLA模型适应灵巧操作

Chuanke Pang, Junyi Huang, Zhijun Zhao, Yaobing Wang, Kun Xu, Xilun Ding

机构 * Beihang University(北京航空航天大学) China Academy of Space Technology(中国空间技术研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出InDex框架,通过将预训练的1-DoF平行抓取输出重用作宏观虚拟抓取意图代理,结合两阶段解耦学习架构,实现VLA模型从低自由度夹爪到高自由度灵巧手的适应,有效缓解灾难性遗忘和动作流形坍缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02295 2026-07-29 cs.RO 版本更新 90%

CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding

CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型

Chenyang Ma, Kai Lu, Guangyu Yang, Jiuming Liu, Shitong Xu, Bill Byrne, Ioannis Havoutis, Niki Trigoni, Andrew Markham

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力

Comments Project Page: https://dannymcy.github.io/cyclevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25912 2026-07-29 cs.RO cs.AI 新提交 90%

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐

Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen

机构 * University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Infiforce(英飞拓)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25516 2026-07-29 cs.RO 新提交 89%

A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models

用于视觉语言动作模型测试时模态适应的因果感知推理-诊断-细化框架

Haoyu Zhang, Yuwei Wu, Jin Chen, Gao Zhi, Zhenxin Diao, Mingyang Gao, Kun Wu, Yongchun Liu, Fan Li

机构 * Beijing Institute of Technology(北京理工大学) AInnovation Co. Ltd.(A创新有限公司) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对VLA模型模态融合问题,提出因果感知推理-诊断-细化框架,通过视觉观察推理、因果效应诊断及动作预测细化实现模态适应,设计因果感知动作细化器,实验验证了该框架在多VLA主干上提升整体性能的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25918 2026-07-29 cs.RO 新提交 79%

DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models

DC-WAM:用于世界-动作模型的以动态为中心的视觉监督与推理

Haoyuan Ji, Lingxiang Fan, Shang Su, Yinqiao Lu, Mengkai Shi, Jun Gao, Shuo Feng

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究如何让基于RGB的世界-动作模型从外观主导的重建转向交互诱导的视觉动态,提出DC-WAM框架,通过重新分配监督和计算,结合时间差分流匹配等方法,提升策略性能,尤其在多种分布外扰动下表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25703 2026-07-29 astro-ph.CO 新提交 67%

Simulation-based tension quantification of the cosmic dipole

基于模拟的宇宙偶极张力量化

Mali Land-Strykowski, Harry T. J. Bevins, Oliver T. Oayda, Geraint F. Lewis

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究针对宇宙偶极张力超预期挑战,提出基于模拟的推理架构,用神经比率估计器测量张力,经验证可准确恢复真实值,应用于多数据集测得了不同张力,能在新观测时代实现稳健张力量化。

Comments 14 pages, 9 figures, accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏