arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3061 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 175 篇

2606.20285 2026-06-19 cs.RO 新提交 70%

Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems

Co-VLA:面向双臂视觉-语言-动作系统的协调感知结构化动作建模

Yandong Wang, Jiaqian Yu, Xiongfeng Peng, Lu Xu, Yamin Mao, Weiming Li, Jaewook Yoo, Dongwook Lee, Daehyun Ji, Mingbo Zhao, Chao Zhang

机构 * Donghua University(东华大学) Samsung R&D Institute China-Beijing (SRCB)(三星中国北京研究院) Samsung AI Center, DS Division(三星DS部门AI中心)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对双臂紧耦合任务中隐式协调不足的问题,提出Co-VLA框架,通过结构化动作专家和潜在感知控制器显式引入协调先验,在仿真和真实场景中显著提升成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16178 2026-06-16 cs.RO 新提交 70%

Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks

面向长时任务的视觉运动策略短期记忆扩展

Rutav Shah, Rajat Kumar Jenamani, Xiaohan Zhang, Lingfeng Sun, Roberto Martín-Martín, Yuke Zhu, Deva Ramanan, Karl Schmeckpeper

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出PRISM架构,通过门控注意力与层次化压缩扩展视觉运动策略的短期记忆至两分钟,在ReMemBench基准上超越现有方法5%-12%。

Comments 14 pages, 9 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15021 2026-06-16 cs.RO 新提交 70%

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention

通过动作令牌干预引导自回归视觉-语言-动作策略

Jason Chan, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 机器人基础模型 :manipulation(abstract);robot foundation model(abstract);分类 cs.RO

AI总结 提出Token Steering方法,在推理时通过干预动作令牌空间动态引导VLA模型轨迹生成,无需训练或微调,显著提升家务操作任务成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 70%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14084 2026-06-15 cs.RO 新提交 70%

Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing

自我改进的VLA策略:用于抗伪影动作平滑的选择性扩散噪声

Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu, Binh Gia Nguyen, Vinh Tong, Anji Liu, Vu N. Duong, Dung D. Le, Daniel Sonntag, Trung Le, Ngan Le, Jan Peter, An Thai Le, Minh Nhat Vu, Mathias Niepert, Khoa D. Doan, Duy M. H. Nguyen, Vien Anh Ngo

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics KAIST(韩国科学技术院) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) National University of Singapore(新加坡国立大学) DFKI(德国人工智能研究中心) University of Oldenburg(奥尔登堡大学) Monash University(莫纳什大学) University of Arkansas(阿肯色大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种无需训练的选择性扩散噪声方法,通过动态采样噪声向量增强视觉-语言-动作策略的鲁棒性和动作平滑性,在仿真和真实场景中成功率分别提升8%和10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 70%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 机器人基础模型 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10568 2026-06-10 cs.RO 新提交 70%

VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models

VeriSpace: 面向视觉-语言-动作模型的空间基础动作验证

Guiyu Zhao, Longteng Guo, Junyou Zhu, Jun Fu, Yanghong Mei, Bin Cao, Jie Jiang, Xingjian He, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出VeriSpace,一种3D感知的动作验证器,通过双路径3D注入场景编码和空间基础动作推理,在测试时选择候选动作,提升VLA模型的可靠性。

Comments Submit to ACM MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09740 2026-06-09 cs.RO 新提交 70%

ProbeAct: Probe-Guided Training-Free Failure Recovery in Vision-Language-Action Models

ProbeAct: 视觉-语言-动作模型中的探针引导无训练故障恢复

Fan Zhang, Seongbin Park, Baharan Mirzasoleiman, Shariar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出ProbeAct框架,通过轻量级隐藏状态探针、运动学状态机和分层控制屏障函数,无需训练即可检测并恢复VLA模型的抓取与放置失败,在LIBERO-plus上将成功率从69.6%提升至74.1%。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27138 2026-07-30 cs.RO cs.AI cs.CV 新提交 67%

DLAM: Distributional Latent Actions with Temporal Constraints

DLAM:带时间约束的分布隐式动作模型

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交 67%

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14236 2026-07-17 cs.RO cs.AI cs.LG 新提交 67%

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Noematrix Ltd.(诺玛矩阵有限公司)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。

Comments Project page: https://lift-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24884 2026-06-24 cs.RO cs.AI cs.LG 新提交 67%

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight: 通过可引导的VLA实现自主技能获取

Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。

Comments Project website: https://insight-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21470 2026-06-23 cs.RO cs.CV cs.LG 新提交 67%

ASCII Art Turns LLMs into VLA Controllers

ASCII艺术将LLMs转化为VLA控制器

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12105 2026-06-11 cs.RO cs.CV cs.LG 新提交 67%

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

DAM-VLA: 解耦异步多模态视觉语言动作模型

Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

机构 * Intuitive Robots Lab, Karlsruhe Institute of Technology (KIT)(直觉机器人实验室,卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute of Germany(德国机器人研究所)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对VLA模型同步时钟与物理交互中不同模态频率不匹配的问题,提出DAM-VLA,通过解耦各模态时间处理、维护传感器速率更新的潜在缓冲区,并利用门控交叉注意力整合高频模态,在7个真实操作任务中平均成功率提升至95.2%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10267 2026-06-10 cs.RO cs.AI cs.LG 新提交 67%

What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents

机器人策略编排的关键因素:分层VLA智能体的系统研究

Jiaheng Hu, Mohit Shridhar, Caden Lu, Dhruv Shah, Hao-Tien Lewis Chiang, Jie Tan, Annie Xie

机构 * Google DeepMind(谷歌DeepMind)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 系统研究分层视觉-语言-动作(Hi-VLA)系统的设计原则,通过统一框架分析规划器、控制器及接口机制对短时、长时及推理密集型任务性能的影响,提出构建更强健分层VLA智能体的实用原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09630 2026-06-09 cs.RO cs.AI cs.LG 新提交 67%

ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies

ReCoVLA: VLM引导的奖励编译用于视觉-语言-动作策略的故障恢复

Haodi Hu, Chung-Ta Huang, Jing Liu, Ye Wang, Kei Suzuki, Matthew Brand, Toshiaki Koike-Akino

机构 * University of Southern California(南加州大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) Harvard University(哈佛大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出ReCoVLA框架,通过冻结预训练VLA策略,利用外部VLM推断故障模式并编译结构化奖励,训练残差恢复策略,实现零样本仿真到真实部署,在多种操作任务中提升成功率。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 62%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16074 2026-08-18 cs.RO cs.CV 新提交 62%

US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdomina

US-VLA:用于腹部超声的超声-视觉-动作模型

Cheng Zhang, Xingzheng Wu, Guihao Yan, Xifeng Hu, Zhi Liu, Mei Wu, Qing Cai

机构 * Faculty of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) the Qilu Second Hospital of Shandong University(山东大学第二齐鲁医院) Innovation School of Artificial Intelligence, Hefei University of Technology(合肥工业大学人工智能创新学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对现有超声扫描方法泛化性与稳定性不足的问题,提出US-VLA模型,设计超声感知专家融合模块并构建US-VLA-Data数据集,在腹部超声探头操作任务中取得竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15285 2026-08-18 cs.RO cs.AI 新提交 62%

PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies

PhaseLoRA:面向连续动作视觉-语言-动作策略的控制条件式低秩适配

Yufei Guo, Yinan Wu, Haoran Duan, Guiguang Ding, Jungong Han

机构 * Tsinghua University(清华大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 PhaseLoRA是面向连续动作VLA策略的轻量级PEFT方法,通过控制条件式LoRA实现阶段依赖适配,在LIBERO数据集上较匹配参数的高秩LoRA基线提升平均成功率12.2个百分点,性能优于其他LoRA变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 62%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 62%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07361 2026-08-10 cs.RO cs.CV 新提交 62%

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。

Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06434 2026-08-10 cs.RO cs.LG 新提交 62%

Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection

快速且精准:一种通过环境感知模型选择的自适应VLA推理框架

Yuewei Sun, Lang Qin, Zechuan Tian, Jingwen Li, Guiqin Wang, Shengzeng Huo, Wenxin Ren, Tao Fang, Xiaochen Zhang, Guanqing Deng, Xiang Wang, Xiaowen Dong, Qinghai Guo, Yuxin Ma

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出环境感知模型选择(EMS)自适应VLA推理框架,通过解耦双系统与强化学习切换策略,在LIBERO基准及真实双臂任务中平衡了VLA的推理速度与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25912 2026-07-29 cs.RO cs.AI 新提交 62%

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐

Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen

机构 * University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Infiforce(英飞拓)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25487 2026-07-29 cs.AI cs.CV 新提交 62%

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA:用于十亿参数以下视觉-语言-动作模型的思维链蒸馏

Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

机构 * Chung-Ang University(韩国中央大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 研究针对VLA模型内存需求大问题,提出CoTinyVLA模型。通过双视图时间输入、分层思维链蒸馏、释义增强三个组件,在LIBERO-Plus基准测试中取得优异成绩,证明结构化监督可让小参数主干超越其他模型。

Comments 22 pages, 2 figures, 20 tables. Code at https://github.com/BrainJellyPie/CoTinyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13429 2026-07-16 cs.RO cs.CV 新提交 62%

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德州农工大学) University of California, Irvine(加州大学欧文分校)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。

Comments Code: https://github.com/dwipddalal/Anchor-Align

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 62%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06655 2026-07-10 cs.RO cs.LG 新提交 62%

Pelican-VLA 0.5: Attending Before Acting Benefits Generalization

Pelican-VLA 0.5:行动前关注有益于泛化

Zeyuan Ding, Wenhai Liu, Yang Xu, Jiayu Hu, Yinda Chen, Yi Zhang, Yong Dai, Jian Tang, Xiaozhu Ju

机构 * Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心(X-人形机器人))

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 研究展示了Pelican-VLA 0.5统一VLA模型,无需特定注释或微调就能实现注意力级泛化。其动作路径聚焦指令相关对象和区域,能力源于感知与动作间的可学习推理插槽,在不同场景和架构中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03182 2026-07-07 cs.RO cs.AI 新提交 62%

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning

AnchorVLA:为视觉-语言-动作规划连接离散决策与连续轨迹

Qi Liu, Yabei Li, Hongsong Wang, Heng Zhang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与交通国家重点实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Meituan Inc.(美团公司) Dongfeng Motor Corporation(东风汽车公司)

专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 自动驾驶规划需将多种信息转化为连续轨迹,现有视觉-语言-动作(VLA)规划器有局限。提出AnchorVLA框架,用轨迹模式锚连接高层VLA推理与连续轨迹执行,提升效率、语义动作对齐和生成灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02092 2026-07-07 cs.RO cs.AI 新提交 62%

Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies

引导动作流:面向流匹配视觉-语言-动作策略的Q引导推理

Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院) Department of Mechanical Engineering, University College London(机械工程系,伦敦大学学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出Guided Action Flow框架,通过冻结预训练策略并利用学习到的动作块评论家引导逆向流采样,在LIBERO任务中单任务评论家将成功率从68.0%提升至82.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏