arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9754 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2605.08612 2026-05-12 cs.RO 89%

ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models

ATAAT: 面向视觉-语言-动作模型后门攻击的自适应威胁感知对抗调制框架

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(重庆绿色智能技术研究院,中国科学院) Chongqing School, University of Chinese Academy of Sciences(重庆学校,中国科学院大学) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(奥卢大学信息科技与电气工程学院,芬兰)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出ATAAT框架,解决视觉-语言-动作模型中后门攻击的梯度干扰问题,通过威胁-方法自适应映射机制实现高效攻击并保持隐蔽性,实验表明其在高成功率和低污染率下表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20834 2026-04-27 cs.RO 89%

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19710 2026-04-22 cs.CV 89%

SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model

SpanVLA: 一种高效的视觉-语言-动作模型,通过负样本恢复学习实现动作桥接与学习

Zewei Zhou, Ruining Yang, Xuewei, Qi, Yiluan Guo, Sherry X. Chen, Tao Feng, Kateryna Pistunova, Yishan Shen, Lili Su, Jiaqi Ma

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校) Motional, USA(Motional公司) Northeastern University, USA(东北大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SpanVLA,一种端到端自动驾驶框架,结合自回归推理与流匹配动作专家,通过高效桥接和负样本恢复学习提升推理效率和鲁棒性。

Comments Project page: https://spanvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04052 2026-04-21 cs.RO cs.CL 89%

Stable Language Guidance for Vision-Language-Action Models

用于视觉-语言-动作模型的稳定语言引导

Zhihao Zhan, Yuhao Chen, Jiaying Zhou, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出RSS框架,通过解耦物理 affordance 与语义执行,提升视觉-语言-动作模型在语言扰动下的鲁棒性,实验表明其在多种操作基准测试中达到最优性能。

Comments Accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05672 2026-04-16 cs.RO 89%

A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model

A1: 一个完全透明的开源、自适应和高效的截断视觉-语言-动作模型

Kaidong Zhang, Jian Zhang, Rongtao Xu, Yu Sun, Shuoshuo Xue, Youpeng Wen, Xiaoyu Guo, Minghao Guo, Weijia Liufu, Liu Zihou, Kangyi Ji, Yangsong Zhang, Jiarun Zhu, Jingzhi Liu, Zihang Li, Ruiyi Chen, Meng Cao, Jingming Zhang, Shen Zhao, Xiaojun Chang, Feng Zheng, Ivan Laptev, Xiaodan Liang

机构 * SYSU(华南理工大学) MBZUAI(微软亚洲人工智能研究院) Spatialtemporal AI(时空人工智能)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 A1通过利用预训练的VLM提供隐含的 affordance 先验知识,实现低成本、高吞吐量的推理,同时提高机器人操作的成功率,且在多个基准和真实机器人上实现了最先进的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12447 2026-04-15 cs.RO 89%

HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models

HazardArena:评估视觉-语言-动作模型中的语义安全性

Zixing Chen, Yifeng Gao, Li Wang, Yunhan Zhao, Yi Liu, Jiayu Li, Xiang Zheng, Zuxuan Wu, Cong Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 HazardArena通过可控风险情境评估视觉-语言-动作模型的语义安全性,发现模型在安全场景训练后在危险场景中表现不佳,提出安全选项层以减少不安全行为。

Comments Submitted to conference; 12 pages, 8 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25740 2026-03-27 cs.RO cs.AI cs.CV cs.LG cs.MA 89%

Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving

Drive My Way: 为个性化驾驶的视觉-语言-动作模型偏好对齐

Zehao Wang, Huaide Jiang, Shuaiwu Dong, Yuping Wang, Hang Qiu, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Drive My Way框架,通过学习用户驾驶习惯和自然语言指令,实现个性化驾驶,提升对用户意图的适应能力。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026); Project website: https://dmw-cvpr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21341 2026-03-24 cs.AI 89%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10712 2026-03-12 cs.RO 89%

FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model

FutureVLA: 视觉-运动联合预测用于视觉-语言-动作模型

Xiaoxu Xu, Hao Li, Jinhui Ye, Yilun Chen, Jia Zeng, Xinyi Chen, Linning Xu, Dahua Lin, Weixin Li, Jiangmiao Pang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO

AI总结 FutureVLA通过联合视觉-运动预测架构,解决视觉-语言-动作模型中联合建模的挑战,提升时间连续性和视觉监督解耦能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05487 2026-03-06 cs.RO 89%

Observing and Controlling Features in Vision-Language-Action Models

观察和控制视觉-语言-动作模型中的特征

Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann, Marco Pavone

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00592 2026-03-03 cs.RO cs.AI cs.CL cs.CV cs.LG 89%

LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models

LangGap:诊断和缩小视觉-语言-动作模型中的语言差距

Yuchen Hou, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore, Singapore(电子与计算机工程系,新加坡国立大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 LangGap通过系统性语义扰动诊断和多样化任务设计,揭示并缩小VLA模型在理解多样语言指令方面的差距。

Comments 7 pages, 3 figures. Code and benchmark will be available at https://github.com/YC11Hou/langgap

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20659 2026-02-26 cs.AI 89%

Recursive Belief Vision Language Action Models

递归信念视觉语言动作模型

Vaidehi Bagaria, Bijo Sebastian, Nirav Kumar Patel

机构 * Department of Engineering Design, Indian Institute of Technology, Madras, Chennai, India(工程设计系,印度理工学院,马德拉斯,钦奈,印度)

专题命中 VLA模型 :action model(title,abstract);vision language action(title);vision-language-action(abstract);VLA(abstract)

AI总结 RB-VLA通过信念与意图联合条件化扩散策略,实现长周期任务的高效执行,显著提升成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV 89%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.CV

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11480 2026-01-27 cs.AI cs.CV cs.ET cs.LG cs.RO 89%

Cross-Platform Scaling of Vision-Language-Action Models from Edge to Cloud GPUs

从边缘到云GPU的视觉-语言-动作模型跨平台扩展

Amir Taherin, Juyi Lin, Arash Akbari, Arman Akbari, Pu Zhao, Weiwei Chen, David Kaeli, Yanzhi Wang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文研究了视觉-语言-动作模型在边缘到云GPU平台上的跨平台扩展,揭示了架构选择和电力限制对性能的影响,并挑战了数据中心硬件的优越性假设。

Comments To appear in the Asilomar Conference on Signals, Systems, and Computers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21571 2025-10-27 cs.RO cs.AI cs.CV cs.LG 89%

Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos

Qixiu Li, Yu Deng, Yaobo Liang, Lin Luo, Lei Zhou, Chengtang Yao, Lingqi Zeng, Zhiyuan Feng, Huizhi Liang, Sicheng Xu, Yizhong Zhang, Xi Chen, Hao Chen, Lily Sun, Dong Chen, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project page: https://microsoft.github.io/VITRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13888 2025-09-30 cs.RO 89%

InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning

Ji Zhang, Shihan Wu, Xu Luo, Hao Wu, Lianli Gao, Heng Tao Shen, Jingkuan Song

机构 * Southwest Jiaotong University(西南交通大学) University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23655 2025-09-30 cs.RO cs.AI cs.CV cs.LG 89%

Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models

Rokas Bendikas, Daniel Dijkman, Markus Peschl, Sanjay Haresh, Pietro Mazzaglia

机构 * Centre for Artificial Intelligence, UCL(人工智能中心,伦敦大学学院) Qualcomm AI Research(高通人工智能研究)

专题命中 VLA模型 :vision language action(title);action model(title);vision-language-action(abstract);VLA(abstract)

Comments Presented at 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12440 2025-07-21 cs.RO cs.AI cs.CV cs.LG 89%

EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos

Ruihan Yang, Qinxi Yu, Yecheng Wu, Rui Yan, Borui Li, An-Chieh Cheng, Xueyan Zou, Yunhao Fang, Xuxin Cheng, Ri-Zhao Qiu, Hongxu Yin, Sifei Liu, Song Han, Yao Lu, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校) UIUC(伊利诺伊大学香槟分校) MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments More videos can be found on our website: https://rchalyang.github.io/EgoVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17418 2025-03-20 cs.CV 89%

A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation

Chenxuan Li, Jiaming Liu, Guanqun Wang, Xiaoqi Li, Sixiang Chen, Liang Heng, Chuyan Xiong, Jiaxin Ge, Renrui Zhang, Kaichen Zhou, Shanghang Zhang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13508 2025-02-24 cs.RO 89%

VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation

Wei Zhao, Pengxiang Ding, Min Zhang, Zhefei Gong, Shuanghao Bai, Han Zhao, Donglin Wang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO

Comments Accepted as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19650 2024-12-02 cs.RO cs.AI cs.CL cs.CV cs.LG 89%

CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation

Qixiu Li, Yaobo Liang, Zeyu Wang, Lin Luo, Xi Chen, Mozheng Liao, Fangyun Wei, Yu Deng, Sicheng Xu, Yizhong Zhang, Xiaofan Wang, Bei Liu, Jianlong Fu, Jianmin Bao, Dong Chen, Yuanchun Shi, Jiaolong Yang, Baining Guo

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project Webpage: https://cogact.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24884 2026-06-24 cs.RO cs.AI cs.LG 新提交 89%

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight: 通过可引导的VLA实现自主技能获取

Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。

Comments Project website: https://insight-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05014 2026-04-08 cs.RO cs.AI cs.CV 89%

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发

StarVLA Community

机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。

Comments Open-source VLA infra, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 89%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.CV

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02958 2026-08-05 cs.RO cs.AI 新提交 89%

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

ValueFormer:面向半自主视觉-语言-动作策略的、具有阶段感知标签的因果变换价值函数

Inkyu Sa, Konstantin Stulov, Rajat Bhageria

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出 ValueFormer,一种带阶段感知标签的因果变换价值函数,用于半自主 VLA 策略,在真实机器人双手机器人三明治组装任务上提升了任务完成率并降低了服务成本。

Comments 22 pages, 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01028 2026-08-04 cs.RO cs.AI 新提交 89%

VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks

VLAGuard:无线传感器网络中视觉-语言-动作机器人的物理注意力劫持评估与缓解框架

Dongfu Yin, Jinquan Zhang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI

AI总结 VLAGuard框架通过提出VASA攻击和APFT防御,有效降低了无线传感器网络中VLA机器人的物理注意力劫持风险,提升了其在模拟与真实环境中的鲁棒性。

Comments 32 pages, 8 figures, 5 tables. Accepted for publication in Ad Hoc & Sensor Wireless Networks (AHSWN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27782 2026-07-31 cs.RO cs.AI 新提交 89%

RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy

RedFlow:将失败重定向为流匹配VLA策略的动作级修正

Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 RedFlow是将失败转化为动作级修正监督的离线RL框架,在LIBERO基准及真实操纵任务上,其真实成功率达74.7%,优于现有离线RL基线,样本量仅为强在线方法的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13429 2026-07-16 cs.RO cs.CV 新提交 89%

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德州农工大学) University of California, Irvine(加州大学欧文分校)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。

Comments Code: https://github.com/dwipddalal/Anchor-Align

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02604 2026-07-07 cs.CV cs.RO 新提交 89%

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

DynaWM:用于移动物体操纵的基于基础VLA的世界基础模型

Chongkei Chang, Zhidong Deng

机构 * Department of Computer Science and Technology, THUAI, Tsinghua University, Beijing 100084, China(计算机科学与技术系,THUAI,清华大学,北京100084,中国)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对移动物体操纵挑战,提出DynaWM模型,用多种编码器提取特征,联合条件流匹配DiT生成动作轨迹,构建数据集评估,相比其他模型有性能提升,消融实验验证各部分作用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00678 2026-07-07 cs.CV cs.RO 新提交 89%

ABot-M0.5: Unified Mobility-and-Manipulation World Action Model

ABot-M0.5:统一移动与操作的世界动作模型

Ronghan Chen, Yandan Yang, Zuojin Tang, Dongjie Huo, Tong Lin, Haoning Wu, Haoyun Liu, Yuzhi Chen, Lulu Zheng, Botai Yuan, Tianlun Li, Mingxin Wang, Dekang Qi, Bin Hu, Wei Mei, Yuze Xuan, Haolong Yang, Yanqing Zhu, Mu Xu, Zhiheng Ma, Xinyuan Chang

机构 * AMAP CV Lab(AMAP CV实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);action model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对移动操作任务中VLA策略缺乏世界建模、动作空间耦合及训练-推理不一致的问题,提出ABot-M0.5模型,通过三级对齐(时间粒度、动作空间、训练-测试一致性)实现细粒度控制,在长时域任务成功率和控制精度上达到最优。

Comments Code: https://github.com/amap-cvlab/ABot-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏