arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 566 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 566 篇

2510.13778 2025-10-16 cs.RO cs.AI cs.CV 78%

InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy

Xinyi Chen, Yilun Chen, Yanwei Fu, Ning Gao, Jiaya Jia, Weiyang Jin, Hao Li, Yao Mu, Jiangmiao Pang, Yu Qiao, Yang Tian, Bin Wang, Bolun Wang, Fangjing Wang, Hanqing Wang, Tai Wang, Ziqin Wang, Xueyuan Wei, Chao Wu, Shuai Yang, Jinhui Ye, Junqiu Yu, Jia Zeng, Jingjing Zhang, Jinyu Zhang, Shi Zhang, Feng Zheng, Bowen Zhou, Yangkun Zhu

机构 * Intern Robotics Shanghai AI Laboratory(Intern Robotics上海AI实验室)

专题命中 机器人基础模型 :robot policy(title);分类 cs.RO、cs.AI、cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26820 2026-08-11 cs.RO 版本更新 77%

Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?

VLA 模型能否从现实世界数据中持续学习而不遗忘?

Jiarun Zhu, Yijun Hong, Xiaoquan Sun, Zetian Xu, Qijun He, Haijier Chen, Zhiyong Wang, Mingqi Yuan, Wenjun Zeng, Jiayu Chen

机构 * HKU(香港大学) INFIFORCE EIT, Ningbo(宁波工程学院) HUST(华中科技大学) SUSTech(南方科技大学) HITSZ(香港理工大学)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究通过构建包含四个顺序操作任务的真实世界持续学习数据集,实证发现视觉-语言-动作(VLA)模型在持续学习异构真实世界演示时存在严重灾难性遗忘,并系统评估了经验回放方法的关键实施因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 77%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03392 2026-06-03 cs.RO 77%

OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform

OpenEAI-Platform: 一个开源具身人工智能硬件-软件统一平台

Jinyuan Zhang, Luoyi Fan, Leiyu Wang, Yeqiang Wang, Yicheng Zhu, Cewu Lu, Nanyang Ye

机构 * Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出OpenEAI-Platform,集成低成本6+1自由度机械臂和可复现VLA模型,通过开源设计和两阶段训练在真实操作任务中超越商业臂,性能媲美大规模预训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01241 2026-06-03 cs.RO 77%

OneVLA: A Unified Framework for Embodied Tasks

OneVLA:面向具身任务的统一框架

Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Xiaomi EV(小米电动车) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) HKUST(GZ)(香港科技大学(广州))

专题命中 机器人基础模型 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出统一架构OneVLA,通过设计统一动作头和渐进式训练策略(含数据构建和思维链微调),在导航与操作任务上实现跨任务正迁移,达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09928 2026-04-10 cs.RO 77%

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性

Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学) Westlake Robotics(西湖机器人)

专题命中 机器人基础模型 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO

AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。

Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21542 2026-03-26 cs.RO cs.AI cs.CV cs.LG 77%

E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion

E0: 通过 Tweedie 离散扩散增强 VLA 模型的泛化能力与细粒度控制

Zhihao Zhan, Jiaying Zhou, Likui Zhang, Qinhan Lv, Hao Liu, Jusheng Zhang, Weizheng Li, Ziliang Chen, Tianshui Chen, Ruifeng Zhai, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出 E0 框架,通过离散扩散方法提升 VLA 模型在多任务和多视角下的泛化能力,并实现精细可控的动作生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16044 2026-03-18 cs.AI 77%

Enhancing Linguistic Generalization of VLA: Fine-Tuning OpenVLA via Synthetic Instruction Augmentation

增强 VLA 的语言泛化能力:通过合成指令增强细调 OpenVLA

Dongik Shin

专题命中 机器人基础模型 :embodied AI(abstract);embodied agent(abstract);robotic(abstract);分类 cs.AI

AI总结 本文提出通过合成指令集提升 OpenVLA 的语言泛化能力,利用 LoRA 技术在增强数据上微调,增强复杂自然语言意图与机器人动作之间的桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11080 2026-03-13 cs.RO 77%

SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly

SELF-VLA: 一种增强技能的代理视觉-语言-动作框架用于接触丰富的拆解

Chang Liu, Sibo Tian, Xiao Liang, Minghui Zheng

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 SELF-VLA是一种整合显式拆解技能的代理视觉-语言-动作框架,通过实验在接触丰富的拆解任务中优于现有端到端VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22643 2026-03-03 cs.RO 77%

VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search

VLA-Reasoner: 通过在线蒙特卡洛树搜索增强视觉-语言-动作模型的推理能力

Wenkai Guo, Guanxing Lu, Haoyuan Deng, Zhenyu Wu, Yansong Tang, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)

专题命中 机器人基础模型 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO

AI总结 VLA-Reasoner通过在线蒙特卡洛树搜索增强视觉-语言-动作模型,提升长时间轨迹任务的推理能力与执行效率。

Comments 8 pages, 6 figures, Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15543 2026-02-18 cs.RO 77%

Selective Perception for Robot: Task-Aware Attention in Multimodal VLA

机器人选择性感知:多模态VLA中的任务感知注意力

Young-Chae Son, Jung-Woo Lee, Yoon-Ji Choi, Dae-Kwan Ko, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种动态信息融合框架,通过任务感知注意力提升机器人多模态VLA模型的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 77%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 77%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);robotic(abstract);分类 cs.RO

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07582 2025-12-09 cs.RO 77%

See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations

一次观看,随后行动:基于单次视频示范的任务学习视觉-语言-行动模型

Guangyan Chen, Meiling Wang, Qi Shao, Zichen Zhou, Weixin Mao, Te Cui, Minzhao Zhu, Yinan Deng, Luojie Yang, Zhanqi Zhang, Yi Yang, Hua Chen, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) LimX Dynamics

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ViVLA通过单次视频示范高效学习机器人操控任务,实现跨任务和跨身体的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19257 2025-11-17 cs.CV cs.AI cs.LG cs.RO 77%

TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models

Chenghao Liu, Jiachen Zhang, Chengxuan Li, Zhimu Zhou, Shixin Wu, Songfang Huang, Huiling Duan

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Accepted to AAAI 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16815 2025-09-19 cs.CV cs.AI cs.LG cs.RO 77%

ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning

Chi-Pin Huang, Yueh-Hua Wu, Min-Hung Chen, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

Comments NeurIPS 2025. Project page: https://jasper0314-huang.github.io/thinkact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22020 2025-03-31 cs.CV cs.AI cs.LG cs.RO 77%

CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models

Qingqing Zhao, Yao Lu, Moo Jin Kim, Zipeng Fu, Zhuoyang Zhang, Yecheng Wu, Zhaoshuo Li, Qianli Ma, Song Han, Chelsea Finn, Ankur Handa, Ming-Yu Liu, Donglai Xiang, Gordon Wetzstein, Tsung-Yi Lin

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Project website: https://cot-vla.github.io/

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04910 2026-07-24 cs.RO cs.AI cs.LG 版本更新 76%

VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory

VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆

Yuheng Lei, Zhixuan Liang, Hongyuan Zhang, Ping Luo

机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29350 2026-06-30 cs.CV cs.AI 76%

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合

Junzhou Chen, Jindong Wang, Gang Zhou

机构 * Department of Computer Science(计算机科学系) Department of Data Science(数据科学系) William & Mary(威廉玛丽学院)

专题命中 机器人基础模型 :robotic(title);分类 cs.AI、cs.CV

AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12497 2026-06-12 cs.LG cs.RO 新提交 76%

$μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models

$μ$VLA:部分可观测操作中VLA模型的循环记忆研究

Egor Cherepanov, Nikita Kachaev, Daniil Zelezetsky, Aydar Bulatov, Artem Pshenitsyn, Yuri Kuratov, Alexey Skrynnik, Aleksandr I. Panov, Alexey K. Kovalev

机构 * CogAI Lab, Moscow, Russia(CogAI实验室,莫斯科,俄罗斯) MIRAI, Moscow, Russia(MIRAI,莫斯科,俄罗斯)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.LG

AI总结 针对VLA模型在部分可观测场景中的记忆缺失问题,提出仅通过可学习记忆令牌和截断反向传播时间实现最小化循环记忆增强,在MIKASA-Robo上将训练任务成功率从0.42提升至0.84,并在LIBERO上保持全可观测性能。

Comments 34 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07931 2026-05-15 cs.CV cs.AI 76%

One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

每帧一个令牌:重新考虑世界模型中的视觉带宽

Zuojin Tang, Shengchao Yuan, Xiaoxin Bai, Zhiyuan Jing, De Ma, Gang Pan, Bin Liu

机构 * Zhejiang University(浙江大学) Central South University(中南大学) Harbin Institute of Technology(哈尔滨工业大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)

专题命中 机器人基础模型 :world model(title);分类 cs.AI、cs.CV

AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10426 2026-05-14 cs.CV cs.AI 76%

CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

CoWorld-VLA:面向自动驾驶的多专家世界模型中的思考

Minqing Huang, Yujiao Xiang, Zihan Liang, Jiajie Huang, Jingqi Wang, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang, Gong Che

机构 * Afari Intelligent Drive(Afari智能驾驶公司) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学)

专题命中 机器人基础模型 :world model(title);分类 cs.AI、cs.CV

AI总结 本文提出CoWorld-VLA,通过多专家世界推理框架,利用显式条件指导动作规划,提升自动驾驶的场景生成与路径规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03293 2025-06-05 cs.RO cs.CV 76%

Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning

Junjie Wen, Minjie Zhu, Yichen Zhu, Zhibin Tang, Jinming Li, Zhongyi Zhou, Chengmeng Li, Xiaoyu Liu, Yaxin Peng, Chaomin Shen, Feifei Feng

专题命中 机器人基础模型 :robot foundation model(title);分类 cs.RO、cs.CV

Comments Accepted by ICML 2025. The project page is available at: http://diffusion-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15275 2026-07-17 cs.RO cs.AI cs.LG 新提交 75%

RoboTTT: Context Scaling for Robot Policies

RoboTTT:机器人策略的上下文扩展

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA(英伟达公司) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人基础模型 :manipulation(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。

Comments Project website: http://research.nvidia.com/labs/gear/robottt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 75%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 75%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06001 2026-07-03 cs.RO cs.AI cs.CV 版本更新 75%

Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration

恢复VLA模型中的语言基础:无需训练的注意力重校准方法

Ninghao Zhang, Bin Zhu, Shijie Zhou, Jingjing Chen

机构 * Tsinghua University(清华大学) Singapore Management University(新加坡管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对VLA模型在分布外指令下出现“语言盲视”问题,提出无需训练的注意力重校准方法IGAR,通过调整注意力分布恢复语言指令影响,在LIBERO基准和真实机器人上有效减少错误执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18960 2026-06-16 cs.LG cs.CV cs.RO 版本更新 75%

AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

AVA-VLA: 通过主动视觉注意力改进视觉-语言-动作模型

Lei Xiao, Jifeng Li, Juntao Gao, Feiyang Ye, Yan Jin, Jingjing Qian, Jing Zhang, Yong Wu, Xiaoyuan Yu

机构 * LiAuto Inc.(LiAuto公司) Beijing University of Technology(北京理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对VLA模型忽视历史信息的问题,提出AVA-VLA框架,利用循环状态近似信念并引入主动视觉注意力动态重加权视觉令牌,在LIBERO和CALVIN等基准上取得最优性能。

Comments Accepted at CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11906 2026-06-11 cs.CL 新提交 75%

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models

语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性

Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);robotic(abstract)

AI总结 本研究通过将LIBERO基准翻译成十种语言,首次系统评估了VLA模型的多语言鲁棒性,发现非英语指令下成功率下降30-50%,并基于步骤级语言敏感性提出推理时对齐干预,显著提升性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03598 2026-06-04 cs.RO cs.AI cs.CV 75%

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

PHASER: 面向视觉-语言-动作模型的相位感知与语义经验回放

Ziyang Chen, Shaoguang Wang, Weiyu Guo, Qianyi Cai, He Zhang, Pengteng Li, Yiren Zhao, Yandong Guo

机构 * Thrust of AI, HKUST(Guangzhou)(人工智能 thrust,香港科技大学(广州)) AI 2 Robotics, Shenzhen, China(人工智能与机器人,深圳,中国)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出PHASER框架,通过相位感知容量分配和多模态干扰路由策略,结合自动相位提取管线Auto-PC,解决VLA模型在持续学习中的灾难性遗忘问题,在LIBERO基准上平均成功率提升高达31%。

Comments 20 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏