arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 293 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 262 篇

2608.02326 2026-08-05 cs.RO 版本更新 89%

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

ChainVLA:通过统一执行状态串联视觉-语言-动作查询以实现长 horizon 操纵

Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 ChainVLA 是 12 亿参数的 VLA 策略,通过联合可修订的执行状态串联查询,结合进展上下文与运动尾部,在长 horizon 操纵任务中大幅提升成功率, ablation 验证了两个组件的关键作用。

Comments 13 pages (9 main + 4 appendix), 4 figures. Project page: https://muqy1818.github.io/chainvla-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15671 2026-08-04 cs.RO 版本更新 89%

Long-Term Memory for VLA-based Agents in Open-World Task Execution

基于VLA的智能体长期记忆在开放世界任务执行中的应用

Xu Huang, Weixin Mao, Yinhao Li, Hua Chen, Jiabao Zhao

机构 * Nanjing University(南京大学) LimX Dynamics(LimX 动态)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出ChemBot框架,通过双层记忆和MCP服务器提升复杂化学实验中的任务执行效率与安全性。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17977 2026-08-03 cs.RO 版本更新 89%

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18016 2026-07-28 cs.RO 版本更新 89%

Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation

人形机器人视觉语言动作闭环:用于可验证移动操作的持久3D对象令牌

Peng Ren, Haoyang Ge, Jiang Zhao, Cong Huang, Yukun Shi, Pei Chi, Kai Chen

机构 * BUAA(北京航空航天大学) DeepCybo(深灵机器人) ZGCI(未提及具体中文译名)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究人形机器人视觉语言动作中对象状态差异问题,提出持久对象令牌化方法(POT)并实例化为POT-VLA,通过RGB-D观察维护3D对象记录,转换为对象令牌用于动作生成与验证,实验表明该方法提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 89%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 89%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.CV

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21445 2026-06-23 cs.RO 版本更新 89%

VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies

VLA 知道自己的极限:机器人策略的自适应执行视界

Haoxuan Wang, Gengyu Zhang, Yan Yan, Ramana Rao Kompella, Gaowen Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Cisco Research(思科研究)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对流式视觉-语言-动作模型中执行视界影响性能的问题,提出 AutoHorizon 方法,通过分析注意力权重动态估计每块动作的执行视界,提升机器人操作任务性能。

Comments ECCV 2026. Project page at https://hatchetproject.github.io/autohorizon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13458 2026-07-21 cs.NI 版本更新 88%

From Traditional Automation to Embodied Wireless Intelligence: Vision-Language-Action Empowered Physics-Aware Communication Networks

从传统自动化到具身无线智能:视觉-语言-动作赋能的物理感知通信网络

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract)

AI总结 提出具身智能基站(eBS)范式,采用视觉-语言-动作(VLA)流水线,使基站具备环境感知、因果物理推理和物理感知动作生成能力,实现从规则自动化到具身智能的转变。

Comments submitted for possible jounal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05868 2026-08-11 cs.RO 版本更新 88%

AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models

AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型

Hyeongjun Heo, Seungyeon Woo, Sang Min Kim, Junho Kim, Junho Lee, Yonghyeon Lee, Young Min Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 AnyCamVLA通过零样本相机适应提升视觉-语言-动作模型在视角变化下的鲁棒性,适用于任何RGB策略。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 88%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06491 2026-07-21 cs.RO cs.AI 版本更新 88%

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA: 学习速度可控的视觉-语言-动作策略

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

机构 * RUC(中国人民大学) FDU(福建大学) UNC(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO、cs.AI

AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21391 2026-06-16 cs.RO cs.AI 版本更新 88%

From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges

从噪声到意图:基于残差桥的生成式VLA策略锚定

Yiming Zhong, Yaoyu He, Zemin Yang, Pengfei Tian, Yifan Huang, Qingqiu Huang, Xinge Zhu, Yuexin Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.AI

AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20771 2026-07-28 cs.RO cs.AI cs.LG 版本更新 88%

Emergent Compositional Skills in Mixture-of-Experts VLAs

混合专家VLA中的涌现组合技能

Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali, Dhruv Shah

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 研究从专家演示端到端学习组合机器人策略的问题,用简化MoE动作头训练VLA,发现其能将任务分解,学习到的专家可跨任务重用,MoE在展示专家专业化时与整体基线性能匹配,向模块化、可解释机器人策略迈进。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05498 2026-08-14 cs.RO 版本更新 87%

JailWAM: Jailbreaking World Action Models in Robot Control

JailWAM: 在机器人控制中对World Action Models进行劫持

Hanqing Liu, Songping Wang, Jiahuan Long, Jiacheng Hou, Jialiang Sun, Chao Li, Yang Yang, Wei Peng, Xu Liu, Tingsong Jiang, Yao Mu, Wen Yao

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部重点实验室) PR Lab, Nanjing University(南京大学PR实验室) Defense Innovation Institute, Chinese Academy of Military Science(军事科学院国防创新研究院)

专题命中 VLA模型 :action model(title,title_cn);分类 cs.RO

AI总结 本文提出JailWAM框架,通过三级安全分类体系和三个核心组件,系统评估WAM的安全性,实验表明其能有效暴露物理漏洞,攻击成功率高达84.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01205 2026-06-09 cs.RO 版本更新 87%

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning

ImagineUAV:通过世界-动作建模和动力学规划实现空中视觉语言导航

Xuchen Liu, Jiawei Huang, Shihao Xia, Bingxi Liu, Jinqiang Cui, Jiankun Yang

机构 * Pengcheng Laboratory(鹏城实验室) School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Southern University of Science and Technology(南方科技大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对无人机视觉语言导航中几何不一致和动力学失配问题,提出基于潜视频扩散模型的世界-动作建模框架,通过生成未来观测推断6自由度运动并规划无碰撞轨迹,以1.3B参数在基准和实际飞行中超越先前方法。

Comments Video demo: https://www.youtube.com/watch?v=Ng1alP0yhc0

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02501 2026-08-11 cs.RO cs.CV cs.OS 版本更新 87%

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时

Ling Xu, Borui Li, Hao Wu, Chuyu Han, Xiangyu Li, Mohan Hua, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

机构 * Southeast University(东南大学) Nanjing University(南京大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。

Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15620 2026-07-01 cs.CV cs.RO 版本更新 87%

Towards Generalizable Robotic Manipulation in Dynamic Environments

面向动态环境的通用机器人操作

Heng Fang, Shangru Li, Shuhan Wang, Xuanyang Xi, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。

Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00229 2026-06-09 cs.RO cs.AI cs.LG 版本更新 87%

Continuous Reasoning for Vision-Language-Action

视觉-语言-动作的连续推理

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

机构 * Airoa

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 针对视觉-语言-动作策略中语言与连续控制粒度不匹配的问题,提出一种可共享、可验证的连续推理方法,通过高斯潜变量接口和自验证目标提升机器人任务成功率。

Comments Project page: https://continuous-reasoning.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 86%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05233 2026-06-29 cs.RO 版本更新 86%

MobileManiBench: Simplifying Model Verification for Mobile Manipulation

MobileManiBench:简化移动操作模型验证

Wenbo Wang, Fangyun Wei, QiXiu Li, Xi Chen, Yaobo Liang, Chang Xu, Jiaolong Yang, Baining Guo

机构 * Microsoft Research Asia(微软亚洲研究院) University of Sydney(悉尼大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出仿真优先框架MobileManiBench,基于NVIDIA Isaac Sim和强化学习自动生成多样化移动操作轨迹,包含300K条轨迹,用于验证VLA模型在真实部署前的性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29662 2026-07-27 cs.CV cs.RO 版本更新 86%

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

SAFE-Pruner: 语义注意力引导的未来感知令牌剪枝用于高效视觉-语言-动作操控

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 针对视觉-语言-动作模型推理加速中现有剪枝方法忽略深层视觉信息的问题,提出SAFE-Pruner框架,通过引入未来层注意力线索和语义注意力一致性实现前瞻性令牌剪枝,在仿真和真实实验中取得最高1.89倍加速且成功率下降小于1.7%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31286 2026-06-17 cs.RO cs.AI 版本更新 86%

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation

DeMaVLA:面向可泛化可变形物体操作的视觉-语言-动作基础模型

Taiyi Su, Jian Zhu, Tianjian Wang, Youzhang He, Zitai Huang, Jianjun Zhang, Chong Ma, Hanyang Wang, Tianjiao Zhang, Munan Yin, Weihao Ding, Yi Xu

机构 * Tongji University(同济大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出DeMaVLA模型,采用VLM骨干与动作专家结合流匹配生成连续动作,通过剪枝Transformer层提升效率,并利用大规模真实世界数据和人类反馈数据聚合训练,实现可变形物体折叠操作的多类别泛化。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27284 2026-06-16 cs.RO cs.AI 版本更新 86%

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。

Comments 26 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17640 2026-08-06 cs.RO cs.AI cs.LG 版本更新 86%

RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation

RESample:通过探索性采样构建鲁棒数据增强框架用于机器人操控

Yuquan Xue, Guanxing Lu, Zhenyu Wu, Chuanrui Zhang, Bofang Jia, Zhengyi Gu, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出RESample框架,通过探索性采样机制提升VLA训练数据分布覆盖,有效解决分布外场景下的能力瓶颈问题,实验证明在LIBERO基准和真实机器人任务中性能提升12%。

Comments 8 pages, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13597 2026-07-21 cs.RO cs.AI cs.CV 版本更新 86%

Semantic Anchoring for Robotic Action Representations

用于机器人动作表示的语义锚定

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

机构 * Peking University(北京大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。

Comments Project Page: https://xy02-05.github.io/SemanticMN

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02735 2026-06-09 cs.RO cs.AI cs.LG 版本更新 86%

See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs

看得更少,指定更多:面向可泛化视觉-语言-动作模型的视觉证据预算

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

机构 * Airoa

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出S2框架,通过显式视觉证据预算和细化轨迹语言,改善VLA模型在干扰、外观变化和语义相似任务下的泛化能力。

Comments Project page: https://s2.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06375 2026-08-11 cs.RO 版本更新 85%

$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation

ω-0:一种用于类人机器人协同移动操作的潜在预测世界动作模型

Zhe Li, Zhenzhe Zhang, Yangyang Wei, Wenjie Zhang, Xichen Yuan, Peiyuan Zhi, Gen Li, Xinying Guo, Fengjie Gao, Jianfei Yang, Shanghang Zhang

机构 * NTU(南洋理工大学) PKU(北京大学) BAAI(北京智源人工智能研究院) HKUST(GZ)(香港科技大学(广州))

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出 ω-0 模型,针对类人机器人协同移动操作问题,结合潜在视觉预见与扩散动作生成,在 11 项家庭任务上优于多个基线,还构建了 ω-HOME 数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14852 2026-07-22 cs.RO 版本更新 85%

Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation

迈向类人物理智能:用于机器人操作的终身视觉-语言-动作学习

Yao He, Gan Sun, Wenqi Liang, Fazeng Li, Yang Cong

机构 * South China University of Technology(华南理工大学) University of Trento(特伦托大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究针对机器人操作中可塑性-稳定性权衡难题,提出缓存高效的终身视觉-语言-动作学习框架LifelongVLA。通过双时间尺度LoRA门控模块及缓存高效随机重放策略,有效缓解权衡问题,实现技能扩展、行为保留,减少再训练依赖,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06256 2026-07-16 cs.RO 版本更新 85%

Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition

诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败

Ke Rui, Yushen Zuo, Jiawei Wang, Haoran Jia, Jinming Ma, Weitao Zhou, Minglei Li

机构 * SimpleAI

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。

Journal ref RSS SemRob Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23128 2026-07-08 cs.RO 版本更新 85%

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control

$\pi_0$-EqM:闭环视觉-语言-动作控制的均衡匹配

Huanming Liu, Congsheng Xu, Jianmin Ji, Yao Mu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出$\pi_0$-EqM,用均衡匹配解码器替换$\pi_0$中的流匹配专家,在固定预算下提升机器人操作成功率,并发现残差与成功率之间的非单调关系。

Comments Preprint. 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏