arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 160 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 160 篇

2603.22876 2026-06-30 cs.RO cs.AI 88%

Grounding Sim-to-Real Generalization in Robotic Manipulation: An Empirical Study with Vision-Language-Action Models

在机器人操作中建立仿真到现实泛化:基于视觉-语言-动作模型的实证研究

Ruixing Jin, Zicheng Zhu, Ruixiang Ouyang, Sheng Xu, Bo Yue, Zhizheng Wu, Guiliang Liu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 部署与泛化 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文通过四个维度探讨仿真到现实泛化的决定因素,提出评估协议并释放资源以建立标准化基准,提升机器人操作策略的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16211 2025-06-23 cs.RO 86%

ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models

Puhao Li, Yingying Wu, Ziheng Xi, Wanlin Li, Yuzhe Huang, Zhiyuan Zhang, Yinghan Chen, Jianan Wang, Song-Chun Zhu, Tengyu Liu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Lab of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) Astribot Inc.(Astribot公司)

专题命中 部署与泛化 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO

Comments Website: https://controlvla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09613 2026-05-12 cs.RO cs.CV 86%

SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation

SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应

Narsimha Menga, Parikshit Sakurikar, Amirreza Rouhi, Satya Sai Reddy, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 部署与泛化 :VLA(title,title_cn);robot foundation model(abstract);分类 cs.RO、cs.CV

AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11921 2025-12-16 cs.RO cs.AI 84%

Towards Accessible Physical AI: LoRA-Based Fine-Tuning of VLA Models for Real-World Robot Control

迈向可及的物理AI:基于LoRA的VLA模型在现实机器人控制中的微调

Abdullah Yahya Abdullah Omaisan, Ibrahim Sheikh Mohamed

机构 * Independent Researchers(独立研究者)

专题命中 部署与泛化 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于LoRA的VLA模型微调方法,使大规模VLA模型能在消费级GPU上高效运行,实现在低成本机器人平台上的现实部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07430 2026-04-10 cs.CV 83%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 部署与泛化 :embodied foundation model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16444 2026-02-20 cs.RO cs.AI cs.LG 82%

RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation

RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务

Yixue Zhang, Kun Wu, Zhi Gao, Zhen Zhao, Pei Ren, Zhiyuan Xu, Fei Liao, Xinhua Wang, Shichao Fan, Di Wu, Qiuxuan Feng, Meng Li, Zhengping Che, Chang Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Beijing Institute of Technology(北京理工大学) The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 部署与泛化 :VLA(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05378 2026-05-28 cs.CL cs.CV 81%

ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving

ICR-Drive:面向端到端语言驱动自动驾驶的指令反事实鲁棒性

Kaiser Hamid, Can Cui, Nade Liang

机构 * Texas Tech University(德克萨斯科技大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);embodied foundation model(abstract);分类 cs.CV

AI总结 提出ICR-Drive框架,通过生成四类扰动指令(改写、歧义、噪声、误导)并基于CARLA仿真评估,揭示语言条件驾驶模型对指令变化的脆弱性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 872-880

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02881 2026-05-11 cs.RO 81%

MolmoAct2: Action Reasoning Models for Real-world Deployment

MolmoAct2:面向现实部署的动作推理模型

Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊公司) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 部署与泛化 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。

Comments 31 pages, project page: https://allenai.org/blog/molmoact2

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03233 2025-08-28 cs.RO 81%

GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

Shengliang Deng, Mi Yan, Songlin Wei, Haixin Ma, Yuxin Yang, Jiayi Chen, Zhiqi Zhang, Taoyu Yang, Xuheng Zhang, Wenhao Zhang, Heming Cui, Zhizheng Zhang, He Wang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);action model(abstract);embodied foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12690 2026-06-12 cs.RO cs.AI 新提交 81%

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence

EWAM:一种用于具身智能闭环在线自适应的增强世界动作模型

Xin Zhou, Cong Miao

机构 * Astronex Robotics Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出EWAM架构,基于冻结的Cosmos3骨干网络,通过四个轻量级神经层实现零样本在线自适应,无需微调或额外演示数据,显著减少新任务布局的部署数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07217 2026-06-08 cs.RO cs.CV cs.LG 新提交 80%

Robotic Policy Adaptation via Weight-Space Meta-Learning

通过权重空间元学习实现机器人策略自适应

Christian Bianchi, Siamak Yousefi, Alessio Sampieri, Andrea Roberti, Luca Rigazio, Fabio Galasso, Luca Franco

机构 * ItalAI University of Verona(威尼斯大学) Sapeinza University of Rome(罗马萨佩因扎大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出WIZARD框架,通过权重空间元学习从语言指令和演示视频生成任务特定LoRA参数,无需微调即可适应新任务,在LIBERO上性能提升高达14倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04907 2026-06-16 cs.RO 版本更新 79%

WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation

WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模

Ning Yang, Yan Huang, Kaiwen Peng, Ziheng He, Kai Wang, Cui Miao, Kailin Lyu, Guo Li, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) FiveAges National University of Defense Technology(国防科技大学) Tsinghua University(清华大学) GigaAI

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO

AI总结 提出WAM-Nav,一种联合学习动作生成与潜在视觉预测的非对称扩散Transformer模型,通过共享扩散Transformer实现长时程动作与短时程视觉预测的联合扩散,并引入双流上下文条件机制和目标对齐模块,在统一策略下支持图像目标、点目标和无目标导航,在ClutterScenes和InternScenes基准上分别提升15.7%和3.3%的成功率,并在真实环境中实现85%的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10363 2026-06-10 cs.RO 新提交 79%

HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation

HiMem-WAM: 用于机器人操作的分层记忆门控世界动作模型

Xiaoquan Sun, Ruijian Zhang, Chen Cao, Yihan Sun, Jiahui Chen, Zetian Xu, Bo Chen, Haijier Chen, Zhen Yang, Jiarun Zhu, Yijun Hong, JingZhe Xu, Jingrui Pang, Mingqi Yuan, Jiayu Chen

机构 * The University of Hong Kong(香港大学) INFIFORCE Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Southern University of Science and Technology(南方科技大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO

AI总结 提出分层记忆门控世界动作模型HiMem-WAM,通过分层潜在动作框架和边界触发记忆更新,提升长时域机器人操作的任务相关记忆与泛化鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10980 2026-02-12 cs.RO 79%

RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation

RADAR:通过现实动态、空间-物理智能和自主评估进行视觉-语言-动作泛化基准测试

Yuhao Chen, Zhihao Zhan, Xiaoxin Lin, Zijian Song, Hao Liu, Qinhan Lyu, Yubo Zu, Xiao Chen, Zhiyuan Liu, Tao Pu, Tianshui Chen, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 部署与泛化 :vision-language-action(title);VLA(abstract);分类 cs.RO

AI总结 RADAR通过现实动态、空间-物理智能和自主评估,系统评估VLA模型在现实环境中的泛化能力,揭示其在物理动态和空间推理上的脆弱性。

Comments 12 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19789 2026-01-15 cs.LG 79%

What Can RL Bring to VLA Generalization? An Empirical Study

RL能为VLA泛化带来什么?一项实证研究

Jijia Liu, Feng Gao, Bingwen Wei, Xinlei Chen, Qingmin Liao, Yi Wu, Chao Yu, Yu Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 部署与泛化 :VLA(title,abstract);分类 cs.LG

AI总结 本研究通过实证分析发现,PPO在提升VLA的语义理解和执行鲁棒性方面优于SFT,同时保持视觉鲁棒性,为VLA泛化提供了有效的方法。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27881 2026-07-31 cs.RO cs.AI 新提交 79%

RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents

RoboBRIDGE:一种将策略桥接至鲁棒现实世界机器人智能体的模块化框架

Sihyung Yoon, Minjong Yoo, Sanghyun Ahn, Seojeong Choi, Honguk Woo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对视觉-语言-动作模型部署为机器人智能体的缺陷,提出 RoboBRIDGE 模块化框架,通过五大协同模块结合预训练 VLAs 构建鲁棒智能体,在多基准和现实场景中性能优于现有方案。

Comments Accepted to IROS 2026. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08877 2026-07-13 cs.RO cs.LG 新提交 79%

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

FlowDAgger:在潜在空间中对生成式机器人策略进行人工参与的自适应调整

Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 部署与泛化 :VLA(abstract_cn);robot foundation model(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 研究针对预训练生成式机器人策略在实际部署中出现的问题,提出FlowDAgger方法,通过动作反转从人工干预获取监督,在模拟及现实操纵中评估,该方法优于基线且能保留预训练技能,为机器人基础模型自适应调整提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10094 2026-05-13 cs.RO cs.AI 79%

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

检索后再引导:生成式视觉-语言-动作模型的在线成功记忆用于测试时适应

Jianchao Zhao, Huoren Yang, Yusong Hu, Yuyang Gao, Qiguan Ou, Cong Wan, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) One Robotics Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种在线成功记忆引导的测试时适应框架,用于生成式视觉-语言-动作模型,在重复或缓慢变化的环境中通过重用成功经验提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07381 2026-05-11 cs.RO cs.AI 79%

Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation

通过锚点中心适应摆脱机器人操作中的多样性陷阱

Yanzhe Chen, Kevin Yuchen Ma, Qi Lv, Yiqi Lin, Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Institude for Information Research, A STAR(A*STAR信息研究所)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01801 2025-12-24 cs.RO cs.LG 79%

GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation

GR-RL:为长周期机械操作实现灵活与精确

Yunfei Li, Xiao Ma, Jiafeng Xu, Yu Cui, Zhongren Cui, Zhigang Han, Liqun Huang, Tao Kong, Yuxiao Liu, Hao Niu, Wanli Peng, Jingchao Qiao, Zeyu Ren, Haixin Shi, Zhi Su, Jiawen Tian, Yuyang Xiao, Shenyu Zhang, Liwei Zheng, Hang Li, Yonghui Wu

机构 * ByteDance(字节跳动)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);robot foundation model(abstract);分类 cs.RO、cs.LG

AI总结 GR-RL通过多阶段训练管道,将通用VLA策略转化为擅长长周期精确操作的专家策略,成功实现自主系鞋带任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24008 2026-07-28 cs.RO 新提交 77%

FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

FutureRTC:基于预期条件动作分块的实时机器人执行

Hai Jiang, Yixian Zou, Binbin Liang, Boqian Liu, Fanman Meng, Shuaicheng Liu

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究视觉-语言-动作策略实时部署中异步执行的问题,提出FutureRTC框架,通过状态校正和观测预测模块及策略一致性损失,无需修改底层策略,有效提升对推理延迟的鲁棒性,实现更优轨迹、执行速度和任务成功率。

Comments Project Website: https://jianghaiscu.github.io/FutureRTC_proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09023 2026-05-20 cs.RO 77%

TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation

TwinRL: 基于数字孪生的强化学习用于真实世界机器人操作

Qinwen Xu, Jiaming Liu, Rui Zhou, Shaojun Shi, Nuowei Han, Zhuoyang Liu, Chenyang Gu, Shuo Gu, Yang Yue, Gao Huang, Wenzhao Zheng, Sirui Han, Peng Jia, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出TwinRL框架,通过数字孪生与真实世界协同训练,提升视觉-语言-动作模型在真实世界中的探索效率和收敛速度,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20503 2026-03-11 cs.RO cs.AI cs.CL cs.CV cs.LG 77%

Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review

基于基础模型的具身AI在移动服务机器人中的应用:系统综述

Matthew Lisondra, Beno Benhabib, Goldie Nejat

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文系统综述了基础模型在移动服务机器人中的应用,探讨了其在具身AI中的整合、核心挑战及未来研究方向。

Comments v2: Expanded systematic review; resubmitted to Robotics

Journal ref Robotics 2026, 15(3), 55

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03310 2026-02-04 cs.RO cs.AI cs.CV cs.LG 77%

RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization

RDT2:探索UMI数据的缩放极限以实现零样本跨具身泛化

Songming Liu, Bangguo Li, Kai Ma, Lingxuan Wu, Hengkai Tan, Xiao Ouyang, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 RDT2通过三阶段训练配方实现零样本跨具身泛化,提升机器人在开放词汇任务中的表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04265 2026-07-07 cs.RO cs.AI 新提交 76%

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO、cs.AI

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 76%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO、cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06356 2026-02-03 cs.LG cs.AI q-bio.BM 76%

Reaction Prediction via Interaction Modeling of Symmetric Difference Shingle Sets

通过对称差鳞片集的交互建模进行反应预测

Runhan Shi, Letian Chen, Gufeng Yu, Yang Yang

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学)

专题命中 部署与泛化 :action model(title);分类 cs.AI、cs.LG

AI总结 ReaDISH通过引入对称差鳞片编码和几何-结构交互注意力机制,提升了反应预测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02405 2025-08-05 cs.RO cs.CV 76%

Improving Generalization of Language-Conditioned Robot Manipulation

Chenglin Cui, Chaoran Zhu, Changjae Oh, Andrea Cavallaro

机构 * Centre for Intelligent Sensing, Queen Mary University of London(智能传感中心,伦敦女王玛丽大学) Idiap Research Institute and École Polytechnique Fédérale de Lausanne(Idiap研究机构和日内瓦联邦理工学院)

专题命中 部署与泛化 :language-conditioned robot(title);分类 cs.RO、cs.CV

Comments 7 pages,18 figures,2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22338 2026-07-29 cs.RO cs.AI cs.LG 版本更新 75%

RoboMME-Interference: Benchmarking Robot Memory Under Interference

干扰下的机器人记忆基准测试

Soumil Rathi

机构 * Independent Researcher(独立研究员)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出RoboMME-Interference基准,通过跨会话干扰评估机器人长期记忆能力,发现现有系统在干扰下性能显著下降。

Comments 9 pages, 5 figures. v2: adds a retrieval section showing the interference decay is recoverable

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10181 2026-04-13 cs.RO cs.AI cs.CV 75%

Dejavu: Towards Experience Feedback Learning for Embodied Intelligence

Dejavu:迈向具身智能的经验反馈学习

Shaokai Wu, Yanbiao Ji, Qiuchang Li, Zhiyi Zhang, Qichen He, Wenyuan Xie, Guodong Zhang, Bayram Bayramli, Yue Ding, Hongtao Lu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Dejavu框架,通过经验反馈网络增强冻结的视觉-语言-动作策略,提升具身智能任务的适应性、鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏