arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 161 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 161 篇

2505.15685 2025-11-04 cs.RO 70%

From Grounding to Manipulation: Case Studies of Foundation Model Integration in Embodied Robotic Systems

Xiuchao Sui, Daiying Tian, Qi Sun, Ruirui Chen, Dongkyu Choi, Kenneth Kwok, Soujanya Poria

机构 * IHPC, Agency for Science, Technology and Research, Singapore(科技研究局智能技术中心,新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments EMNLP 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25122 2025-10-30 cs.RO 70%

NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies

Jiahong Chen, Jing Wang, Long Chen, Chuwei Cai, Jinghui Lu

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Alberta(阿尔伯塔大学) Xiaomi EV(小米电动车) Northeastern University(东北大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14293 2025-10-17 cs.RO cs.AI cs.CV cs.LG 70%

Learning Human-Humanoid Coordination for Collaborative Object Carrying

Yushi Du, Yixuan Li, Baoxiong Jia, Yutang Lin, Pei Zhou, Wei Liang, Yanchao Yang, Siyuan Huang

机构 * Department of Electrical and Electronic Engineering, the University of Hong Kong(香港大学电子与电气工程系) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22195 2025-09-29 cs.RO 70%

Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting

Asher J. Hancock, Xindi Wu, Lihan Zha, Olga Russakovsky, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14317 2025-09-05 cs.RO 70%

ClutterDexGrasp: A Sim-to-Real System for General Dexterous Grasping in Cluttered Scenes

Zeyuan Chen, Qiyang Yan, Yuanpei Chen, Tianhao Wu, Jiyao Zhang, Zihan Ding, Jinzhou Li, Yaodong Yang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PKU-AgiBot Lab(北京大学阿吉机器人实验室) PKU-PsiBot Lab(北京大学Psi机器人实验室) Princeton University(普林斯顿大学)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

Comments Accepted at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07770 2025-08-14 cs.RO 70%

AgentWorld: An Interactive Simulation Platform for Scene Construction and Mobile Robotic Manipulation

Yizheng Zhang, Zhenjun Yu, Jiaxin Lai, Cewu Lu, Lei Han

机构 * Tencent Robotics X(腾讯机器人X) Shanghai Jiao Tong University(上海交通大学)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

Comments Accepted by Conference on Robot Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17462 2025-07-24 cs.CV 70%

ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents

Chang Nie, Guangming Wang, Zhe Lie, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Key Laboratory of System Control and Information Processing, Ministry of Education of China(自动化与智能感知学院,上海交通大学;系统控制与信息处理重点实验室,中华人民共和国教育部)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07395 2025-05-13 cs.RO 70%

ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning

Hongyin Zhang, Zifeng Zhuang, Han Zhao, Pengxiang Ding, Hongchao Lu, Donglin Wang

机构 * Hongyin Zhang(张 Hongyin) Zifeng Zhuang(庄子峰) Han Zhao(赵涵) Pengxiang Ding(丁鹏祥) Hongchao Lu(卢洪超) Donglin Wang(王东林)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09783 2025-01-20 cs.RO 70%

GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation

Weiliang Tang, Jia-Hui Pan, Yun-Hui Liu, Masayoshi Tomizuka, Li Erran Li, Chi-Wing Fu, Mingyu Ding

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17846 2024-10-01 cs.RO cs.AI cs.CL cs.CV cs.LG 70%

Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation

Abdelrhman Werby, Chenguang Huang, Martin Büchner, Abhinav Valada, Wolfram Burgard

专题命中 部署与泛化 :language-conditioned robot(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Code and video are available at http://hovsg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17846 2026-06-18 cs.RO cs.CV cs.LG 新提交 67%

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 技术报告:对齐解锁机器人操作基础模型的规模

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(Qwen团队)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出 Qwen-RobotManip,通过统一的对齐框架(表示、运动和行为维度)实现多源异构操作数据的大规模协同训练,构建约38,100小时预训练语料,在零样本指令跟随、跨本体迁移等泛化能力上超越先前模型。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13328 2026-05-14 cs.RO cs.AI cs.CL cs.CV 67%

What Limits Vision-and-Language Navigation ?

什么是限制视觉-语言导航的因素?

Yunheng Wang, Yuetong Fang, Taowen Wang, Lusong Li, Kun Liu, Junzhe Xu, Zizhao Yuan, Yixiao Feng, Jiaxi Zhang, Wei Lu, Zecui Zeng, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 67%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12705 2025-06-19 cs.RO cs.AI cs.LG 67%

DreamGen: Unlocking Generalization in Robot Learning through Video World Models

Joel Jang, Seonghyeon Ye, Zongyu Lin, Jiannan Xiang, Johan Bjorck, Yu Fang, Fengyuan Hu, Spencer Huang, Kaushil Kundalia, Yen-Chen Lin, Loic Magne, Ajay Mandlekar, Avnish Narayan, You Liang Tan, Guanzhi Wang, Jing Wang, Qi Wang, Yinzhen Xu, Xiaohui Zeng, Kaiyuan Zheng, Ruijie Zheng, Ming-Yu Liu, Luke Zettlemoyer, Dieter Fox, Jan Kautz, Scott Reed, Yuke Zhu, Linxi Fan

机构 * NVIDIA University of Washington(华盛顿大学) KAIST(韩国科学技术院) UCLA(加州大学洛杉矶分校) UCSD(加州大学圣地亚哥分校) CalTech(加州理工学院) NTU(国立台湾大学) University of Maryland(马里兰大学) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments See website for videos: https://research.nvidia.com/labs/gear/dreamgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01143 2025-04-29 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills

Tairan He, Jiawei Gao, Wenli Xiao, Yuanhang Zhang, Zi Wang, Jiashun Wang, Zhengyi Luo, Guanqi He, Nikhil Sobanbab, Chaoyi Pan, Zeji Yi, Guannan Qu, Kris Kitani, Jessica Hodgins, Linxi "Jim" Fan, Yuke Zhu, Changliu Liu, Guanya Shi

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments RSS 2025. Project website: https://agile.human2humanoid.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05963 2025-02-11 cs.LG cs.AI cs.RO 67%

Redefining Robot Generalization Through Interactive Intelligence

Sharmita Dey

专题命中 部署与泛化 :robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.06626 2021-01-01 cs.CV cs.LG cs.RO 67%

On Deep Learning Techniques to Boost Monocular Depth Estimation for Autonomous Navigation

Raul de Queiroz Mendes, Eduardo Godinho Ribeiro, Nicolas dos Santos Rosa, Valdir Grassi

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV、cs.LG

Comments 29 pages, 16 figures. Preprint published in the Elsevier's Robotics and Autonomous Systems journal on November 23, 2020

Journal ref Journal: Robotics and Autonomous Systems, publisher: Elsevier, volume number: 136, year: 2020, page number: 103701

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14028 2026-08-17 cs.RO cs.AI 新提交 62%

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08127 2026-07-10 cs.CV cs.RO 新提交 62%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18363 2026-06-18 cs.RO cs.AI 新提交 62%

Guava: An Effective and Universal Harness for Embodied Manipulation

Guava: 一种有效且通用的具身操作工具框架

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

机构 * University of Maryland College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Pennsylvania(宾夕法尼亚大学) Amazon FAR(亚马逊 FAR)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出Guava框架,通过迭代感知-推理-行动循环、语义动作抽象和多模态观测三大关键设计,将具身操作能力蒸馏到4B开源模型中,在仿真和真实环境中性能媲美前沿专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17040 2026-06-16 cs.RO cs.CV 新提交 62%

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) BUPT(北京邮电大学) GigaAI

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。

Comments Project page: https://r2rdreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03896 2026-06-12 cs.CV cs.RO 版本更新 62%

GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert

GAE: 利用可泛化动作专家释放VLM的物理潜力

Mingyu Liu, Zheng Huang, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Yating Wang, Haoyi Zhu, Hao Chen, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30350 2026-05-29 cs.RO cs.LG 62%

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

DynaFLIP: 通过三模态动力学引导表示重新思考机器人感知

Jusuk Lee, Seungjae Lee, Jonghun Shin, Hoseong Jung, Sungha Kim, Daesol Cho, H. Jin Kim, Jia-Bin Huang, Furong Huang

机构 * Seoul National University(首尔国立大学) University of Maryland, College Park(马里兰大学学院公园分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 部署与泛化 :VLA(abstract_cn);分类 cs.RO、cs.LG

AI总结 提出DynaFLIP,一种动力学感知的多模态预训练框架,通过图像-语言-3D流三元组训练图像编码器,利用单纯形体积最小化与余弦正则化和对比目标对齐三模态,提升机器人操作中的运动理解与泛化能力。

Comments Project website: https://dynaflip-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14245 2026-04-29 cs.LG cond-mat.mtrl-sci cs.AI cs.CE q-bio.BM 62%

Curriculum-guided multimodal representation learning enables generalizable prediction of nanomaterial-protein interactions

基于课程引导的多模态表示学习可实现纳米材料-蛋白质相互作用的通用预测

Hengjie Yu, Kenneth A. Dawson, Haiyun Yang, Shuya Liu, Yan Yan, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所在先进科技研究院) Centre for BioNano Interactions, School of Chemistry, University College Dublin(都柏林大学学院化学系生物纳米相互作用中心) School of Biomolecular and Biomedical Science, UCD Conway Institute of Biomolecular and Biomedical Research(都柏林大学学院生物分子与生物医学科学系,康沃利斯生物分子与生物医学研究学院)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CuMMI模型,通过多阶段课程学习和大规模数据集,实现纳米材料-蛋白质相互作用的通用预测,验证了其在不同数据集上的鲁棒性和可迁移性。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07562 2026-04-21 cs.CL cs.AI cs.CY cs.LG 62%

Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs

基于推理的无监督文本聚类细化方法

Tunazzina Islam

机构 * Department of Computer Science(计算机科学系)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型作为语义评判者,对无监督聚类结果进行推理细化,通过三个阶段提升聚类的连贯性与可解释性,实验证明其在社交媒体数据中优于传统方法。

Comments Accepted to the Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16484 2026-04-21 cs.CV cs.AI 62%

DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks

DexWorldModel:基于因果潜在世界的建模以实现具身任务的自动化学习

Yueci Deng, Guiliang Liu, Kui Jia

机构 * DexForce AI

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLWM模型,通过分离交互语义与视觉噪声提升领域泛化能力,采用双状态测试时训练机制和推测异步推理方法,实现高效长周期任务处理,并通过EmbodiChain框架提升策略鲁棒性,实验表明其在复杂双臂仿真和物理机器人零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23893 2026-03-03 cs.CV cs.RO 62%

AoE: Always-on Egocentric Human Video Collection for Embodied AI

AoE: 始终在线的以自身为中心的人类视频采集用于具身AI

Bowen Yang, Zishuo Li, Yang Sun, Changtao Miao, Yifan Yang, Man Luo, Xiaotong Yan, Feng Jiang, Jinchuan Shi, Yankai Fu, Ning Chen, Junkai Zhao, Pengwei Wang, Guocai Yao, Shanghang Zhang, Hao Chen, Zhe Li, Kai Zhu

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO、cs.CV

AI总结 AoE系统通过利用人类和智能手机低成本采集以自身为中心的现实世界交互数据,解决具身AI的数据稀缺问题,提升现实世界泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08665 2026-01-14 cs.RO cs.CV 62%

VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory

VLingNav:基于适应性推理和视觉辅助语言记忆的具身导航

Shaoan Wang, Yuanfei Luo, Xingyu Chen, Aocheng Luo, Dongyue Li, Chang Liu, Sheng Chen, Yangang Zhang, Junzhi Yu

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 VLingNav通过引入适应性推理和视觉辅助语言记忆,实现了复杂具身导航任务中的高效导航与泛化能力。

Comments Project page: https://wsakobe.github.io/VLingNav-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21126 2025-09-26 cs.LG cs.AI 62%

Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning

Xiefeng Wu, Jing Zhao, Shu Zhang, Mingyu Hu

机构 * Wuhan University(武汉大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10884 2025-09-16 cs.RO cs.CV 62%

Nav-R1: Reasoning and Navigation in Embodied Scenes

Qingxiang Liu, Ting Huang, Zeyu Zhang, Hao Tang

机构 * Shanghai University of Engineering Science(上海工程技术大学) Peking University(北京大学)

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏