arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 566 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 566 篇

2510.21817 2025-10-28 cs.RO cs.CL cs.LG 62%

VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting

Xiaoyu Liu, Chaoyou Fu, Chi Yan, Chu Wu, Haihan Gao, Yi-Fan Zhang, Shaoqi Dong, Cheng Qian, Bin Luo, Xiuyong Yang, Guanwu Li, Yusheng Cai, Yunhang Shen, Deqiang Jiang, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云图实验室) CASIA(中国科学院自动化研究所) Fourier Intelligence Inc.(傅里叶智能公司)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO、cs.LG

Comments Homepage: https://lxysl.github.io/VITA-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04246 2025-10-07 cs.RO cs.AI 62%

ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context

Huiwon Jang, Sihyun Yu, Heeseung Kwon, Hojin Jeon, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD UC Berkeley(伯克利大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

Comments Project page: https://huiwon-jang.github.io/contextvla

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00406 2025-10-02 cs.RO cs.CV 62%

VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators

Hengtao Li, Pengxiang Ding, Runze Suo, Yihao Wang, Zirui Ge, Dongyuan Zang, Kexian Yu, Mingyang Sun, Hongyin Zhang, Donglin Wang, Weihua Su

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) OpenHelix Team(OpenHelix团队) Fudan University(复旦大学) Zhengzhou University(郑州大学) BUPT(北京邮电大学) Hebei University of Technology(河北工业大学)

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18865 2025-09-24 cs.RO cs.LG 62%

Bi-VLA: Bilateral Control-Based Imitation Learning via Vision-Language Fusion for Action Generation

Masato Kobayashi, Thanpimon Buamanee

机构 * D3 Center, The University of Osaka(大阪大学D3中心) Graduate School of Information Science and Technology, The University of Osaka(大阪大学信息科学与技术研究生院) Graduate School of Maritime Sciences, Kobe University(兵库大学海运研究生院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15155 2025-09-19 cs.LG cs.RO 62%

Self-Improving Embodied Foundation Models

Seyed Kamyar Seyed Ghasemipour, Ayzaan Wahid, Jonathan Tompson, Pannag Sanketi, Igor Mordatch

机构 * Generalist Google DeepMind(谷歌DeepMind)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO、cs.LG

Comments Appearing in the Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16292 2025-08-25 cs.AI cs.RO 62%

Do What? Teaching Vision-Language-Action Models to Reject the Impossible

Wen-Han Hsieh, Elvis Hsieh, Dantong Niu, Trevor Darrell, Roei Herzig, David M. Chan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17294 2025-07-30 cs.RO cs.LG 62%

VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback

Jianxin Bi, Kevin Yuchen Ma, Ce Hao, Mike Zheng Shou, Harold Soh

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09160 2025-07-15 cs.RO cs.LG 62%

Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization

Jialei Huang, Shuo Wang, Fanqi Lin, Yihang Hu, Chuan Wen, Yang Gao

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01016 2025-07-02 cs.RO cs.CV 62%

VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers

Yating Wang, Haoyi Zhu, Mingyu Liu, Jiange Yang, Hao-Shu Fang, Tong He

机构 * Shanghai AI Lab(上海人工智能实验室) Tongji(同济) USTC(中国科学技术大学) ZJU(浙江大学) NJU(南京大学) SJTU(上海交通大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08185 2025-06-17 cs.CV cs.AI 62%

Agentic Surgical AI: Surgeon Style Fingerprinting and Privacy Risk Quantification via Discrete Diffusion in a Vision-Language-Action Framework

Huixin Zhan, Jason H. Moore

机构 * Cedars-Sinai Medical Center(西达萨凡纳医学中心)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04693 2025-01-16 cs.RO cs.AI 62%

Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding

Joshua Jones, Oier Mees, Carmelo Sferrazza, Kyle Stachowicz, Pieter Abbeel, Sergey Levine

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01971 2024-10-04 cs.RO cs.LG 62%

Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust

Asher J. Hancock, Allen Z. Ren, Anirudha Majumdar

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

Comments Website: https://aasherh.github.io/byovla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08283 2026-07-16 cs.RO 版本更新 61%

TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning

TFP:用于视觉运动学习的时间条件记忆融合策略

Yushen Liang, Yue Peng, Baosheng Jin, Tianluo Zhang, Xinyu Zhang, Shuyi Zhou, Zhuoran Chen, Xinqi Liu, Shenji Wan

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 研究针对视觉运动学习中阶段依赖操作问题,提出时间条件记忆融合策略(TFP),通过维护任务进展信念并注入动作解码器来改进VLA策略,在多个任务上提升成功率,证明紧凑且对事件敏感的记忆动态可优化VLA策略。

Comments Accepted to the SemRob 2026 Workshop at Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23147 2026-06-23 cs.RO 新提交 61%

Assistron: Bayesian Shared Autonomy with Off-the-shelf Vision-Language-Action Models

Assistron: 基于现成视觉-语言-动作模型的贝叶斯共享自主

Pinhao Song, Ze Fu, Yutong Hu, Renaud Detry

机构 * KU Leuven(鲁汶大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 提出Assistron共享自主模型,利用VLA模型自主执行宏观运动,仅在关键失败点请求人类干预,无需微调VLA,显著提升任务成功率并降低人类工作量。

Comments Using VLA in assistive robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16458 2026-06-16 cs.RO 新提交 61%

RHO: Your Coding Agent is Secretly a Roboticist

RHO:你的编码代理其实是个机器人专家

Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) AMD

专题命中 机器人基础模型 :robotics(abstract,comments);分类 cs.RO

AI总结 提出RHO范式,通过训练时搜索神经符号化多文件策略库,实现机器人任务的高效零样本泛化,在LIBERO-PRO和Robosuite上分别达到45%和70%的成功率,显著优于现有方法。

Comments 46 pages, 9 figures, 15 tables. Project page: https://rho-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13474 2026-08-14 cs.RO 新提交 57%

Decoding Task Progress from VLA Representations

从视觉-语言-动作模型(VLA)表征中解码任务进度

Atiksh Bhardwaj, Edward Weiyi Duan, Prithwish Dan, Wei-Chiu Ma, Preston Culbertson

机构 * Cornell University(康奈尔大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 该研究利用机制可解释性探究VLA的π₀.₅残差流,发现任务进度可从激活值线性读取,基于此构建的探测器可作为无标签OOD检测器,性能接近最先进方法,为监控部署的视觉运动策略提供轻量可解释路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 57%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04527 2026-08-10 cs.RO 版本更新 57%

Retrieve in Time, Correct in Frequency

及时检索,频率校正

Yuze Fan, Yue Cao, Pengjie Gao, Haojia Gao, Guangqiu Guo, Ziyue Zhang, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

机构 * Research Institute of Tsinghua University in Shenzhen(清华大学深圳研究院) Everwise-Tech Co., Ltd.(恒智慧科技有限公司) Tongji University(同济大学) Fudan University(复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对冻结 VLA 策略长 horizon 操作的误差问题,提出无需训练的 RTCF 框架,通过渐进式记忆对齐和低频残差转移,在 LIBERO 实验中提升了操作成功率且延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24485 2026-08-10 cs.RO 版本更新 57%

τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision

τ:从未来视觉监督中学习触觉增强的视觉-语言-动作模型

Ning Cheng, Jinan Xu, Wanlin Li, Yangzhi Chen, Jing Gao, Yiqun Wang, Kelan Peng, Wenjuan Han

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 研究旨在解决学习触觉表示并应用于VLA模型的挑战,提出τ框架从未来视觉监督学习动作条件时空触觉表示,结合视觉语言特征用于动作生成,引入TacAura数据集,实验证明其性能优于现有模型且能泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10055 2026-08-10 cs.RO 版本更新 57%

STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations

STRONG-VLA: 多模态扰动下视觉-语言-动作模型的解耦鲁棒性学习

Yuhan Xie, Yuping Yan, Yunqi Zhao, Handing Wang, Yaochu Jin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xidian University(西安电子科技大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 本文提出STRONG-VLA框架,通过解耦鲁棒性学习与任务对齐优化,提升多模态扰动下的视觉-语言-动作模型鲁棒性与任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05738 2026-08-07 cs.RO 新提交 57%

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 57%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 57%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04633 2026-08-06 cs.RO 新提交 57%

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA:面向视觉-语言-动作模型的指令感知空间表示对齐方法

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文针对现有VLA方法忽略指令指定目标物体3D几何的问题,提出Mind-VLA方法,通过对齐目标物体相关特征实现指令感知3D理解,在LIBERO、CALVIN及真实机器人遮挡任务上性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03563 2026-08-05 cs.RO 新提交 57%

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

统一视觉运动目标:监督视觉语言智能体(VLA)超越物理动作

Zhenyang Feng, Unnat Jain

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究针对VLA模型训练中视觉语言高级表示与机器人低级动作的不匹配问题,提出UVT统一视觉运动目标,无需改动架构或额外数据,在仿真与真实双臂任务中提升了VLA的训练效率、性能与鲁棒性

Comments Accepted at IROS 2026. Project page: https://unified-visuomotor-targets.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01013 2026-08-04 cs.RO 新提交 57%

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

针对新型机器人实体的OpenVLA-OFT的RL引导

Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文针对形态特殊的缆绳驱动并联机器人,无需实体专属数据集,通过仿真中PPO与GRPO两阶段强化学习,提升了OpenVLA-OFT的指令执行成功率,为仅靠RL生成适配全新实体的语言条件控制器提供了证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17977 2026-08-03 cs.RO 版本更新 57%

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26807 2026-07-30 cs.RO 新提交 57%

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

基于运动学的路由、基于观测的执行:MoE增强视觉-语言智能体(VLA)中的运动学监督专家路由

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究针对MoE增强VLA的专家路由问题,提出KinRT方法,通过运动学聚类监督路由器训练,在两个平台上验证其性能优于现有模型,相关代码与平台将开源。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交 57%

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25516 2026-07-29 cs.RO 新提交 57%

A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models

用于视觉语言动作模型测试时模态适应的因果感知推理-诊断-细化框架

Haoyu Zhang, Yuwei Wu, Jin Chen, Gao Zhi, Zhenxin Diao, Mingyang Gao, Kun Wu, Yongchun Liu, Fan Li

机构 * Beijing Institute of Technology(北京理工大学) AInnovation Co. Ltd.(A创新有限公司) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 针对VLA模型模态融合问题,提出因果感知推理-诊断-细化框架,通过视觉观察推理、因果效应诊断及动作预测细化实现模态适应,设计因果感知动作细化器,实验验证了该框架在多VLA主干上提升整体性能的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏