arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4111 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4111 篇

2603.28053 2026-03-31 cs.LG 70%

Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL

通过视觉语言嵌入减少Oracle反馈用于基于偏好的强化学习

Udita Ghosh, Dripta S. Raychaudhuri, Jiachen Li, Konstantinos Karydis, Amit Roy-Chowdhury

机构 * AWS AI Labs(AWS AI实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出ROVED框架,结合视觉语言嵌入与针对性Oracle反馈,通过过滤机制减少不确定性样本的Oracle查询,提升鲁棒性与效率,实验证明在机器人任务中显著降低Oracle调用次数。

Comments Accepted at ICRA 2026. Project page:https://roved-icra-2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 70%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26666 2026-03-30 cs.RO 70%

VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation

VLA-OPD: 通过在线策略蒸馏连接离线SFT与在线RL以构建视觉-语言-动作模型

Zhide Zhong, Haodong Yan, Junfeng Li, Junjie He, Tianran Zhang, Haoang Li

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出VLA-OPD框架,通过在线策略蒸馏结合离线SFT与在线RL,解决预训练模型在部署中的分布偏移和灾难性遗忘问题,提升样本效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22892 2026-03-25 cs.LG 70%

VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents

VLGOR:基于视觉-语言知识的离线强化学习用于通用智能体

Pengsen Liu, Maosen Zeng, Nan Tang, Kaiyuan Li, Jing-Cheng Pang, Yunan Liu, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China \& School of Artificial Intelligence, Nanjing University, China Computational Intelligence Center (CIC), School of Computer Artificial Intelligence, Shandong Jianzhu University, Jinan, 250101, China

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出VLGOR框架,结合视觉和语言知识生成虚拟轨迹,提升智能体在未见任务中的泛化能力,实验显示其性能比基线方法高24%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21083 2026-03-18 cs.RO 70%

Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry

双代理强化学习用于自适应和成本感知的视觉惯性里程计

Feiyang Pan, Shenghe Zheng, Chunyan Yin, Guangbin Dou

机构 * Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出双代理强化学习框架,通过智能选择代理和融合代理优化视觉惯性里程计的运行时机和信任度,提升精度与效率的平衡。

Comments Accepted to the CVPR 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09325 2026-03-16 cs.CV cs.AI cs.LG cs.RO 70%

SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens

SegDAC:通过动态物体令牌实现强化学习中的视觉泛化

Alexandre Brown, Glen Berseth

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 SegDAC通过动态物体令牌实现强化学习中的视觉泛化,利用文本引导的分割生成物体掩码,并通过变换器处理动态令牌以保持空间信息,提升了在不同视觉条件下的性能。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21085 2026-03-12 cs.RO 70%

Global End-Effector Pose Control of an Underactuated Aerial Manipulator via Reinforcement Learning

通过强化学习实现轻量化空中机械臂的全局末端姿态控制

Shlok Deshmukh, Javier Alonso-Mora, Sihao Sun

机构 * Department of Cognitive Robotics (CoR), Faculty of Mechanical Engineering, Delft University of Technology(认知机器人系(CoR),机械工程学院,代尔夫特理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文通过强化学习实现轻量化空中机械臂的六自由度末端姿态控制,实验展示了厘米级精度和鲁棒性。

Comments 8 pages, 6 figures, accepted by IEEE ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13459 2026-03-09 cs.RO 70%

Contact-Safe Reinforcement Learning with ProMP Reparameterization and Energy Awareness

具有ProMP重参数化和能量意识的接触安全强化学习

Bingkun Huang, Yuhe Gong, Zewen Yang, Tianyu Ren, Luis Figueredo

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出一种基于任务空间和能量安全的框架,结合PPO和运动原语,通过能量意识的笛卡尔阻抗控制器实现安全交互,提升复杂机器人任务的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16050 2026-03-09 cs.RO 70%

Bi-AQUA: Bilateral Control-Based Imitation Learning for Underwater Robot Arms via Lighting-Aware Action Chunking with Transformers

Bi-AQUA:基于双侧控制的水下机器人臂模仿学习框架:通过光敏感动作分块与Transformer实现

Takeru Tsunoori, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 Bi-AQUA通过显式光照建模与双侧控制结合,提升水下机器人操作的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04351 2026-03-05 cs.RO 70%

Tendon Force Modeling for Sim2Real Transfer of Reinforcement Learning Policies for Tendon-Driven Robots

肌腱力建模用于强化学习策略的sim2real迁移:用于肌腱驱动机器人的应用

Valentin Yuryev, Josie Hughes

机构 * CREATE Lab, Swiss Federal Institute of Technology Lausanne (EPFL)(CREATE实验室,瑞士联邦理工学院洛桑分校(EPFL))

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出一种基于变压器的肌腱力建模方法,通过模拟与强化学习结合,提升真实机器人中肌腱驱动手指的控制性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16858 2026-03-04 cs.RO 70%

Towards an Adaptive Social Game-Playing Robot: An Offline Reinforcement Learning-Based Framework

迈向自适应社交游戏机器人:一种基于离线强化学习的框架

Soon Jynn Chu, Raju Gottumukkala, Alan Barhorst

机构 * Department of Mechanical Engineering, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校机械工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于离线强化学习的自适应社交游戏机器人框架,通过整合多模态情绪识别与自适应响应,提升机器人在游戏场景中对用户情绪的适应能力。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14865 2026-02-06 cs.LG 70%

Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning

策略分层子空间用于持续离线强化学习

Anthony Kobanda, Rémy Portelas, Odalric-Ambrym Maillard, Ludovic Denoyer

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);分类 cs.LG

AI总结 HiSPO通过分层策略子空间实现持续离线强化学习,有效解决导航任务中的遗忘与可扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20701 2026-01-29 cs.RO 70%

One Step Is Enough: Dispersive MeanFlow Policy Optimization

一步即可:分散均流策略优化

Guowei Zou, Haitao Wang, Hejun Wu, Yukun Qian, Yuhang Wang, Weibing Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(大数据分析与处理广东省重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 DMPO通过单步生成、分散正则化和强化学习微调,在实时机器人控制中实现高效动作生成,性能超越多步基线。

Comments Code and project page: https://guowei-zou.github.io/dmpo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18763 2026-01-23 cs.LG 70%

GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning

GenPO:生成扩散模型与在线策略强化学习相结合

Shutong Ding, Ke Hu, Shan Zhong, Haoyang Luo, Weinan Zhang, Jingya Wang, Jun Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) MoE Key Laboratory of Intelligent Perception and Human Machine Collaboration(智能感知与人机协同联合实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 GenPO通过生成扩散模型与在线强化学习结合,解决了扩散策略在计算状态-动作对数似然中的挑战,实现了高效的可逆动作映射和熵正则化,提升了机器人任务的训练效果。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03449 2026-01-08 cs.RO 70%

FIRE-VLM: A Vision-Language-Driven Reinforcement Learning Framework for UAV Wildfire Tracking in a Physics-Grounded Fire Digital Twin

FIRE-VLM:一种基于视觉-语言驱动的强化学习框架,用于在物理基础火灾数字孪生中无人机火灾跟踪

Chris Webb, Mobin Habibpour, Mayamin Hamid Raha, Ali Reza Tavakkoli, Janice Coen, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学) University of Nevada, Reno(内华达大学拉斯维加斯分校) NSF NCAR(国家科学基金会NCAR)

专题命中 模仿学习与强化学习 :embodied agent(abstract);navigation(abstract);分类 cs.RO

AI总结 FIRE-VLM是一种基于视觉-语言模型的强化学习框架,用于在物理基础火灾数字孪生中实现无人机火灾跟踪,通过结合物理术语与VLM语义的奖励设计,提升了火灾检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24288 2026-01-01 cs.RO 70%

Real-world Reinforcement Learning from Suboptimal Interventions

现实世界中的基于次优干预的强化学习

Yinuo Zhao, Huiqian Jin, Lechun Jiang, Xinyi Zhang, Kun Wu, Pei Ren, Zhiyuan Xu, Zhengping Che, Lei Sun, Dapeng Wu, Chi Harold Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) City University of Hong Kong(香港城市大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 SiLRI通过状态级拉格朗日强化学习算法,利用次优和噪声的人类干预加速机器人操作学习,显著提高了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18436 2025-12-23 cs.RO 70%

Evaluating the Pre-Dressing Step: Unfolding Medical Garments Via Imitation Learning

评估预穿衣步骤:通过模仿学习展开医疗服装

David Blanco-Mulero, Júlia Borràs, Carme Torras

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术工业研究所,CSIC-UPC)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文通过模仿学习研究预穿衣步骤,利用操作原语和视觉分类器提高医疗服装展开效率。

Comments 6 pages, 4 figures, 2 tables. Accepted to IEEE/RSJ IROS 2025. Project website: https://sites.google.com/view/pre-dressing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14057 2025-12-18 cs.RO 70%

Context Representation via Action-Free Transformer encoder-decoder for Meta Reinforcement Learning

通过无动作变换器编码器-解码器进行上下文表示以实现元强化学习

Amir M. Soufi Enayati, Homayoun Honari, Homayoun Najjaran

机构 * Department of Mechanical Engineering University of Victoria(机械工程系维多利亚大学) Mila-Quebec AI Institute(魁北克AI研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出CRAFT模型,通过无动作变换器编码器-解码器实现上下文表示,提升元强化学习在机器人控制中的泛化能力和适应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16396 2025-12-15 cs.LG 70%

GoalLadder: Incremental Goal Discovery with Vision-Language Models

GoalLadder: 基于视觉语言模型的增量目标发现

Alexey Zakharov, Shimon Whiteson

机构 * University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 GoalLadder利用视觉语言模型在视觉环境中通过增量目标发现提升RL智能体性能,实现高成功率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05061 2025-12-02 cs.RO 70%

Automaton Constrained Q-Learning

自动机约束的Q学习

Anastasios Manganaris, Vittorio Giammarino, Ahmed H. Qureshi

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 ACQL通过结合目标条件的值学习与自动机引导的强化学习,解决了在连续控制任务中同时满足时间有序目标和安全约束的问题。

Comments 10 main content pages, 4 main content figures, 11 appendix pages, 5 appendix figures, camera ready version submitted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09061 2025-11-27 cs.LG cs.SY eess.SY stat.ML 70%

Action Chunking and Exploratory Data Collection Yield Exponential Improvements in Behavior Cloning for Continuous Control

动作分块与探索性数据收集在连续控制行为克隆中的指数性改进

Thomas T. Zhang, Daniel Pfrommer, Chaoyi Pan, Nikolai Matni, Max Simchowitz

机构 * MIT(麻省理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);robot learning(abstract);分类 cs.LG

AI总结 本文通过动作分块和探索性数据收集方法,在连续控制行为克隆中实现误差指数级减少,揭示了控制理论稳定性对模仿学习性能的关键作用。

Comments Updated manuscript. New visualization figures and control-theory primer

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09562 2025-11-19 cs.CR cs.LG 70%

TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning

Mingxuan Zhang, Oubo Ma, Kang Wei, Songze Li, Shouling Ji

机构 * Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00555 2025-11-11 cs.RO 70%

Improving Robustness to Out-of-Distribution States in Imitation Learning via Deep Koopman-Boosted Diffusion Policy

Dianye Huang, Nassir Navab, Zhongliang Jiang

机构 * Chair for Computer Aided Medical Procedures and Augmented Reality (CAMP), Technical University of Munich (TUM)(计算机辅助医疗程序与增强现实中心(CAMP),慕尼黑技术大学(TUM)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Medical Intelligence and Robotic Cognition Lab (MIRoC), The University of Hong Kong (HKU)(医疗智能与机器人认知实验室(MIRoC),香港大学(HKU))

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments Accepted by IEEE T-RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03997 2025-11-07 cs.CV 70%

PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection

Peiyao Wang, Weining Wang, Qi Li

专题命中 模仿学习与强化学习 :robotics(abstract);embodied AI(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16447 2025-10-28 cs.HC cs.RO 70%

SHIFT: An Interdisciplinary Framework for Scaffolding Human Attention and Understanding in Explanatory Tasks

André Groß, Birte Richter, Britta Wrede

机构 * Medical Assistance Systems, Medical School OWL(医疗辅助系统,OWL医学院) Center for Cognitive Interaction Technology, CITEC from Bielefeld University(认知交互技术中心,Bielefeld大学)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22420 2025-10-28 cs.RO cs.SY eess.SY 70%

A Novel Multi-Timescale Stability-Preserving Hierarchical Reinforcement Learning Controller Framework for Adaptive Control in High-Dimensional Dynamical Systems

Mohammad Ali Labbaf Khaniki, Fateme Taroodi, Benyamin Safizadeh

机构 * Faculty of Electrical Engineering K.N. Toosi University of Technology(法拉比科技大学电气工程学院) Faculty of Mathematical Sciences Shahid Beheshti University(沙希德·贝赫什提大学数学科学学院) Department of Mathematics and Computer Science University of Central Oklahoma(中央俄克拉荷马大学数学与计算机科学系)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05294 2025-10-27 cs.LG 70%

A Smooth Sea Never Made a Skilled SAILOR: Robust Imitation via Learning to Search

Arnav Kumar Jain, Vibhakar Mohta, Subin Kim, Atiksh Bhardwaj, Juntao Ren, Yunhai Feng, Sanjiban Choudhury, Gokul Swamy

机构 * Mila- Quebec AI Institute(蒙特利尔AI研究所) Université de Montréal(蒙特利尔大学) Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18518 2025-10-22 cs.RO 70%

Efficient Model-Based Reinforcement Learning for Robot Control via Online Learning

Fang Nan, Hao Ma, Qinghua Guan, Josie Hughes, Michael Muehlebach, Marco Hutter

机构 * CREATE Lab, EPFL, Lausanne, Switzerland(洛桑联邦理工学院CREATE实验室)

专题命中 模仿学习与强化学习 :robot learning(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14065 2025-10-17 cs.RO 70%

Optimistic Reinforcement Learning-Based Skill Insertions for Task and Motion Planning

Gaoyuan Liu, Joris de Winter, Yuri Durodie, Denis Steckelmacher, Ann Nowe, Bram Vanderborght

机构 * Brubotics Vrije Universiteit Brussel(布鲁塞尔自由大学) imec Artificial Intelligence (AI) Lab, Vrije Universiteit Brussel(人工智能(AI)实验室,布鲁塞尔自由大学)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07562 2025-10-10 cs.LG 70%

EBGAN-MDN: An Energy-Based Adversarial Framework for Multi-Modal Behavior Cloning

Yixiao Li, Julia Barth, Thomas Kiefer, Ahmad Fraij

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏