arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4111 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4111 篇

2307.09205 2023-07-19 cs.LG 74%

Learning Dynamic Attribute-factored World Models for Efficient Multi-object Reinforcement Learning

Fan Feng, Sara Magliacane

专题命中 模仿学习与强化学习 :world model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05022 2023-03-10 cs.RO 74%

Learned Parameter Selection for Robotic Information Gathering

Christopher E. Denniston, Gautam Salhotra, Akseli Kangaslahti, David A. Caron, Gaurav S. Sukhatme

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO

Comments 8 pages, Submitted to IROS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.06721 2022-11-21 cs.RO cs.SY eess.SY 74%

Lyapunov Design for Robust and Efficient Robotic Reinforcement Learning

Tyler Westenbroek, Fernando Castaneda, Ayush Agrawal, Shankar Sastry, Koushil Sreenath

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.03100 2022-10-11 cs.RO 74%

Optimal Stroke Learning with Policy Gradient Approach for Robotic Table Tennis

Yapeng Gao, Jonas Tebbe, Andreas Zell

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.00812 2022-08-24 cond-mat.soft cond-mat.stat-mech cs.LG 74%

Reinforcement learning of optimal active particle navigation

Mahdi Nasiri, Benno Liebchen

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01474 2022-06-06 cs.LG stat.ML 74%

Offline Reinforcement Learning with Causal Structured World Models

Zheng-Mao Zhu, Xiong-Hui Chen, Hong-Long Tian, Kun Zhang, Yang Yu

专题命中 模仿学习与强化学习 :world model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12360 2021-08-06 cs.RO cs.SY eess.SY 74%

A reinforcement learning control approach for underwater manipulation under position and torque constraints

Ignacio Carlucho, Mariano De Paula, Gerardo G. Acosta, Corina Barbalata

专题命中 模仿学习与强化学习 :manipulation(title);分类 cs.RO

Journal ref Global Oceans 2020: Singapore - U.S. Gulf Coast

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.04488 2021-05-17 cs.SD cs.LG eess.AS 74%

A Deep Reinforcement Learning Approach to Audio-Based Navigation in a Multi-Speaker Environment

Petros Giannakopoulos, Aggelos Pikrakis, Yannis Cotronis

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.LG

Comments To be published in ICASSP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.09008 2021-01-19 eess.SY cs.LG cs.SY 74%

Reinforcement Learning Control of Robotic Knee with Human in the Loop by Flexible Policy Iteration

Xiang Gao, Jennie Si, Yue Wen, Minhan Li, He, Huang

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.05926 2020-05-13 cs.RO cs.HC 74%

Towards Transparency of TD-RL Robotic Systems with a Human Teacher

Marco Matarese, Silvia Rossi, Alessandra Sciutti, Francesco Rea

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO

Comments Presented at the 2020 Workshop on Assessing, Explaining, and Conveying Robot Proficiency for Human-Robot Teaming

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.01040 2020-03-05 cs.MA cs.LG 74%

Scaling Up Multiagent Reinforcement Learning for Robotic Systems: Learn an Adaptive Sparse Communication Graph

Chuangchuang Sun, Macheng Shen, Jonathan P. How

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09847 2020-01-15 cs.RO cs.SY eess.SY 74%

Using Human Ratings for Feedback Control: A Supervised Learning Approach with Application to Rehabilitation Robotics

Marcel Menner, Lukas Neuner, Lars Lünenburger, Melanie N. Zeilinger

专题命中 模仿学习与强化学习 :robotics(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01713 2019-07-04 cs.RO 74%

End-to-end Decentralized Multi-robot Navigation in Unknown Complex Environments via Deep Reinforcement Learning

Juntong Lin, Xuyun Yang, Peiwei Zheng, Hui Cheng

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO

Comments 8 pages, 13 figures, IEEE International Conference on Mechatronics and Automation (ICMA 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.00091 2018-12-04 cs.AI 74%

BlockPuzzle - A Challenge in Physical Reasoning and Generalization for Robot Learning

Yixiu Zhao, Ziyin Liu

专题命中 模仿学习与强化学习 :robot learning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.05086 2018-01-17 cs.RO 74%

Autonomous UAV Navigation Using Reinforcement Learning

Huy X. Pham, Hung M. La, David Feil-Seifer, Luan V. Nguyen

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
1205.0986 2012-05-07 cs.AI cs.NE 74%

Robot Navigation using Reinforcement Learning and Slow Feature Analysis

Wendelin Böhmer

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.AI

Comments Diploma Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
1007.0376 2010-07-05 cs.NE cs.RO 74%

The Transfer of Evolved Artificial Immune System Behaviours between Small and Large Scale Robotic Platforms

Amanda Whitbrook, Uwe Aickelin, Jonathan M. Garibaldi

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO

Comments 12 pages, 3 figures, 2 tables, 9th International Conference on Artificial Evolution (EA 09),

Journal ref Proceedings of the 9th International Conference on Artificial Evolution (EA 09), LNCS 5975, Strasbourg, France, 2010, p 122-133

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12306 2026-08-13 cs.LG cs.AI 新提交 73%

Redistribution-based Cost Inference Improves Sparse Safe Offline RL

基于重分配的代价推断改进稀疏安全离线强化学习

Ebenezer Gelo, Geraud Nangue Tasse, Steven James, Benjamin Rosman

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对安全离线强化学习中稀疏轨迹级停止反馈问题,提出RCI框架转换为密集每步代价,经理论证明转换无损,实验在两类任务上违规率更低且鲁棒性好。

Comments Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), affiliated with IJCAI/ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00642 2026-08-12 cs.AI cs.LG 版本更新 73%

Coachable agents for interactive gameplay

可指导的交互式游戏智能体

Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman

机构 * Sony AI, Zurich, Switzerland(索尼AI,苏黎世,瑞士) Sony AI, North America (various locations)(索尼AI,北美(多地)) Sony AI, Tokyo, Japan(索尼AI,东京,日本)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出结合通用价值函数近似器与精心选择的训练场景、学习算法和数据增强的框架,使智能体在复杂领域(如《地平线:西之绝境》、《GT赛车》和类人机器人)中实时展现不同风格,同时保持主任务性能。

Comments Source code: https://github.com/SonyResearch/coachable_agents - Videos: https://drive.google.com/drive/folders/19F5uKziT_zkDurze5sy5iMFD4BHfD3lV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31043 2026-07-16 cs.LG cs.RO 版本更新 73%

Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation

Warp RL: 重塑基础策略分布以进行动力学自适应

Ethan Hirschowitz, Fabio Ramos

机构 * University of Sydney(悉尼大学) NVIDIA(英伟达)

专题命中 模仿学习与强化学习 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.LG

AI总结 针对残差强化学习在动力学偏移下无法调整分布形状的问题,提出Warp RL方法,通过可逆状态条件变换重塑基础策略的动作分布,在ManiSkill3任务和真实机器人插销任务中优于残差校正。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09866 2026-07-14 cs.RO cs.AI 新提交 73%

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Robo-ValueRL:离线到在线强化学习的可靠价值估计

Wenke Xia, Pei Ren, Wenbo Yu, Yizhuo Zhang, Jifan Li, Yixue Zhang, Yinuo Zhao, Qingyang Gao, Jianlong Fu, Jian Tang, Ji-Rong Wen, Zhengping Che, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Beijing Forestry University(北京林业大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。

Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16595 2026-07-08 cs.RO cs.LG 版本更新 73%

HERB: Human-augmented Efficient Reinforcement learning for Bin-packing

HERB:用于装箱的人类增强高效强化学习

Gojko Perovic, Nuno Ferreira Duarte, Atabak Dehban, Gonçalo Teixeira, Egidio Falotico, José Santos-Victor

机构 * BioRobotics Institute, Scuola Superiore Sant’Anna, Pisa, Italy, and with the Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna, Pisa, Italy(生物机器人研究所,圣安娜高等学院,意大利比萨,以及与机器人与人工智能卓越部门,圣安娜高等学院,意大利比萨) Institute for Systems and Robotics, Instituto Superior Técnico, Universidade de Lisboa(系统与机器人研究所,技术高等学院,里斯本大学)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究针对不规则物体装箱问题,提出HERB人类增强RL框架,结合人类示范与RL探索确定物体放置,实验表明该方法在效率、延迟上优于其他方法,且策略更稳定、似人类,还验证了现实可行性。

Comments 8 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04265 2026-07-07 cs.RO cs.AI 新提交 73%

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01225 2026-07-02 cs.LG cs.AI 新提交 73%

Language-Critique Imitation Learning from Suboptimal Demonstrations

语言-批评模仿学习从次优演示中

Chih-Han Yang, Dai-Jie Wu, Yun-Ping Huang, Ping-Chun Hsieh, Kenneth Marino, Shao-Hua Sun

机构 * Graduate Institute of Communication Engineering, National Taiwan University (NTU)(国立台湾大学电信工程学研究所) University of Utah(犹他大学) National Yang Ming Chiao Tung University(国立阳明交通大学) NTU Artificial Intelligence Center of Research Excellence(国立台湾大学人工智能卓越研究中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出语言批评框架,用自然语言作为结构化监督信号从次优演示中学习策略,避免压缩为标量,在连续控制任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31846 2026-07-01 cs.RO cs.AI 新提交 73%

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1: 面向视觉-语言-动作模型的高效强化学习

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

机构 * Zioneer Robot Team(Zioneer机器人团队)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31377 2026-07-01 cs.RO cs.AI 新提交 73%

Stage-Transition Dense Reward Modeling for Reinforcement Learning

面向强化学习的阶段转换密集奖励建模

Yang Yang, Bingjie Chen, Zihan Wang, Yizhe Li, Guoping Pan, Yi Cheng, Houde Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Zerith Robotics

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出阶段转换密集奖励(STDR)框架,利用专家视频学习任务阶段结构,提供阶段转换和阶段内进展两种密集奖励信号,结合OOD检测和抓取调节模块,提升机器人操作任务的样本效率和成功率。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17534 2026-07-01 physics.flu-dyn cs.AI cs.LG 版本更新 73%

The HydroGym Reinforcement Learning Platform for Fluid Dynamics

HydroGym:流体动力学的强化学习平台

Christian Lagemann, Sajeda Mokbel, Miro Gondrum, Mario Rüttgers, Yuning Wang, Pol Suárez, Ludger Paehler, Deniz A. Bezgin, Aaron B. Buhendwa, Jared L. Callaham, Samuel Ahnert, Nicholas Zolman, Xiao Shao, Jean-Christophe Loiseau, Nikolaus Adams, Matthias Meinke, Wolfgang Schröder, Kai Lagemann, Esther Lagemann, Ricardo Vinuesa, Steven L. Brunton

机构 * University of Washington(华盛顿大学) AI Institute in Dynamic Systems, University of Washington(华盛顿大学人工智能研究所) RWTH Aachen University(亚琛工业大学) Inha University(仁荷大学) University of Michigan(密歇根大学) KTH Royal Institute of Technology(瑞典皇家理工学院) Technical University of Munich(慕尼黑工业大学) Arts et Métiers Institute of Technology(国立高等工程技术学校) CNAM(法国国立工艺学院) DynFluid, HESAM Université(HESAM大学流体动力学实验室) Munich Institute of Integrated Materials, Energy and Process Engineering, Technical University of Munich(慕尼黑工业大学综合材料、能源与工艺工程研究所) JARA Center for Simulation and Data Science, RWTH Aachen University(亚琛工业大学JARA模拟与数据中心) MediaTek Research(联发科技研究中心) German Center for Neurodegenerative Diseases(德国神经退行性疾病中心)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出HydroGym,一个求解器无关的强化学习平台,提供61+个已验证的流场环境,支持多种后端,RL智能体发现鲁棒控制原理,并实现零样本迁移,显著降低探索成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28152 2026-06-29 cs.LG cs.RO 新提交 73%

Regularized Reward-Punishment Reinforcement Learning

正则化奖惩强化学习

Jiexin Wang, Eiji Uchibe

机构 * Dept. of Brain Robot Interface, ATR Computational Neuroscience Laboratories(ATR计算神经科学实验室脑机接口系)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出KL耦合策略正则化(KCPR)框架,通过策略间动态先验交互实现奖惩强化学习中的策略协调,并衍生出KL耦合软最优性(KCSO)及深度实现klDMP,在网格世界和Gazebo机器人导航任务中提升了安全性和学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27475 2026-06-29 cs.RO cs.LG 新提交 73%

Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience

支持约束强化学习实现无需真实世界经验的真实世界策略改进

Raymond Yu, William Huey, Mustafa Mukadam, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出SCORE框架,通过流导向约束模拟中的强化学习到真实数据预训练生成策略的支持集,实现无需真实世界经验即可改进真实世界操作策略,在八项灵巧操作任务中成功率从37.8%提升至89.9%。

Comments 35 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03065 2026-06-29 cs.LG cs.RO 版本更新 73%

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏