arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 115 篇

2506.17639 2026-06-17 cs.RO cs.AI 版本更新 74%

RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models

RLRC:基于强化学习的压缩视觉-语言-动作模型恢复

Yuxuan Chen, Yixin Han, Yize Huang, Xiao Li

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Key Laboratory of Intelligent Robotics(上海智能机器人重点实验室) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(journal_ref)

AI总结 提出RLRC三阶段压缩恢复流程,通过结构化剪枝、SFT和强化学习恢复以及量化,实现8倍内存减少和2.3倍推理加速,同时保持任务成功率。

Comments 8 pages, 10 figures; accepted by RA-L 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8864-8871, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14427 2026-06-11 cs.RO cs.LG 版本更新 74%

Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning

面向接触丰富机器人强化学习的自监督多感官预训练

Rickmer Krohn, Vignesh Prasad, Gabriele Tiboni, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, TU Darmstadt, Germany(图腾机器人感知与学习实验室,图腾施塔德大学,德国) Hessian.AI(海斯堡人工智能) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG;robotics(journal_ref)

AI总结 提出MSDP框架,通过掩码自编码和跨模态预测学习多感官表示,并采用非对称架构(评论家使用交叉注意力提取动态特征,演员使用稳定池化表示)加速策略学习,在模拟和真实机器人任务中展现出鲁棒性和高效性。

Comments 8 pages, 11 figures

Journal ref IEEE Robotics and Automation Letters, 2026, Vol. 11, No. 6, pp. 6799-6806

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00642 2026-08-12 cs.AI cs.LG 版本更新 73%

Coachable agents for interactive gameplay

可指导的交互式游戏智能体

Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman

机构 * Sony AI, Zurich, Switzerland(索尼AI,苏黎世,瑞士) Sony AI, North America (various locations)(索尼AI,北美(多地)) Sony AI, Tokyo, Japan(索尼AI,东京,日本)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出结合通用价值函数近似器与精心选择的训练场景、学习算法和数据增强的框架,使智能体在复杂领域(如《地平线:西之绝境》、《GT赛车》和类人机器人)中实时展现不同风格,同时保持主任务性能。

Comments Source code: https://github.com/SonyResearch/coachable_agents - Videos: https://drive.google.com/drive/folders/19F5uKziT_zkDurze5sy5iMFD4BHfD3lV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31043 2026-07-16 cs.LG cs.RO 版本更新 73%

Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation

Warp RL: 重塑基础策略分布以进行动力学自适应

Ethan Hirschowitz, Fabio Ramos

机构 * University of Sydney(悉尼大学) NVIDIA(英伟达)

专题命中 模仿学习与强化学习 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.LG

AI总结 针对残差强化学习在动力学偏移下无法调整分布形状的问题,提出Warp RL方法,通过可逆状态条件变换重塑基础策略的动作分布,在ManiSkill3任务和真实机器人插销任务中优于残差校正。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16595 2026-07-08 cs.RO cs.LG 版本更新 73%

HERB: Human-augmented Efficient Reinforcement learning for Bin-packing

HERB:用于装箱的人类增强高效强化学习

Gojko Perovic, Nuno Ferreira Duarte, Atabak Dehban, Gonçalo Teixeira, Egidio Falotico, José Santos-Victor

机构 * BioRobotics Institute, Scuola Superiore Sant’Anna, Pisa, Italy, and with the Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna, Pisa, Italy(生物机器人研究所,圣安娜高等学院,意大利比萨,以及与机器人与人工智能卓越部门,圣安娜高等学院,意大利比萨) Institute for Systems and Robotics, Instituto Superior Técnico, Universidade de Lisboa(系统与机器人研究所,技术高等学院,里斯本大学)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究针对不规则物体装箱问题,提出HERB人类增强RL框架,结合人类示范与RL探索确定物体放置,实验表明该方法在效率、延迟上优于其他方法,且策略更稳定、似人类,还验证了现实可行性。

Comments 8 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17534 2026-07-01 physics.flu-dyn cs.AI cs.LG 版本更新 73%

The HydroGym Reinforcement Learning Platform for Fluid Dynamics

HydroGym:流体动力学的强化学习平台

Christian Lagemann, Sajeda Mokbel, Miro Gondrum, Mario Rüttgers, Yuning Wang, Pol Suárez, Ludger Paehler, Deniz A. Bezgin, Aaron B. Buhendwa, Jared L. Callaham, Samuel Ahnert, Nicholas Zolman, Xiao Shao, Jean-Christophe Loiseau, Nikolaus Adams, Matthias Meinke, Wolfgang Schröder, Kai Lagemann, Esther Lagemann, Ricardo Vinuesa, Steven L. Brunton

机构 * University of Washington(华盛顿大学) AI Institute in Dynamic Systems, University of Washington(华盛顿大学人工智能研究所) RWTH Aachen University(亚琛工业大学) Inha University(仁荷大学) University of Michigan(密歇根大学) KTH Royal Institute of Technology(瑞典皇家理工学院) Technical University of Munich(慕尼黑工业大学) Arts et Métiers Institute of Technology(国立高等工程技术学校) CNAM(法国国立工艺学院) DynFluid, HESAM Université(HESAM大学流体动力学实验室) Munich Institute of Integrated Materials, Energy and Process Engineering, Technical University of Munich(慕尼黑工业大学综合材料、能源与工艺工程研究所) JARA Center for Simulation and Data Science, RWTH Aachen University(亚琛工业大学JARA模拟与数据中心) MediaTek Research(联发科技研究中心) German Center for Neurodegenerative Diseases(德国神经退行性疾病中心)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出HydroGym,一个求解器无关的强化学习平台,提供61+个已验证的流场环境,支持多种后端,RL智能体发现鲁棒控制原理,并实现零样本迁移,显著降低探索成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03065 2026-06-29 cs.LG cs.RO 版本更新 73%

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11103 2026-06-29 cs.RO cs.AI 版本更新 73%

A Primer on SO(3) Action Representations in Deep Reinforcement Learning

深度强化学习中SO(3)动作表示入门

Martin Schuck, Sherif Samy, Angela P. Schoellig

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对SO(3)动作表示在强化学习中的选择问题,系统评估了多种表示在PPO、SAC、TD3算法下的效果,发现切向量表示最可靠。

Comments Published at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03389 2026-06-23 cs.LG cs.AI 版本更新 73%

Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL

Chain-of-Goals 分层策略用于长视界离线目标条件强化学习

Jinwoo Choi, Sang-Hyun Lee, Seung-Woo Seo

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(首尔国立大学电气与计算机工程系) Department of Automotive Engineering, Ajou University, Gyeonggi-do, South Korea(全州大学汽车工程系)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出 Chain-of-Goals 分层策略 (CoGHP),通过自回归生成潜在子目标序列,利用 MLP-Mixer 统一架构建模层次决策,在长视界任务中优于离线基线方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09603 2026-06-23 cs.RO cs.LG 版本更新 73%

DataMIL: Selecting Data for Robot Imitation Learning with Datamodels

DataMIL: 使用数据模型为机器人模仿学习选择数据

Shivin Dass, Alaa Khaddaj, Logan Engstrom, Aleksander Madry, Andrew Ilyas, Roberto Martín-Martín

机构 * UT Austin(得克萨斯大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出DataMIL框架,基于数据模型端到端选择对任务性能提升最大的数据点,避免基于人类质量标准的过滤,通过替代损失函数避免环境交互,在60+模拟和真实操作任务中验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21570 2026-06-12 cs.AI cs.RO 版本更新 73%

From Digital to Physical: Digital Agents as Autonomous Coaches for Physical Intelligence

从数字到物理:数字代理作为物理智能的自主教练

Zixing Lei, Genjia Liu, Yuanshuo Zhang, Qipeng Liu, Yuzhu Cai, Sixiang Chen, Jixian Wu, Yunhong Wang, Weixin Li, Chuan Wen, Bo Zhao, Shanghang Zhang, Wenzhao Lian, Siheng Chen

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院) School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 模仿学习与强化学习 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出EmboCoach-Bench基准,评估LLM代理自主设计具身策略的能力,通过迭代调试和优化,代理在平均成功率上超越人工基线26.5%,并具备自我修正能力。

Comments 53 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 73%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :embodied agent(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03438 2026-08-03 cs.AI 版本更新 70%

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

具有自适应验证器的多模态强化学习

Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

机构 * Microsoft Research(微软研究院) UMass Amherst(马萨诸塞大学阿默斯特分校) ETH Zurich(苏黎世联邦理工学院) UW–Madison(威斯康星大学麦迪逊分校)

专题命中 模仿学习与强化学习 :robotics(abstract);embodied AI(abstract);分类 cs.AI

AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06954 2026-07-24 cs.RO cs.SY eess.SY 版本更新 70%

Is Your Safe Controller Actually Safe? A Critical Review of CBF Tautologies and Hidden Assumptions

你的安全控制器真的安全吗?CBF永真式和隐藏假设的批判性审查

Taekyung Kim

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文批判性地审查了CBF在机器人安全中的应用,揭示了安全控制器理论与实际实现之间的差距,并提供了构建实际安全论证的实用指南。

Comments Technical Report. Interactive web demo: https://cbf.taekyung.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07530 2026-07-21 cs.RO 版本更新 70%

ICLR: In-Context Imitation Learning with Visual Reasoning

ICLR: 基于视觉推理的上下文模仿学习

Toan Nguyen, Weiduo Yuan, Songlin Wei, Hui Li, Daniel Seita, Yue Wang

机构 * University of Southern California(南加州大学) Autodesk Research(Autodesk研究)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ICLR通过结合视觉推理与上下文模仿学习,提升机器人在复杂任务中的适应性和泛化能力。

Comments Accepted to IROS 2026. Project website: https://toannguyen1904.github.io/ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11494 2026-06-23 cs.RO 版本更新 70%

SHIELD: Safety on Humanoids via CBFs In Expectation on Learned Dynamics

SHIELD: 基于学习动力学期望的控制障碍函数实现人形机器人安全

Lizhi Yang, Blake Werner, Ryan K. Cosner, David Fridovich-Keil, Preston Culbertson, Aaron D. Ames

机构 * Mechanical and Civil Engineering, California Institute of Technology(加州理工学院机械与土木工程系) Aerospace Engineering and Engineering Mechanics, UT Austin(德克萨斯大学奥斯汀分校航空航天工程与工程力学系) Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 模仿学习与强化学习 :robot learning(abstract);navigation(abstract);分类 cs.RO

AI总结 提出SHIELD框架,通过训练随机动力学残差模型并利用随机离散时间CBF在概率上保证安全,为黑箱RL控制器添加最小侵入式安全层,在Unitree G1人形机器人上实现安全导航。

Comments Accepted to the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025). Copyright transferred to IEEE. Video at https://youtu.be/-Qv1wR4jfj4

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25025 2026-06-15 cs.RO cs.SY eess.SY 版本更新 70%

Micro-Swarm Locomotion Optimization in Dynamic Flow using Multi-Objective Multi-Agent Reinforcement Learning

动态流场中微群集运动优化的多目标多智能体强化学习方法

Josef Berman, Oren Gal

机构 * Hatter Department of Marine Technologies, Leon H. Charney School of Marine Sciences, University of Haifa(哈特尔海洋技术系,列昂·H·夏恩海洋科学学院,海法大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出混合CFD与多目标多智能体强化学习框架,通过PCGrad解决梯度冲突,在振荡流中优化微机器人集群的上游推进、能量效率和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00461 2026-06-11 cs.CV 版本更新 70%

ReMoT: Reinforcement Learning with Motion Contrast Triplets

ReMoT: 基于运动对比三元组的强化学习

Cong Wan, Zeyu Guo, Jiangyang Li, SongLin Dong, Yifan Bai, Lin Peng, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03087 2026-07-22 cs.RO cs.AI cs.LG 版本更新 69%

Training and Simulation of Quadrupedal Robot in Adaptive Stair Climbing and Descending for Indoor Firefighting: An End-to-End Reinforcement Learning Approach

四足机器人在室内灭火中的自适应爬楼梯训练与仿真:一种端到端强化学习方法

Baixiao Huang, Baiyu Huang, Yu Hou

机构 * Independent Researcher(独立研究者) Department of Construction Management, Western New England University(西雅图新英格兰大学建设管理系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本研究提出一种两阶段端到端强化学习方法,用于四足机器人在复杂室内环境中适应不同楼梯形状的爬行任务。

Comments 8 pages, 9 figures, 43rd International Symposium on Automation and Robotics in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04568 2026-08-07 cs.LG cs.AI cs.RO 版本更新 67%

Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination

Dream-MPC:基于梯度与潜在想象的模型预测控制

Jonathan Spieler, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) Robotics, Center for Robotics(机器人学,机器人中心) the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。

Comments Accepted for International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04147 2026-07-20 cs.RO cs.AI cs.LG 版本更新 67%

SLAC: Safe and Efficient Real-Robot Reinforcement Learning via Unsupervised Simulation Pre-Training

SLAC:通过无监督模拟预训练实现安全高效的真实机器人强化学习

Jiaheng Hu, Peter Stone, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Sony AI(索尼人工智能) Amazon Robotics(亚马逊机器人技术)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究旨在解决高自由度机器人强化学习难题,提出SLAC方法,利用低保真模拟器预训练潜在动作空间,通过定制无监督方法训练并用于新型离策略算法,在双手移动操纵任务中达领先性能,高效学习复杂任务。

Comments Preliminary version at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15283 2026-07-02 cs.LG cs.AI cs.RO 版本更新 67%

Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms

通过强化学习策略梯度算法增强机器的硬件容错能力

Sheila Schoepp, Mehran Taghian, Shotaro Miwa, Yoshihiro Mitsuka, Shadan Golestan, Osmar Zaïane

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所) Advanced Technology R&D Center, Mitsubishi Electric Corporation(三菱电机株式会社先进技术研发中心) Information Technology R&D Center, Mitsubishi Electric Corporation(三菱电机株式会社信息技术研发中心)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文首次系统比较PPO和SAC两种强化学习算法在硬件故障容错中的表现,并研究四种知识迁移策略,实验表明算法能快速恢复故障并存在性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22748 2026-06-19 cs.RO cs.AI cs.LG cs.MA 版本更新 67%

Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning

通过多智能体强化学习实现超人类安全且敏捷的赛车

Ismail Geles, Leonard Bauersfeld, Markus Wulfmeier, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人与感知组) Google DeepMind(谷歌DeepMind) Nomagic

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出通过多智能体强化学习在高速四旋翼赛车中实现安全且敏捷的性能,展示了多智能体交互对真实世界交互安全性的关键作用,同时在高速赛车中超越人类飞行员并减少碰撞率。

Comments 12 pages (+4 supplementary). Website: https://rpg.ifi.uzh.ch/marl

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08653 2026-07-01 cs.RO 版本更新 65%

High-Speed Vision-Based Flight in Clutter with Safety-Shielded Reinforcement Learning

基于安全盾牌强化学习的高速度视觉飞行在杂乱环境中

Jiarui Zhang, Chengyong Lei, Chengjiang Dai, Kenghou Hoi, Lijie Wang, Zhichao Han, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术研究所) Differential Robotics(微分机器人)

专题命中 模仿学习与强化学习 :navigation(abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 提出一种结合模型安全机制的端到端强化学习框架,通过物理信息奖励和实时安全滤波器实现高速飞行与严格避障,在杂乱环境和森林中速度达7.5 m/s。

Comments Published in IEEE Robotics and Automation Letters

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01568 2026-08-14 cs.LG cs.RO 版本更新 62%

Trajectory First: A Curriculum for Discovering Diverse Policies

轨迹优先:发现多样化策略的课程

Cornelius V. Braun, Sayantan Auddy, Marc Toussaint

机构 * TU Berlin(柏林技术大学) Robotics Institute(机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种两阶段课程,通过轨迹先验生成多样化高奖励行为,再蒸馏为反应式策略,提升任务性能与行为多样性。

Comments Best paper at the Inductive Biases in Reinforcement Learning Workshop at RLC 2025

Journal ref Reinforcement Learning Journal 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04949 2026-08-07 cs.CV cs.AI 版本更新 62%

DeepForgeSeal: Latent Space-Driven Semi-Fragile Watermarking for Deepfake Detection Using Adversarial Reinforcement Learning

DeepForgeSeal:基于对抗强化学习的隐空间驱动半脆弱深度伪造检测水印技术

Tharindu Fernando, Clinton Fookes, Sridha Sridharan

机构 * The Signal Processing, Artificial Intelligence and Vision Technologies (SAIVT), Queensland University of Technology, Australia(信号处理、人工智能与视觉技术研究所(SAIVT),昆士兰理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 该研究针对深度伪造检测中现有水印方法鲁棒性与脆弱性难以平衡的问题,提出基于对抗强化学习的隐空间驱动半脆弱水印框架,在CelebA和CelebA-HQ数据集上性能优于现有最优方法

Comments Accepted for Publication in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12408 2026-08-06 cs.RO cs.LG 版本更新 62%

Imitation Learning from Human Motion Alone Does Not Guarantee Biomechanically Plausible Gait Kinetics

超越动作模仿:仅有人体动作数据是否足以解释步态控制与生物力学?

Xinyi Liu, Jangwhan Ahn, Edgar Lobaton, Jennie Si, He Huang

机构 * Joint Department of Biomedical Engineering, University of North Carolina - Chapel Hill(北卡罗来纳大学教堂山分校联合生物医学工程系) Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电气与计算机工程系) School of Electrical, Computer and Energy Engineering, Arizona State University(亚利桑那州立大学电气、计算机与能源工程学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本研究探讨了在基于强化学习的动作模仿框架中,加入足-地面相互作用测量对人类步态运动学和运动动力学估计的影响,发现仅准确再现运动学不足以保证生物力学合理性,需引入动力学约束以提升步态表示的物理一致性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25464 2026-08-03 cs.LG cs.AI 版本更新 62%

Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning

为实机零样本强化学习的最大熵行为探索

Jiajun Hu, Nuria Armengol Urpi, Jin Cheng, Stelian Coros

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FB-MEBE算法,通过最大熵行为探索策略和正则化批评者,提升实机四足机器人控制的零样本强化学习性能,实现自然可部署的政策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26434 2026-07-31 cs.RO cs.AI 版本更新 62%

Reinforcement Learning on Cost-Constrained Quadrupedal Hardware

成本受限四足硬件上的强化学习

Javier C. Weddington, Bence P. Ölveczky, Stephen A. Baccus

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学) Stanford University School of Medicine(斯坦福大学医学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对低成本四足硬件的仿真-现实差距,采用生物启发方法,结合延迟前向模型与时间感知神经网络,学习到鲁棒CPG,实现了成本受限硬件上的强化学习控制。

Comments Sim-to-real transfer, locomotion, reinforcement learning, central pattern generator

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20220 2026-07-24 cs.RO cs.AI 版本更新 62%

What Matters for Simulation to Online Reinforcement Learning on Real Robots

在真实机器人上在线强化学习中什么至关重要

Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

机构 * ETH Zurich(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本研究探讨了在真实机器人上实现稳定在线强化学习的关键设计选择,发现某些默认设置可能有害,而稳健的设计选择能提高学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏