arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4113 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4113 篇

2604.04334 2026-04-13 cs.LG cs.AI 62%

Boosted Distributional Reinforcement Learning: Analysis and Healthcare Applications

提升分布强化学习:分析与医疗应用

Zequn Chen, Wesley J. Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院塞耶工程学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BDRL算法,通过优化个体结果分布并确保相似代理的可比性,提升医疗决策的一致性和效果。

Comments Preprint. 40 pages,11 figures. Supplementary appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25241 2026-04-08 cs.RO cs.AI 62%

One-shot Adaptation of Humanoid Whole-body Motion with Walking Priors

单样本适应人类全身体态与行走先验

Hao Huang, Geeta Chandra Raju Bethala, Shuaihang Yuan, Congcong Wen, Mengyu Wang, Anthony Tzes, Yi Fang

机构 * Embodied AI and Robotics (AIR) Lab, NYUAD(纽约大学阿布扎比分校具身人工智能与机器人实验室) NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心) New York University Abu Dhabi(纽约大学阿布扎比分校) Harvard Ophthalmology AI Lab, Harvard University(哈佛大学眼科人工智能实验室)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种高效适应全身体态的方法,利用行走先验和单样本目标生成中间姿态,通过最优传输和几何插值实现碰撞自由配置,实验显示优于基线方法。

Comments 14 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04356 2026-04-06 math.OC cs.AI cs.RO 62%

Mission-Aligned Learning-Informed Control of Autonomous Systems: Formulation and Foundations

任务对齐的学习引导控制:公式与基础

Vyacheslav Kungurtsev, Monicah Cherop Naibei, Gustav Sir, Akhil Anand, Sebastien Gros, Haozhe Tian, Homayoun Hamedmoghadam

机构 * Czech Technical University in Prague(捷克布拉格工业大学) Norwegian University of Science and Technology(挪威科技大学) Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种任务对齐的学习引导控制框架,结合控制、经典规划和强化学习,提升自主系统安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02226 2026-04-03 cs.AI cs.LG 62%

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

何时提问:用于强化学习的不确定性门控语言帮助

Juarez Monteiro, Nathan Gavenski, Gianlucca Zuin, Adriano Veloso

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。

Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16705 2026-04-03 cs.RO cs.LG 62%

Olaf: Bringing an Animated Character to Life in the Physical World

奥拉夫:将动画角色带入现实世界

David Müller, Espen Knoop, Dario Mylonopoulos, Agon Serifi, Michael A. Hopkins, Ruben Grandia, Moritz Bächer

机构 * Disney Research Imagineering(迪士尼研究与工程)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文通过强化学习结合动画参考,使奥拉夫在现实世界中活动,采用软泡沫裙隐藏不对称腿部,利用球形和平面连杆实现动作控制,并通过温度输入和额外奖励减少过热风险,验证了其在仿真和硬件中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27416 2026-03-31 cs.RO cs.AI 62%

Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion

由代理驱动的自主强化学习研究:四足运动的迭代策略改进

Nimesh Khandelwal, Shakti S. Gupta

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了四足运动中由代理驱动的自主强化学习,通过70次实验展示了代理在低人类干预下完成迭代策略改进的能力,同时记录了多个自主研究决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23889 2026-03-26 cs.LG cs.RO 62%

Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration

基于约束乐观探索的非策略安全强化学习

Guopeng Li, Matthijs T. J. Spaan, Julian F. P. Kooij

机构 * Faculty of Mechanical Engineering(机械工程学院) Delft University of Technology(代尔夫特理工大学) Faculty of Electrical Engineering, Mathematics and Computer Science(电气工程、数学和计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出COX-Q算法,通过约束乐观探索和保守离线分布价值学习,解决非策略安全强化学习中的约束违反问题,实现在安全关键应用中的高效样本利用和可控数据收集成本。

Comments 21 pages, 9 figures, accepted by ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14469 2026-03-24 cs.RO cs.LG 62%

Physics-Informed Policy Optimization via Analytic Dynamics Regularization

通过解析动力学正则化实现物理信息的策略优化

Namai Chandra, Liu Mohan, Zhihao Gu, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University, Singapore(EmPACT实验室,南洋理工大学,新加坡)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出PIPER框架,通过在神经策略优化中引入解析软物理约束,提升机器人控制的效率和物理一致性。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19685 2026-03-23 cs.AI cs.LG cs.MA 62%

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

一种用于提升长周期LLM代理的子目标驱动框架

Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。

Comments 50 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05089 2026-03-19 cs.CR cs.LG cs.RO 62%

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

警惕不可信的模拟器 -- 强化学习中的无奖励后门攻击

Ethan Rathbun, Wo Wei Lin, Alina Oprea, Christopher Amato

机构 * Khoury College of Computer Sciences(计算机科学学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种新型攻击'Daze',通过模拟器动态在强化学习代理中隐秘植入动作级后门,无需修改或观察奖励,证明其在通用RL任务中的有效性,并展示其在机器人硬件上的迁移。

Comments 10 pages main body, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI 62%

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17152 2026-03-19 cs.RO cs.LG 62%

Shielded Reinforcement Learning Under Dynamic Temporal Logic Constraints

受动态时序逻辑约束的防护强化学习

Sadık Bera Yüksel, Ali Tevfik Buyukkocak, Derya Aksaray

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种结合序列控制屏障函数和无模型强化学习的框架,以满足复杂的时序逻辑任务,扩展了传统安全约束的应用范围。

Comments 7 pages, 3 figures, 2026 IEEE American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16978 2026-03-19 cs.RO cs.LG 62%

Rewarding DINO: Predicting Dense Rewards with Vision Foundation Models

奖励DINO:基于视觉基础模型预测密集奖励

Pierre Krack, Tobias Jülg, Wolfram Burgard, Florian Walter

机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系) TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Rewarding DINO,一种基于语言条件的奖励模型,通过学习实际奖励函数而非特定轨迹,实现机器人操作任务的密集奖励预测,具有紧凑结构和低计算开销,能有效泛化至新场景。

Comments 10 pages, 5 figures, submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16384 2026-03-18 cs.RO cs.LG q-bio.PE 62%

Controlling Fish Schools via Reinforcement Learning of Virtual Fish Movement

通过虚拟鱼运动的强化学习控制鱼群

Yusuke Nishii, Hiroaki Kawashima

机构 * Faculty of Engineering, Kyoto University(京都大学工学部)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文通过强化学习训练虚拟鱼,实现对鱼群的引导与控制,实验证明该方法在模拟和实际环境中均能有效引导鱼群向目标方向移动,优于基线方法。

Comments English translation of the author's 2018 bachelor's thesis. Keywords: fish schooling, reinforcement learning, collective behavior, artificial agents, swarm-machine interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15771 2026-03-18 cs.RO cs.AI 62%

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器

Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15725 2026-03-18 cs.MA cs.ET cs.LG cs.RO 62%

S2Act: Simple Spiking Actor

S2Act: 简单的脉冲行为者

Ugur Akcal, Seung Hyun Kim, Mikihisa Yuasa, Hamid Osooli, Jiarui Sun, Ribhav Sahu, Mattia Gazzola, Huy T. Tran, Girish Chowdhary

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 S2Act通过构建基于速率脉冲神经元的actor-critic模型,利用梯度训练并转换为物理参数,有效解决SNN中的梯度消失问题,提升多机器人任务的实时推理性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15418 2026-03-17 cs.RO cs.AI 62%

MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings

MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型

Shahil Shaik, Aditya Parameshwaran, Anshul Nayak, Jonathon M. Smereka, Yue Wang

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Clemson University(克莱姆斯大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14908 2026-03-17 cs.RO cs.CV 62%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.CV

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13295 2026-03-17 cs.LG cs.AI 62%

ICPRL: Acquiring Physical Intuition from Interactive Control

ICPRL: 从交互控制中获取物理直觉

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Shuo Zhang, Zhiming Ding, Bo Zheng

机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) RUC(中国人民大学) PUC-Rio(里约热内卢联邦大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11351 2026-03-13 cs.RO cs.AI 62%

Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning

通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应

Hong Lu, Pierrick Lorang, Timothy R. Duggan, Jivko Sinapov, Matthias Scheutz

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00915 2026-03-12 cs.LG cs.RO 62%

Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments

部分等价强化学习在对称破坏环境中

Junwoo Chang, Minwoo Park, Joohwan Seo, Roberto Horowitz, Jongmin Lee, Jongeun Choi

机构 * School of Mechanical Engineering, Yonsei University, Seoul, South Korea(延世大学机械工程学院,首尔,韩国) Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系,首尔,韩国) Department of Mechanical Engineering, University of California, Berkeley, United States(加州大学伯克利分校机械工程系,美国)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出部分等价强化学习框架,通过选择性应用群不变或标准贝尔曼备份,提升样本效率和泛化能力,适用于对称破坏环境的离散和连续控制任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13406 2026-03-09 cs.RO cs.AI cs.SY eess.SY 62%

Generative Predictive Control: Flow Matching Policies for Dynamic and Difficult-to-Demonstrate Tasks

生成预测控制:用于动态和难以示范任务的流匹配策略

Vince Kurtz, Joel W. Burdick

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出生成预测控制方法,用于解决动态且难以示范任务中的快速动态问题,通过流匹配策略实现高效反馈和高频率控制。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04790 2026-03-06 cs.LG cs.RO 62%

Diffusion Policy through Conditional Proximal Policy Optimization

通过条件近端策略优化实现扩散策略

Ben Liu, Shunpeng Yang, Hua Chen

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学) Hong Kong University of Science and Technology, Hongkong, China(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute, Haining, China(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于条件近端策略优化的高效方法,用于在在线强化学习中训练多模态扩散策略,解决了计算动作对数似然的难题,并在多个基准任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03973 2026-03-06 cs.LG cs.AI 62%

Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning

引导流策略:在离线强化学习中学习高价值动作

Franki Nguimatsia Tiofack, Théotime Le Hellard, Fabian Schramm, Nicolas Perrin-Gilbert, Justin Carpentier

机构 * Inria and DI-ENS, PSL Research University(Inria和DI-ENS,PSL研究大学) Sorbonne Université, CNRS, ISIR, France(索邦大学,CNRS,ISIR,法国)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 引导流策略通过结合多步流匹配与提炼的演员,有效区分高价值动作,从而在多个基准测试中实现卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04289 2026-03-05 cs.LG cs.AI 62%

IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning

IPD: 通过离线规划蒸馏提升序列策略

Yihao Qin, Yuanfei Wang, Hang Zhou, Peiran Liu, Hao Dong, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 IPD通过引入离线规划蒸馏技术,提升离线强化学习中序列策略的决策稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18817 2026-03-04 cs.RO cs.LG 62%

Learning Acrobatic Flight from Preferences

从偏好学习空中杂技飞行

Colin Merk, Ismail Geles, Jiaxu Xing, Angel Romero, Giorgia Ramponi, Davide Scaramuzza

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出REC框架,通过基于置信度的奖励集合方法,在空中杂技飞行中实现88.4%的奖励性能,优于传统方法的55.2%,并验证其在连续控制中的广泛适用性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14696 2026-03-03 cs.CV cs.GR cs.RO 62%

CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives

CRISP: 从单目视频中基于接触引导的现实到仿真转换

Zihan Wang, Jiashun Wang, Jeff Tan, Yiwen Zhao, Jessica Hodgins, Shubham Tulsiani, Deva Ramanan

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 CRISP通过拟合平面原始体和强化学习,从单目视频中生成可模拟的现实到仿真环境,显著降低运动跟踪失败率。

Comments Published at ICLR 2026. Project page: https://crisp-real2sim.github.io/CRISP-Real2Sim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21533 2026-03-03 cs.RO cs.AI 62%

Model Predictive Adversarial Imitation Learning for Planning from Observation

基于模型预测的对抗模仿学习用于从观察中规划

Tyler Han, Yanda Bao, Bhaumik Mehta, Gabriel Guo, Anubhav Vishwakarma, Emily Kang, Sanghun Jung, Rosario Scalise, Jason Zhou, Bryan Xu, Byron Boots

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于模型预测的对抗模仿学习方法,通过端到端学习从观察中规划,提升样本效率和鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09434 2026-03-03 cs.MA cs.AI cs.LG 62%

When Is Diversity Rewarded in Cooperative Multi-Agent Learning?

在合作多智能体学习中,多样性何时会被奖励?

Michael Amir, Matteo Bettini, Amanda Prorok

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 研究通过理论分析和算法验证,探讨了多智能体学习中异质性团队奖励机制,提出HetGPS算法用于发现异质性优势的奖励场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00396 2026-03-03 cs.LG cs.AI cs.SY eess.SY math.OC 62%

Hereditary Geometric Meta-RL: Nonlocal Generalization via Task Symmetries

继承性几何元强化学习:通过任务对称性实现非局部泛化

Paul Nitschke, Shahriar Talebi

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出继承性几何元强化学习方法,通过任务对称性实现非局部泛化,提升任务空间泛化能力。

Comments Accepted to 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏