arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4113 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4113 篇

2605.19166 2026-05-20 cs.RO cs.LG math.OC 62%

A Heuristic Approach for Performance Tuning in RL-based Quadrotor Control via Reward Design and Termination Conditions

一种通过奖励设计和终止条件实现RL基于四旋翼控制性能调优的启发式方法

Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy, George Nikolakopoulos

机构 * Robotics and AI group, in the Department of Computer Science, Electrical and Space Engineering at Luleå University of Technology(鲁德尼大学机器人与人工智能小组,计算机科学、电气与空间工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种新的启发式方法,通过奖励设计和终止条件实现RL四旋翼控制的可调性能,该方法通过双带宽指数奖励结构实现了设定点跟踪的临界阻尼响应,并具有低稳态误差。在使用近端策略优化(PPO)算法训练时,结合episode截断条件,在600万次时间步内以高效的方式实现了所需性能。通过直观的启发式规则调整奖励权重和指数系数,可以实现更快(空翻式)和更慢(检查式)的稳定时间性能,同时保留基线临界阻尼响应和约2%的稳态误差。

Comments Accepted in the 34th Mediterranean Conference on Control and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08052 2026-05-18 cs.RO cs.LG 62%

An Introduction to Deep Reinforcement and Imitation Learning

深度强化学习与模仿学习入门

Pedro Santana

机构 * ISCTE – University Institute of Lisbon(里斯本大学理工学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 本文介绍深度强化学习和深度模仿学习在具身智能体中的应用,涵盖马尔可夫决策过程、REINFORCE和PPO等核心算法,以及行为克隆、DAgger和GAIL等基础方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15509 2026-05-18 cs.LG cs.RO 62%

parallelcbf: A composable safety-filter and auditability framework for tensor-parallel reinforcement learning

parallelcbf:一种用于张量并行强化学习的可组合安全性过滤和可追溯性框架

Yijun Lu, Zilei Yang, Yuyin Ma

机构 * Xinjiang Key Laboratory of Intelligent Computing and Smart Applications(新疆智能计算与智能应用重点实验室) School of Software, Xinjiang University, Urumqi, China(新疆大学软件学院,中国乌鲁木齐) School of Computing Science, Waseda University, Tokyo, Japan(早稻田大学计算机科学系,日本东京)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 ParallelCBF首次整合了张量并行无人机环境、硬门CBF安全过滤器、分片BC到RL流水线和第一类操作可追溯性,提供可组合的API以实现端到端安全约束训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04539 2026-05-18 cs.LG cs.RO 62%

FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control

FlashSAC: 高维机器人控制中的快速稳定离线强化学习

Donghu Kim, Youngdo Lee, Minho Park, Kinam Kim, I Made Aswin Nahendra, Takuma Seno, Sehee Min, Daniel Palenicek, Florian Vogt, Danica Kragic, Jan Peters, Jaegul Choo, Hojoon Lee

机构 * KTH Royal Institute of Technology(皇家理工学院) German Research Center for AI (DFKI)(德国人工智能研究中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 FlashSAC基于Soft Actor-Critic提出快速稳定的离线强化学习算法,通过减少梯度更新并增大模型规模和数据吞吐量,在高维任务中超越PPO和强离线基线,显著提升训练效率和性能。

Comments RSS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14742 2026-05-15 cs.CV cs.RO 62%

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL:一种统一的分析引导强化学习框架,用于第一人称交互推理与像素定位

Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学电子与电气工程系) Division of Emerging Interdisciplinary Areas (EMIA), The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学新兴跨学科领域研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出EARL框架,通过分析引导特征合成器提升第一人称交互推理与像素定位的准确性,实验显示在Ego-IRGBench上像素定位达到65.48% cIoU,优于现有方法。

Comments Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14297 2026-05-15 cs.LG cs.AI math.OC stat.ML 62%

Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

通过混合梯度在混合离散-连续动作空间中进行策略优化

Matias Alvo, Daniel Russo, Yash Kanoria

机构 * Graduate School of Business Columbia University(哥伦比亚大学商学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合策略优化方法HPO,通过混合梯度估计器解决高维空间中离散-连续动作的策略优化问题,实验显示其在库存控制和切换线性二次调节问题中优于PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14246 2026-05-15 cs.LG cs.AI cs.SY eess.SY 62%

Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability

动作条件化风险门控用于部分可观测下的安全关键控制

Yushen Liu, Yin-Jen Chen, Ziyi Chen, Tao Wang, Heng Huang, Xugui Zhou, Yanfu Zhang

机构 * University of Virginia(弗吉尼亚大学) Google(谷歌) University of Maryland, College Park(马里兰大学 College Park 分校) Stanford University(斯坦福大学) Louisiana State University(路易斯安那州立大学) College of William and Mary(威廉与玛丽学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级风险门控强化学习方法,用于部分可观测环境下风险敏感控制。通过构建紧凑的有限历史代理状态并学习动作条件化的短期安全违规预测,实现风险惩罚与决策时的保守评估,提升安全关键任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14026 2026-05-15 cs.LG cs.AI 62%

R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning

R2R2:通过冗余减少在自预测学习中的鲁棒表示

Sanghyeob Song, Donghyeok Lee, Jinsik Kim, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R2R2方法,通过减少冗余提升自预测学习中密集数据重用的鲁棒性,有效缓解过拟合问题,在11个连续控制任务中验证其有效性。

Comments Accepted at the Forty-Third International Conference on Machine Learning (ICML 2026). This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21060 2026-05-14 cs.LG cs.AI 62%

On the Sample Complexity of Differentially Private Policy Optimization

关于差分隐私策略优化的样本复杂性

Yi He, Xingyu Zhou

机构 * Wayne State University(韦恩州立大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了差分隐私策略优化的样本复杂性,分析了多种策略优化算法在隐私约束下的样本复杂性,揭示隐私成本在样本复杂性中的表现。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11009 2026-05-13 cs.LG cs.RO 62%

ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network

ACSAC:自适应块大小的Actor-Critic与因果TransformerQ网络

Qian Chen, Junqiao Zhao, Hongtu Zhou, Hang Yu, Yanping Zhao, Chen Ye, Guang Chen

机构 * Tongji University(同济大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 针对长 horizon、稀疏奖励任务,ACSAC通过自适应块大小实现平衡反应与时间一致性,提升强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06182 2026-05-12 cs.RO cs.LG 62%

Apple: Toward General Active Perception via Reinforcement Learning

Apple:通过强化学习实现通用主动感知

Tim Schneider, Cristiana de Farias, Roberto Calandra, Liming Chen, Jan Peters

机构 * Department of Computer Science, TU Darmstadt, Germany(德国图林根大学计算机科学系) LIRIS, CNRS UMR5205, École Centrale de Lyon, France(法国里里萨大学LIRIS实验室) LASR Lab & CeTI, TU Dresden, Germany(德国德累斯顿技术大学LASR实验室) DFKI, Hessian.AI, RIG, and Centre for Cognitive Science, TU Darmstadt, Germany(德国图林根大学DFKI、海德堡人工智能、RIG及认知科学中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Apple框架,通过强化学习解决多种主动感知问题,展示了其在触觉探索任务中的有效性,证明了其在机器人领域中的通用性。

Comments 27 pages; 21 figures; accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11258 2026-05-12 cs.LG cs.AI cs.CL 62%

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

知识不足:注入强化学习技能以实现持续适应

Pingzhi Tang, Yiding Wang, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17693 2026-05-12 cs.LG cs.AI cs.MA 62%

COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

COSAC:在顺序合作团队中的反事实信用分配

Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki, Nikos Vlassis

机构 * Adobe Research(Adobe研究)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08182 2026-05-12 cs.LG cs.AI 62%

Quantile Geometry Regularization for Distributional Reinforcement Learning

分位数几何正则化用于分布性强化学习

Zhaofan Zhang, Minghao Yang, Rufeng Chen, Sihong Xie, Hui Xiong

机构 * Information Hub, AI Thrust(信息中心,人工智能方向)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RQIQN方法,通过分位数估计视角改进分布性强化学习,解决分位数估计退化问题,提升风险敏感导航和Atari游戏性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06149 2026-05-08 cs.LG cs.AI 62%

AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning

AdaGamma:强化学习中时序适应的状态依赖折扣

Yaomin Wang, Jianting Pan, Ran Tian, Xiaoyang Li, Yu Zhang, Hengle Qin, Tianshu YU

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 AdaGamma通过学习状态依赖折扣函数和回报一致性目标,改进了深度强化学习中的状态依赖折扣方法,在连续控制基准和京东物流平台实现显著提升。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 62%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23073 2026-05-04 cs.LG cs.RO 62%

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

RL Token: 通过视觉-语言-动作模型实现在线强化学习的启动

Charles Xu, Jost Tobias Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出RL Token方法,通过轻量级在线强化学习微调预训练的视觉-语言-动作模型,提升真实任务的精度与速度,实验证明在四个真实机器人任务中显著提高任务效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI 62%

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 62%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22558 2026-04-27 cs.LG cs.AI 62%

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

SOLAR-RL:半在线长 horizon 分配强化学习

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang Lab(浙江实验室) CUHK MMLab(香港大学多模态实验室) Hubei University(湖北省大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。

Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19730 2026-04-22 cs.LG cs.AI 62%

FASTER: Value-Guided Sampling for Fast RL

FASTER:基于价值引导的快速强化学习采样

Perry Dong, Alexander Swerdlow, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16850 2026-04-21 cs.RO cs.AI cs.SY eess.SY 62%

Refinement of Accelerated Demonstrations via Incremental Iterative Reference Learning Control for Fast Contact-Rich Imitation Learning

通过增量迭代参考学习控制细化加速演示

Koki Yamane, Cristian C. Beltran-Hernandez, Steven Oh, Masashi Hamaya, Sho Sakaino

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) University of Tsukuba(茨口大学) Waseda University(早稻田大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出I2RLC方法,通过逐步提升速度并更新参考轨迹,实现高保真度的加速演示,提升接触密集模仿学习的效率与稳定性。

Comments 8 pages, 11 figures, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16158 2026-04-20 cs.CL cs.AI cs.LG 62%

AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency

AtManRL:通过可微注意力显著性实现更忠实的推理

Max Henning Höth, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu

机构 * Aleph Alpha Research Lab(Aleph Alpha研究实验室) TU Darmstadt(图林根大学) Hessian.AI Lab(黑森AI实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AtManRL方法,通过可微注意力操控学习更忠实的推理过程,结合GRPO框架优化正确性与可解释性,实验证明能识别关键推理token并提升模型透明度。

Comments 14 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15149 2026-04-17 cs.LG cs.AI 62%

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich

机构 * TU Darmstadt(图宾根大学) DFKI(德累斯顿人工智能研究所) Intrinsic Lab1141(Lab1141实验室) CERTAIN, Germany(德国CERTAIN) MPI-Inf, SIC(慕尼黑人工智能研究所) Meta

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20869 2026-04-17 cs.LG cs.AI 62%

Model-Based Reinforcement Learning under Random Observation Delays

基于模型的强化学习在随机观测延迟下的应用

Armin Karamzade, Kyungmin Kim, JB Lanier, Davide Corsi, Roy Fox

机构 * Department of Computer Science(计算机科学系) University of California, Irvine(加州大学尔湾分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了POMDPs中的随机传感器延迟问题,提出了一种基于模型的过滤过程和延迟感知框架,以提升强化学习在随机延迟环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13891 2026-04-16 cs.RO cs.AI cs.SY eess.SY 62%

Beyond Conservative Automated Driving in Multi-Agent Scenarios via Coupled Model Predictive Control and Deep Reinforcement Learning

通过耦合模型预测控制和深度强化学习实现多智能体场景下的非保守自动驾驶

Saeed Rahmani, Gözde Körpe, Zhenlin, Xu, Bruno Brito, Simeon Craig Calvert, Bart van Arem

机构 * TU Delft, Faculty of Civil Engineering and Geosciences, Department of Transport and Planning(代尔夫特理工大学,土木工程与地质科学学院,交通与规划系) NVIDIA

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出结合MPC与RL的框架,提升多智能体场景下的导航性能,实验表明MPC-RL在碰撞率和成功率上优于传统方法,且在零样本迁移中表现更优,展示了MPC对跨场景鲁棒性的贡献。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13788 2026-04-16 cs.RO cs.CV 62%

Failure Identification in Imitation Learning Via Statistical and Semantic Filtering

通过统计和语义过滤进行模仿学习中的故障识别

Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Inria, CNRS, Université de Lorraine, LORIA(Inria,CNRS,洛林大学,LORIA) Bleu Robotics(Bleu机器人)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出FIDeL模块,结合统计和语义过滤技术,提升机器人模仿学习中的故障检测性能,通过多模态数据集BotFails验证其有效性。

Comments 8 pages, Appendix coming soon, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO 62%

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09452 2026-04-13 cs.LG cs.AI 62%

SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning

SafeAdapt: 在深度强化学习中提供安全的策略更新

Maksim Anisimov, Francesco Belardinelli, Matthew Wicker

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeAdapt方法,通过引入Rashomon集在连续强化学习中提供安全策略更新的正式保证,确保在下游适应过程中源任务的安全性。

Comments Code available at: https://github.com/maxanisimov/provably-safe-policy-updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09035 2026-04-13 cs.AI cs.LG 62%

Advantage-Guided Diffusion for Model-Based Reinforcement Learning

基于优势的扩散模型用于基于模型的强化学习

Daniele Foffano, Arvid Eriksson, David Broman, Karl H. Johansson, Alexandre Proutiere

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Digital Futures(数字未来)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGD-MBRL,通过利用智能体的优势估计引导反向扩散过程,提升长周期回报。采用SAG和EAG两种引导方法,改进了短周期视角下的扩散模型MBRL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏