arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-15 至 2026-05-15 共收录 10 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 10 篇

2605.14723 2026-05-15 cs.AI cs.CL cs.LG 81%

Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model

通过与临床世界模型交互实现患者动态的智能体化

Minghao Wu, Yuting Yan, Zhenyang Cai, Ke Ji, Chuangsen Fang, Ziying Sheng, Xidong Wang, Rongsheng Wang, Hejia Zhang, Shuang Li, Benyou Wang, Hongyuan Zha

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SepsisAgent,通过临床世界模型模拟患者对液体-血管加压药干预的响应,采用提出-模拟-细化流程进行脓毒症治疗推荐,优于传统RL和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14937 2026-05-15 cs.LG cs.AI cs.RO 80%

Slot-MPC: Goal-Conditioned Model Predictive Control with Object-Centric Representations

Slot-MPC:基于目标中心表示的面向目标的模型预测控制

Jonathan Spieler, Angel Villar-Corrales, Sven Behnke

机构 * Autonomous Intelligent Systems(自主智能系统) Computer Science Institute VI(计算机科学研究所VI) Intelligent Systems and Robotics(智能系统与机器人) Center for Robotics(机器人中心) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能学习与智能研究所) University of Bonn, Germany(波恩大学,德国)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 Slot-MPC通过模型预测控制实现目标中心表示的规划,利用可微分的世界模型提升任务性能和规划效率,优于非目标中心世界模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14174 2026-05-15 cs.RO 79%

Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation

具有事后训练可达性验证的安全强化学习用于机器人导航

Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于条件价值风险约束的强化学习框架,通过训练对高成本尾部结果敏感的策略,并在训练后利用神经网络可达性验证评估其安全边际,实验表明该方法在导航任务中实现了更高的安全验证率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14742 2026-05-15 cs.CV cs.RO 62%

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL:一种统一的分析引导强化学习框架,用于第一人称交互推理与像素定位

Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学电子与电气工程系) Division of Emerging Interdisciplinary Areas (EMIA), The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学新兴跨学科领域研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出EARL框架,通过分析引导特征合成器提升第一人称交互推理与像素定位的准确性,实验显示在Ego-IRGBench上像素定位达到65.48% cIoU,优于现有方法。

Comments Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14297 2026-05-15 cs.LG cs.AI math.OC stat.ML 62%

Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

通过混合梯度在混合离散-连续动作空间中进行策略优化

Matias Alvo, Daniel Russo, Yash Kanoria

机构 * Graduate School of Business Columbia University(哥伦比亚大学商学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合策略优化方法HPO,通过混合梯度估计器解决高维空间中离散-连续动作的策略优化问题,实验显示其在库存控制和切换线性二次调节问题中优于PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14246 2026-05-15 cs.LG cs.AI cs.SY eess.SY 62%

Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability

动作条件化风险门控用于部分可观测下的安全关键控制

Yushen Liu, Yin-Jen Chen, Ziyi Chen, Tao Wang, Heng Huang, Xugui Zhou, Yanfu Zhang

机构 * University of Virginia(弗吉尼亚大学) Google(谷歌) University of Maryland, College Park(马里兰大学 College Park 分校) Stanford University(斯坦福大学) Louisiana State University(路易斯安那州立大学) College of William and Mary(威廉与玛丽学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级风险门控强化学习方法,用于部分可观测环境下风险敏感控制。通过构建紧凑的有限历史代理状态并学习动作条件化的短期安全违规预测,实现风险惩罚与决策时的保守评估,提升安全关键任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14026 2026-05-15 cs.LG cs.AI 62%

R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning

R2R2:通过冗余减少在自预测学习中的鲁棒表示

Sanghyeob Song, Donghyeok Lee, Jinsik Kim, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R2R2方法,通过减少冗余提升自预测学习中密集数据重用的鲁棒性,有效缓解过拟合问题,在11个连续控制任务中验证其有效性。

Comments Accepted at the Forty-Third International Conference on Machine Learning (ICML 2026). This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14350 2026-05-15 cs.LG 57%

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

通过自适应任务采样实现分布鲁棒多任务强化学习

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna

机构 * Computer Sciences Department(计算机科学系) University of Wisconsin – Madison(威斯康星大学麦迪逊分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出DRATS算法,通过自适应优先采样未被解决的任务,提升多任务强化学习的数据效率和最差任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14274 2026-05-15 cs.CV 57%

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

机构 * Northwestern University(西北大学) University of California, San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14235 2026-05-15 cs.LG cs.MA quant-ph 57%

Quantum Advantage in Multi Agent Reinforcement Learning

量子多智能体强化学习中的量子优势

Simranjeet Singh Dahia, Claudia Szabo

机构 * Adelaide University(阿德莱德大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文通过实验验证量子纠缠在多智能体强化学习中的协调作用,展示了量子智能体在CHSH游戏中超越经典性能的量子优势,并探讨了不同纠缠结构对性能的影响。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏