arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-14 至 2026-05-14 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 8 篇

2509.19538 2026-05-14 cs.LG cs.AI 82%

DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions

DAWM:基于扩散的世界模型用于通过动作推断的离线强化学习

Zongyue Li, Xiao Han, Yusong Li, Niklas Strauss, Matthias Schubert

机构 * Department of Computer Science, University of Munich, Munich, Germany(慕尼黑大学计算机科学系) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML))

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 DAWM通过动作推断生成未来状态-奖励轨迹,结合逆动力学模型,为离线强化学习提供高效训练方案,提升算法性能。

Comments ICML2025 workshop Building Physically Plausible World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18809 2026-05-14 cs.LG 70%

Test-time Offline Reinforcement Learning on Goal-related Experience

测试时的离线强化学习在目标相关经验上的应用

Marco Bagatella, Mert Albaba, Jonas Hübotter, Georg Martius, Andreas Krause

机构 * ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Max Planck Institute for Intelligent Systems, Tubingen, Germany(智能系统马克斯·普朗克研究所,图宾根,德国) University of Tubingen, Tubingen, Germany(图宾根大学,图宾根,德国)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 本文提出了一种基于目标的测试时训练方法,通过选择与当前状态和评估目标相关的经验来提升策略性能,适用于高维定位导航和操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12771 2026-05-14 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 69%

Adaptive Smooth Tchebycheff Attention for Multi-Objective Policy Optimization

自适应平滑切比雪夫注意力用于多目标策略优化

Alejandro Murillo-Gonzalez, Mahmoud Ali, Lantao Liu

机构 * Indiana University–Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本文提出自适应平滑切比雪夫框架,通过动态调节优化景观曲率,解决多目标强化学习中非凸区域解恢复问题,验证于机器人隐身视觉搜索任务,发现非凸区域的帕累托最优策略。

Comments To appear in the Proceedings of Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21060 2026-05-14 cs.LG cs.AI 62%

On the Sample Complexity of Differentially Private Policy Optimization

关于差分隐私策略优化的样本复杂性

Yi He, Xingyu Zhou

机构 * Wayne State University(韦恩州立大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了差分隐私策略优化的样本复杂性,分析了多种策略优化算法在隐私约束下的样本复杂性,揭示隐私成本在样本复杂性中的表现。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22273 2026-05-14 cs.LG 57%

Decoupling Exploration and Policy Optimization: Uncertainty Guided Tree Search for Hard Exploration

解耦探索与策略优化:基于不确定性引导的树搜索用于困难探索

Zakaria Mhammedi, James Cohan

机构 * Google Research, NYC(谷歌研究,纽约市)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出一种解耦探索与策略优化的方法,通过树搜索策略和不确定性测量提升探索效率,在困难探索任务中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12831 2026-05-14 cs.LG 57%

Quantifying Potential Observation Missingness in Inverse Reinforcement Learning

量化逆强化学习中的潜在观察缺失程度

Leo Benac, Abhishek Sharma, Alihan Huyuk, Finale Doshi-Velez

机构 * School of Engineering and Applied Sciences(工程与应用科学学院) Harvard University(哈佛大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文研究逆强化学习中因观察缺失导致的决策偏差问题,提出算法量化行为数据中可能的观察缺失范围,通过合成导航任务、癌症治疗模拟和ICU治疗数据实验验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12746 2026-05-14 cs.CR cs.AI 57%

CoT-Guard: Small Models for Strong Monitoring

CoT-Guard:用于强监控的小型模型

Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty, Giri Iyengar, Sambit Sahu, Huan Zhang, Gang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Capital One

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 本文提出CoT-Guard,通过结合监督微调和强化学习,提升小型模型在代码生成任务中检测隐藏目标的能力,其在提示和代码攻击下的表现优于现有大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 57%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏