arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4106 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4106 篇

2001.00449 2020-01-03 cs.LG cs.RO stat.ML 82%

Continuous-Discrete Reinforcement Learning for Hybrid Control in Robotics

Michael Neunert, Abbas Abdolmaleki, Markus Wulfmeier, Thomas Lampe, Jost Tobias Springenberg, Roland Hafner, Francesco Romano, Jonas Buchli, Nicolas Heess, Martin Riedmiller

专题命中 模仿学习与强化学习 :robotics(title);robotic(abstract);分类 cs.RO、cs.LG;robot learning(comments)

Comments Presented at the 3rd Conference on Robot Learning (CoRL 2019), Osaka, Japan. Video: https://youtu.be/eUqQDLQXb7I

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03747 2019-12-10 cs.RO cs.LG 82%

Effects of a Social Force Model reward in Robot Navigation based on Deep Reinforcement Learning

Óscar Gil Viyuela, Alberto Sanfeliu

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG;robotics(comments)

Comments This is a preprint. This paper has been accepted to the fourth Iberian Robotics Conference (Robot 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.02369 2017-01-27 cs.HC cs.AI cs.RO 82%

Reinforcement Learning based Embodied Agents Modelling Human Users Through Interaction and Multi-Sensory Perception

Kory W. Mathewson, Patrick M. Pilarski

专题命中 模仿学习与强化学习 :embodied agent(title,comments);robotic(abstract);分类 cs.RO、cs.AI

Comments 4 pages, 2 figures, Accepted at the 2017 AAAI Spring Symposium on Interactive Multi-Sensory Object Perception for Embodied Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18884 2026-02-24 cs.AI 81%

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

TPRU: 推动大型多模态模型中的时序与过程理解

Zhenkun Gao, Xuhong Wang, Xin Tan, Yuan Xie

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 TPRU通过引入大规模多模态数据集和强化学习微调方法,显著提升大型模型在时序和过程理解上的表现,达到当前最先进的准确率。

Comments Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.15469 2023-02-22 cs.RO cs.AI cs.CV cs.LG 81%

Watch and Match: Supercharging Imitation with Regularized Optimal Transport

Siddhant Haldar, Vaibhav Mathur, Denis Yarats, Lerrel Pinto

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Code and robot videos are available on https://rot-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09678 2021-06-18 cs.LG cs.AI cs.CV cs.RO 81%

SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies

Linxi Fan, Guanzhi Wang, De-An Huang, Zhiding Yu, Li Fei-Fei, Yuke Zhu, Anima Anandkumar

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments ICML 2021. Website: https://linxifan.github.io/secant-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.00482 2018-10-02 cs.LG cs.AI cs.CV cs.RO stat.ML 81%

Few-Shot Goal Inference for Visuomotor Learning and Planning

Annie Xie, Avi Singh, Sergey Levine, Chelsea Finn

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Videos available at https://sites.google.com/view/few-shot-goals

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08558 2025-06-23 cs.RO cs.AI cs.LG 81%

Can We Detect Failures Without Failure Data? Uncertainty-Aware Runtime Failure Detection for Imitation Learning Policies

Chen Xu, Tony Khuong Nguyen, Emma Dixon, Christopher Rodriguez, Patrick Miller, Robert Lee, Paarth Shah, Rares Ambrus, Haruki Nishimura, Masha Itkina

机构 * Toyota Research Institute (TRI)(丰田研究院) Woven by Toyota (WbyT)(丰田编织(WbyT))

专题命中 模仿学习与强化学习 :manipulation(abstract);robot policy(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Accepted by Robotics: Science and Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.10066 2021-10-07 cs.LG cs.AI cs.RO 81%

Learning Off-Policy with Online Planning

Harshit Sikchi, Wenxuan Zhou, David Held

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 30 pages, Conference of Robot Learning (CoRL) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.11944 2020-10-23 cs.LG cs.AI cs.RO 81%

Accelerating Reinforcement Learning with Learned Skill Priors

Karl Pertsch, Youngwoon Lee, Joseph J. Lim

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 4th Conference on Robot Learning (CoRL), 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12917 2026-08-14 cs.LG cs.RO 新提交 81%

Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

基于近体学奖励建模的深度强化学习中符合社会规范的导航研究

Takieddine Soualhi, Jacques Saraydaryan, Laetitia Matignon

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG

AI总结 该研究针对DRL社会导航中社会合规目标不足的问题,提出基于近体学的奖励建模方法,经模拟验证可提升社会指标且保持导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12063 2026-08-13 cs.RO cs.AI 新提交 81%

Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL

基于稀疏离线到在线强化学习从SMPC演示中学习移动操作

Martin Schuck, Maks Sorokin, Simone Manni, Duy Ta, Angela P. Schoellig, Marco Hutter, Simon Le Cleac'H, Jan Brüdigam

机构 * RAI Institute(RAI研究所) Technical University of Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究利用仿真中SMPC生成的离线数据,结合稀疏奖励训练离策略RL智能体,整合动态稳定性控制器,实现机器人移动操作技能的仿真到真实迁移,性能超越原最优控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 81%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04964 2026-08-06 cs.AI cs.LG 新提交 81%

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

WorldCycle:用于长时序视频世界模型的自验证强化学习

Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究针对交互式视频世界模型的误差累积问题,提出自验证RL框架WorldCycle,利用可逆动作循环实现无标注监督,在CycleBench基准上大幅降低状态返回漂移并提升复合动作准确率。

Comments https://nevsnev.github.io/Worldcycle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19749 2026-07-23 cs.LG cs.AI 新提交 81%

The World Model Remembers, the Actor Forgets: Dream Rehearsal for Continual Model-Based RL

世界模型记忆,智能体遗忘:基于持续模型的强化学习中的梦境排练

Gurp Nijjer

机构 * Quantegra Research(Quantegra研究公司)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究 DreamerV3 家族智能体在任务序列训练时的遗忘问题,通过组件级探测发现是通道问题,提出分级梦境排练方法,能产生无任务标签、参数恒定的持续学习者,在多任务链保留上表现优异。

Comments 11 pages, 2 figures. Code, pre-registration trail, and run data: https://github.com/gurpnijjer/dream-rehearsal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16204 2026-07-21 cs.AI cs.LG 新提交 81%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 81%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20031 2026-07-08 cs.RO cs.AI 新提交 81%

A Neuromorphic Reinforcement Learning Framework for Efficient Pathfinding in Robotic Mobile Fulfillment Systems

一种用于机器人移动履行系统高效路径规划的神经形态强化学习框架

Junzhe Xu, Zecui Zeng, Lusong Li, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 提出SDQN-RMFS框架,通过ANN到SNN的转换和硬标签知识蒸馏,在神经形态芯片上实现超低功耗路径规划,相比GPU能耗降低11281倍,延迟减少近一半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26154 2026-06-26 cs.RO cs.LG physics.bio-ph 新提交 81%

Reinforcement Learning Enables Autonomous Microrobot Navigation and Intervention in Simulated Blood Capillaries

强化学习实现模拟毛细血管中自主微机器人导航与干预

Jannik Drotleff, Samuel Tovey, Paul Hohenberger, Christoph Lohrmann, Julian Hoßbach, Konstantin Nikolaou, Christian Holm

机构 * Institute for Computational Physics, University of Stuttgart(斯图加特大学计算物理研究所)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG

AI总结 开发基于物理的毛细血管网络仿真,利用深度强化学习训练微机器人通过趋化性导航,发现多种通用策略并实现靶向血流阻塞与恢复。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22027 2026-06-25 cs.RO cs.AI 新提交 81%

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

RARM:基于置信度门控的进展奖励建模用于操作中的强化学习

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07945 2026-06-25 cs.RO cs.AI 版本更新 81%

Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation

面向社交导航的真实世界学习的增量残差强化学习

Haruto Nagahisa, Kohei Matsumoto, Yuki Tomita, Yuki Hyodo, Ryo Kurazume

机构 * School of Engineering, Kyushu University(九州大学工学系) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系) School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出增量残差强化学习(IRRL),结合增量学习与残差强化学习,在无回放缓冲区的情况下实现与基于回放缓冲区方法相当的性能,并通过真实世界实验验证机器人适应新环境的能力。

Comments RO-MAN 2026, video https://youtu.be/NJOhv56CrPM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12365 2026-06-11 cs.RO cs.AI 新提交 81%

Ambient Diffusion Policy: Imitation Learning from Suboptimal Data in Robotics

环境扩散策略:从次优数据中进行机器人模仿学习

Adam Wei, Nicholas Pfaff, Thomas Cohn, Arif Kerem Dayı, Constantinos Daskalakis, Giannis Daras, Russ Tedrake

机构 * MIT(麻省理工学院)

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.AI

AI总结 提出环境扩散策略,通过噪声依赖的数据使用从次优数据中提取有用特征,在六项任务上优于现有方法,最高提升33%。

Comments 14 pages (main body), 52 pages total. Project website: https://ambient-diffusion-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03963 2026-06-10 cs.RO cs.AI 版本更新 81%

AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation

面向视觉条件的无人机导航的自优化智能体强化学习

Roohan Ahmed Khan, Yasheerah Yaqoot, Amir Atef Habel, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出AgenticRL框架,利用多模态GPT智能体自动设计奖励函数、通过闭环自改进优化策略,在多种无人机导航任务中提升性能并实现高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06659 2026-06-09 cs.LG cs.AI 版本更新 81%

In-Context Reinforcement Learning via Communicative World Models

通过通信世界模型进行上下文强化学习

Fernando Martinez-Lopez, Tao Li, Yingdong Lu, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) IBM Research(IBM研究院)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CORAL框架,通过将潜在表示学习与控制分离,利用信息代理预训练世界模型并生成通信消息,使控制代理实现零样本适应和样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01072 2026-06-08 cs.RO cs.CV 版本更新 81%

Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs

利用场景图扩展机器人模仿学习的时空上下文

Jianing Qian, Qinhe Peng, Emmanuel Panov, Leonor Fermoselle, Dinesh Jayaraman, Bernadette Bucher, Tarik Kelestemur

机构 * University of Pennsylvania(宾夕法尼亚大学) RAI Institute(RAI研究院) University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出使用场景图作为显式结构化记忆机制,通过动态维护对象中心关系及其时间演化,解决机器人模仿学习中的部分可观测性和长时推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.06161 2026-06-04 cs.RO cs.LG cs.SY eess.SY 81%

BaRC: Backward Reachability Curriculum for Robotic Reinforcement Learning

BaRC:机器人强化学习中的逆向可达性课程

Boris Ivanovic, James Harrison, Apoorva Sharma, Mo Chen, Marco Pavone

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算机科学学院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出BaRC方法,利用物理先验知识设计课程方案,通过逆向可达性策略加速连续控制MDP中模型无关RL算法的训练,提升性能并减少探索需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02860 2026-06-04 stat.ML cs.LG cs.RO cs.SY eess.SY 81%

Gaussian Processes for Data-Efficient Learning in Robotics and Control

高斯过程在机器人和控制中的数据高效学习

Marc Peter Deisenroth, Dieter Fox, Carl Edward Rasmussen

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于高斯过程的非参数转移模型,通过提取更多数据信息加速学习,减少模型误差影响,实现高效自主学习。

Comments 20 pages, 29 figures; fixed a typo in equation on page 8

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 37, issue no 2, pages 408-423, February 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00780 2026-06-02 cs.LG cs.AI 81%

Behavior-Invariant Task Representation Learning with Transformer-based World Models for Offline Meta-Reinforcement Learning

基于Transformer世界模型的行为不变任务表示学习用于离线元强化学习

Fuyuan Qian, Menglong Zhang, Song Wang, Quanying Liu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合信息论任务表示学习与Transformer随机世界模型的框架,通过提取行为不变的任务变量和保守值惩罚,解决离线元强化学习中的分布偏移和稀疏奖励问题,实现鲁棒泛化。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00383 2026-06-02 cs.RO cs.LG cs.SY eess.SY 81%

Behavior Cloning of MPC for 3-DOF Robotic Manipulators

三自由度机械臂MPC的行为克隆

Theo Guegan, Dexter Wen Jie Teo

机构 * University of Waterloo(多伦多大学) Universite de Technologie de Compiègne(技术与科学大学) Nanyang Technological University(南洋理工大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 针对MPC实时计算负担重的问题,采用行为克隆方法近似MPC策略,通过多种神经网络架构实现三自由度机械臂的实时控制,在宽松容差下推理延迟降低3倍,成功率84.98%。

Comments Accepted at the IEEE ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning (RL4IL), 6 pages excluding references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08758 2026-05-28 cs.RO cs.AI math.OC 81%

Omni-scale Learning-based Sequential Decision Framework for Order Fulfillment of Tote-handling Robotic Systems

基于全尺度学习的料箱搬运机器人系统订单履行序贯决策框架

Jiaxin Liu, Peng Yang, Yuping Li, Xinyue Xie

机构 * Institution of Data and Information, Shenzhen International Graduate School, Tsinghua University, Nanshan District, Shenzhen 518055, China(数据与信息研究所,深圳国际研究生院,清华大学,南山区,深圳518055,中国)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 针对料箱搬运机器人系统的订单履行决策,提出一种结合结构化组合优化与多智能体强化学习的通用可扩展序贯决策框架OLSF-TRS,在小规模系统上平均最优性差距低于3.5%,在大规模场景中相比启发式基线减少8-12%的料箱移动,并保持实时响应。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏