arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-02 至 2026-06-02 共收录 22 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 22 篇

2605.12689 2026-06-02 cs.RO 83%

3D RL-DWA: A Hybrid Reinforcement Learning and Dynamic Window Approach for Goal-Directed Local Navigation in Multi-DoF Robots

3D RL-DWA:一种用于多自由度机器人目标导向局部导航的混合强化学习与动态窗口方法

Chiara Castellani, Enrico Turco, Domenico Prattichizzo

机构 * European Union’s Horizon Europe Research and Innovation Programme(欧洲联盟的地平线欧洲研究与创新计划)

专题命中 模仿学习与强化学习 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出结合强化学习与动态窗口方法的混合框架,利用稀疏点云数据动态调整可变形微型机器人的运动和形状,在复杂受限环境中实现目标导航并最大化占据体积,实验表明该方法在变形和导航能力上优于纯强化学习和基于模型的方法。

Comments Accepted for publication in the Proceedings of the IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00780 2026-06-02 cs.LG cs.AI 81%

Behavior-Invariant Task Representation Learning with Transformer-based World Models for Offline Meta-Reinforcement Learning

基于Transformer世界模型的行为不变任务表示学习用于离线元强化学习

Fuyuan Qian, Menglong Zhang, Song Wang, Quanying Liu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合信息论任务表示学习与Transformer随机世界模型的框架,通过提取行为不变的任务变量和保守值惩罚,解决离线元强化学习中的分布偏移和稀疏奖励问题,实现鲁棒泛化。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00383 2026-06-02 cs.RO cs.LG cs.SY eess.SY 81%

Behavior Cloning of MPC for 3-DOF Robotic Manipulators

三自由度机械臂MPC的行为克隆

Theo Guegan, Dexter Wen Jie Teo

机构 * University of Waterloo(多伦多大学) Universite de Technologie de Compiègne(技术与科学大学) Nanyang Technological University(南洋理工大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 针对MPC实时计算负担重的问题,采用行为克隆方法近似MPC策略,通过多种神经网络架构实现三自由度机械臂的实时控制,在宽松容差下推理延迟降低3倍,成功率84.98%。

Comments Accepted at the IEEE ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning (RL4IL), 6 pages excluding references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00083 2026-06-02 cs.LG cs.AI cs.RO 75%

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

从演示到奖励:VLM奖励模型的测试时提示优化

Christian Gumbsch, Leonardo Barcellona, Lennard Schünemann, Platon Karageorgis, Andrii Zadaianchuk, Zehao Wang, Sergey Zakharov, Fabien Despinoy, Rahaf Aljundi, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) Catholic University of Leuven(鲁汶天主大学) Toyota Research Institute(丰田研究院) Toyota Motor Europe(丰田欧洲公司)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Demo2Reward方法,利用少量专家演示在测试时优化VLM奖励模型的提示指令,减少假阳性并保持真阳性,无需额外训练即可提升下游策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00062 2026-06-02 cs.RO cs.AI cs.LG 75%

SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning

SpeedAug: 通过节奏增强策略和强化学习微调实现策略加速

Taewook Nam, Junmo Cho, Youngsoo Jang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) UNIST(全南大学) DeepAuto.ai

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出SpeedAug框架,通过节奏增强先验策略和强化学习微调,使机器人策略学习任务最优执行节奏,在保持高成功率的同时显著提升执行速度和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20070 2026-06-02 cs.RO 74%

LLM Trainer: Automated Robotic Data Generation via Demonstration Augmentation using LLMs

LLM Trainer:利用大语言模型通过演示增强自动生成机器人数据

Abraham George, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO

AI总结 提出LLM Trainer,一种利用大语言模型的世界知识将少量人类演示自动扩展为大规模机器人数据集的管道,通过离线标注和在线关键姿势重定向生成新轨迹,并采用汤普森采样优化标注。

Comments 9 pages, 5 figures, 4 tables. Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02194 2026-06-02 cs.LG 70%

Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards

基于学习奖励的大规模行为模型的一致性离策略改进

Christian Scherer, Joe Watson, Theo Gruner, Daniel Palenicek, Ingmar Posner, Jan Peters

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Oxford(牛津大学) Zuse School ELIZA(泽努斯学校ELIZA) hessian.AI(海西斯AI) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出一种逆强化学习方法,通过从专家演示中学习稠密奖励函数,结合一致性模仿学习理论保证,实现对预训练策略的离策略改进,在稀疏奖励操作任务中优于强化学习基线。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01672 2026-06-02 cs.LG 70%

RDA: Reward Design Agent for Reinforcement Learning

RDA:用于强化学习的奖励设计智能体

Hojoon Lee, Ajay Subramanian, Ben Abbatematteo, Vijay Veerabadran, Pedro Matias, Karl Ridgeway, Nitin Kamra

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度Mind)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出基于视觉语言模型的奖励设计智能体RDA,通过任务分解、视觉轨迹评估和失败模式总结迭代优化奖励函数,在操作任务中生成更符合指令的策略。

Comments Accepted to RLC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01036 2026-06-02 cs.RO 70%

Position: Good Embodied Reward Models Need Bad Behavior Data

立场:好的具身奖励模型需要不良行为数据

Ran Tian, Yilin Wu, Andrea Bajcsy

机构 * Ran Tian, Yilin Wu, Andrea Bajcsy

专题命中 模仿学习与强化学习 :robotics(abstract);embodied AI(abstract);分类 cs.RO

AI总结 本文主张为获得可靠的具身奖励模型,社区必须投资于“不良”机器人数据(失败、次优、易错甚至危险行为),并通过实验证明即使少量真实不良数据也能改善与人类偏好的一致性。

Comments This position paper has been accepted by the ICML 2026 position track as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07578 2026-06-02 cs.RO 70%

Approximate Imitation Learning for Event-based Quadrotor Flight in Cluttered Environments

基于事件的四旋翼飞行器在杂乱环境中的近似模仿学习

Nico Messikommer, Jiaxu Xing, Leonard Bauersfeld, Marco Cannici, Elie Aljalbout, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich, Switzerland(苏黎世联邦理工学院机器人与感知组)

专题命中 模仿学习与强化学习 :robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 提出近似模仿学习框架,通过分离表征学习与策略搜索,将事件相机四旋翼飞行策略训练时间从52.44小时降至1.86小时,实现28倍加速,并在仿真和真实环境中验证了高速飞行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01302 2026-06-02 cs.RO 70%

Hybrid TD3: Overestimation Bias Analysis and Stable Policy Optimization for Hybrid Action Space

混合TD3:混合动作空间中的过估计偏差分析与稳定策略优化

Thanh-Tuan Tran, Thanh Nguyen Canh, Nak Young Chong, Xiem HoangVan

机构 * Department of Computer Science, University of California, Berkeley(1. 加州大学伯克利分校计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对离散-连续混合动作空间中的强化学习挑战,提出Hybrid TD3算法,通过理论分析过估计偏差并引入加权裁剪Q学习目标,实现稳定策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19191 2026-06-02 cs.RO 70%

RCM-ACT: Imitation Learning with Dynamic RCM Calibration for Autonomous Intraocular Foreign Body Removal

RCM-ACT: 基于动态RCM校准的模仿学习用于自主眼内异物取出

Yue Wang, Wenjie Deng, Haotian Xue, Di Cui, Yiqi Chen, Mingchuan Zhou, Haochao Ying, Jian Wu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院血管植入设备国家重点实验室) Dessight Biomedical(Dessight生物医学公司) Center for Rehabilitation Medicine, Department of Ophthalmology, Zhejiang Provincial People’s Hospital(浙江省人民医院康复医学中心、眼科部门) School of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) School of Public Health and Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院公共卫生学院及第二附属医院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital and School of Public Health, Zhejiang University School of Medicine(浙江大学医学院第二附属医院及公共卫生学院血管植入设备国家重点实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出RCM-ACT模仿学习框架,通过动态RCM校准和动作分块变换器解决眼内手术中的运动学不确定性,实现自主环抓取与定位,平均3D抓取偏差0.686 mm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01098 2026-06-02 cs.RO cs.AI 62%

Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry

隐式漂移策略:通过条件专家几何实现单步动作生成

Zemin Yang, Yaoyu He, Yiming Zhong, Yuhao Zhang, Xinge Zhu, Yao Mu, Qingqiu Huang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Morphi Robot(Morphi机器人)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出隐式漂移策略(IDP),一种单步模仿学习框架,通过条件专家几何隐式引入训练时的漂移校正,无需显式向量场估计,在2D、3D及真实世界操作任务中有效保持有效动作流形,性能优于显式漂移方法并达到强单步基线水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00562 2026-06-02 cs.CV cs.LG 62%

DeepLatent: Think with Images via Parallel Latent Visual Reasoning

DeepLatent: 通过并行潜在视觉推理用图像思考

Dongchen Lu, Zhimo Li, Mao Shu, Huo Cao

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 提出DeepLatent框架,通过LatentFormer并行生成潜在视觉状态,并结合连续空间强化学习优化潜在表示,在多个基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02337 2026-06-02 cs.AI 57%

Coordination Graphs for Constrained Multi-Agent Reinforcement Learning

约束多智能体强化学习的协调图

Santiago Amaya-Corredor, Miguel Calvo-Fullana, Anders Jonsson

机构 * Department of Electrical and Computer Engineering, Linköping University(1 链çe普大学电气与计算机工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出CG-CMARL框架,利用协调图和拉格朗日对偶分解联合动作空间与约束耦合问题,实现独立于智能体数量的模型学习,并通过Max-Sum消息传递和拉格朗日乘子控制目标-约束权衡,生成帕累托前沿。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 40 pages (12 main + 28 appendix), 5 figures, 16 tables, 7 theorems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02280 2026-06-02 cs.RO 57%

Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation

动力学是学出来的,不是告诉的:零样本策略适应的潜在动力学几何半监督发现

Zhiming Xu, Weitao Zhou, Xianghui Pan, Nanshan Deng, Chengju Liu, Qijun Chen, Chenpeng Yao

机构 * Zhiming Xu(徐志明) Weitao Zhou(周伟涛) Xianghui Pan(潘向辉) Nanshan Deng(邓南山) Chengju Liu(刘成军) Qijun Chen(陈齐军) Chenpeng Yao(姚晨鹏)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对机器人强化学习中动力学变化导致策略失效的问题,提出基于对比学习的半监督方法,通过构建平滑、任务相关的潜在拓扑结构,实现零样本策略适应,在MuJoCo基准上优于参数中心方法。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01868 2026-06-02 cs.LG 57%

Task-Induced Representational Invariances Depend on Learning Objective in Deep RL

任务诱导的表征不变性依赖于深度强化学习中的学习目标

Manu Srinath Halvagal, Sebastian Lee, SueYeon Chung

机构 * Department of Physics, Harvard University(哈佛大学物理系) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) Center for Computational Neuroscience, Flatiron Institute(Flatiron研究所计算神经科学中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文通过MDP约简理论分析深度强化学习中的表征,发现基于价值的方法(DQN)学习对MDP同态对称性不变的表征,而基于策略梯度的方法(PPO)学习对动作对称性不变的表征,这些差异影响迁移学习并在LLM中呈现提示依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01363 2026-06-02 cs.LG cs.SY eess.SY 57%

All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning

所有模型都是错的,知道哪里有用:强化学习中的模型不确定性

Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele, Friedrich Solowjow, Sebastian Trimpe

机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) Robotics Institute Germany (RIG)(德国机器人研究所) Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00730 2026-06-02 cs.RO 57%

Infeasible optimization problems and the hierarchical augmented Lagrangian method in imitation learning

模仿学习中的不可行优化问题与分层增广拉格朗日方法

Roland Andrews, Justin Carpentier, Ajay Sathya

机构 * University of Cambridge(剑桥大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对模仿学习中约束不可行导致训练不稳定的问题,提出基于增广拉格朗日方法的解决方案,将策略引导至最近可行约束问题的解,并在驾驶示例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00427 2026-06-02 cs.LG 57%

Topology-Aware State Abstraction with Tangle Cores for Markov Decision Processes

基于纠缠核的马尔可夫决策过程拓扑感知状态抽象

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 提出纠缠核抽象框架,利用经验转移图的图纠缠构建重叠状态抽象,在动作一致性条件下保证价值保持,并通过实验证明其在瓶颈领域优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14709 2026-06-02 cs.CV 57%

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器

Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li, Feng Wang, Shuochen Chang, Shaobo Wang, Yali Wang, Keming Ye, Jiangtong Li, Li Niu

机构 * Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17919 2026-06-02 cs.CE 50%

Training Diffusion Language Models for Black-Box Optimization

训练扩散语言模型用于黑盒优化

Zipeng Sun, Can Chen, Ye Yuan, Haolun Wu, Jiayao Gu, Christopher Pal, Xue Liu

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 针对离线黑盒优化问题,提出通过扩散语言模型的双向建模能力,结合统一语料构建和两阶段后训练框架,实现高效设计生成,在Design-Bench上达到最优性能。

Comments Accepted at ICML 2026 as a Spotlight Paper (top 2.2% of submissions)

详情

展开后加载摘要…

URL PDF HTML 收藏