arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-16 至 2026-06-16 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 13 篇

2502.19544 2026-06-16 cs.LG cs.RO 版本更新 86%

Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data

通过非策划数据引导世界模型的高效强化学习

Yi Zhao, Aidan Scannell, Wenshuai Zhao, Yuxin Hou, Tianyu Cui, Le Chen, Dieter Büchler, Arno Solin, Juho Kannala, Joni Pajarinen

机构 * Aalto University(阿alto大学) University of Edinburgh(爱丁堡大学) ELLIS Institute Finland(芬兰ELLIS研究所) Deep Render Imperial College London(伦敦帝国理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所(Amii)) University of Oulu(奥卢大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出利用无奖励、混合质量、多本体的非策划离线数据,通过经验回放和执行引导技术解决分布偏移问题,显著提升在线强化学习的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16621 2026-06-16 cs.RO 新提交 79%

Reinforcement Learning with Inner-loop Dynamics Estimator for Aerial Manipulation under Uncertainty

基于内环动力学估计器的强化学习在不确定性下的空中操纵

Shivansh Pratap Singh, Samaksh Ujjwal, Ishita Chaudhary, V R Vasudevan, Rishabh Dev Yadav, Spandan Roy

机构 * International Institute of Information Technology Hyderabad(国际信息技术学院海德拉巴) University of Manchester(曼彻斯特大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出一种分层控制框架,结合强化学习与外环与内环动力学估计器,实现直接任务驱动控制,在硬件实验中降低末端执行器跟踪误差并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16572 2026-06-16 cs.RO 新提交 79%

Steering Generative Reinforcement Learning into Stable Robotic Controller

将生成式强化学习引导至稳定机器人控制器

Yixuan Wang, Shutong Ding, Ke Hu, Tianxiang Gui, Jingya Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出SteerGenPO框架,通过潜在空间强化学习将训练好的生成式策略转化为鲁棒的确定性机器人控制器,在Isaac Lab和Unitree G1任务上优于基线方法,实现更稳定的推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12560 2026-06-16 cs.CV cs.LG cs.RO 版本更新 78%

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

CoIRL-AD:面向自动驾驶的潜在世界模型中的协作-竞争模仿-强化学习

Xiaoji Zheng, Ziyuan Yang, Yanhao Chen, Yuhang Peng, Yuanrong Tang, Gengyuan Liu, Bokui Chen, Jiangtao Gong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :world model(title);分类 cs.RO、cs.CV、cs.LG

AI总结 提出CoIRL-AD框架,通过解耦模仿学习与强化学习、利用潜在世界模型进行长时程奖励估计以及引入竞争机制,在离线训练中提升自动驾驶的鲁棒性,尤其在跨城市泛化和长尾场景中表现优异。

Comments 19 pages, 22 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15514 2026-06-16 cs.RO cs.LG 新提交 73%

Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities

强化学习引导的软融合检索用于缺失模态下的鲁棒多模态模仿学习

Hassan Ismkhan, Hamid Bouchahcia

机构 * Bournemouth University(伯恩茅斯大学)

专题命中 模仿学习与强化学习 :robotic(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 提出RL4IL方法,利用强化学习策略从训练库中检索最相关专家演示,并通过软交叉注意力融合生成动作,有效处理传感器缺失问题,在LIBERO基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16856 2026-06-16 cs.RO 新提交 70%

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

基于视频的最优传输用于反馈高效的离线偏好强化学习

Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出VOTP框架,利用视频基础模型和最优传输生成伪标签,仅需少量人类反馈即可学习有效奖励函数,显著降低标注成本。

Comments ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15918 2026-06-16 cs.RO 新提交 70%

Energy-Efficient Arm Reaching for a Humanoid Robot via Deep Reinforcement Learning with Identified Power Models

基于识别功率模型的深度强化学习实现人形机器人节能手臂伸展

Nestor N. Deniz, Simon Parsons, Fernando Auat Cheein

机构 * Harper Adams University(哈珀亚当斯大学) Lincoln Institute for Agri-Food Technology(林肯农业食品技术研究所) Lincoln Centre for Autonomous Systems(林肯自主系统中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种端到端能量感知强化学习框架,结合物理实验识别的电功率模型与SAC策略,在Unitree G1人形机器人上实现节能手臂伸展,仿真成功率69.9%,实物验证平均能耗71.5 J。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16515 2026-06-16 cs.LG cs.AI cs.RO 新提交 67%

Direction-Conditioned Policies via Compositional Subgoal Scoring for Online Goal-Conditioned Reinforcement Learning

基于组合子目标评分的方向条件策略用于在线目标条件强化学习

Swaminathan S K, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan, Aritra Hazra

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur(计算机科学与工程系,印度理工学院Kharagpur分校) Department of Mechanical Engineering, Indian Institute of Technology Kharagpur(机械工程系,印度理工学院Kharagpur分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出方向条件策略(DCP),通过共享InfoNCE表示将目标达成分解为子目标评分和方向条件动作,理论证明方向充分性、训练与部署一致性及可控子空间失效条件,在九个环境中优于对比RL。

Comments 17 pages, Accepted to the 2nd Workshop on Compositional Learning at ICML 2026 (Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14801 2026-06-16 cs.LG cs.AI cs.RO 新提交 67%

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

QPILOTS:面向流策略的高效测试时Q引导

Yifan Ruan, Chenyang Cao, Andreas Burger, Ali Pesaranghader, Kaveh Kamali, Jaehong Kim, Nandita Vijaykumar, Alan Aspuru-Guzik, Igor Gilitschenski, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) LG Electronics(LG电子)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出QPILOTS方法,在推理时通过投影去噪中间状态到最终动作估计并计算评论家梯度来引导流匹配和扩散策略,无需修改原策略,在离线到在线RL基准上达到90%平均成功率。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16480 2026-06-16 cs.RO cs.AI cs.SY eess.SY 新提交 62%

HOLO-MPPI: Multi-Scenario Motion Planning via Hierarchical Policy Optimization

HOLO-MPPI:通过分层策略优化的多场景运动规划

Youngjae Min, Jovin D'sa, Faizan M. Tariq, David Isele, Navid Azizan, Sangjae Bae

机构 * Massachusetts Institute of Technology(麻省理工学院) Honda Research Institute, USA(本田研究所(美国))

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI

AI总结 提出HOLO-MPPI框架,结合离线高层策略学习与在线低层随机最优控制,实现多场景运动规划,无需针对每个场景重新调整参数,在自动驾驶中优于MPPI和端到端RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05608 2026-06-16 cs.RO 版本更新 61%

HiCrowd: Hierarchical Crowd Flow Alignment for Dense Human Environments

HiCrowd:密集人群环境中的分层人群流对齐

Yufei Zhu, Shih-Min Yang, Martin Magnusson, Allan Wang

机构 * Robot Navigation and Perception Lab, AASS Research Center, Örebro University, Sweden(奥雷布罗大学机器人导航与感知实验室,AASS研究中心,瑞典) Miraikan – The National Museum of Emerging Science and Innovation, Japan(日本新兴科学与创新国家博物馆——Miraikan)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 提出HiCrowd分层框架,结合强化学习与模型预测控制,通过跟随人群流解决机器人冻结问题,在真实和合成数据集上提升导航效率与安全性。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16870 2026-06-16 cs.CV cs.GR 新提交 57%

Latent Space Reinforcement Learning for Inverse Material Estimation in Food Fracture Simulation

潜空间强化学习用于食品断裂模拟中的逆材料估计

Adrian Ramlal, Yuhao Chen, John S. Zelek

机构 * University of Waterloo(滑铁卢大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 针对食品断裂模拟中材料参数难以直接测量的问题,提出基于潜空间强化学习的目标条件策略,实现从断裂行为描述到材料参数的单次前向估计,精度提升23%。

Comments Accepted in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 MetaFood Workshop

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 9573-9581

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27450 2026-06-16 cs.LG 版本更新 57%

FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies

FlowRL:基于扩散策略的强化学习分类与模块化框架

Chenxiao Gao, Edward Chen, Tianyi Chen, Bo Dai

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出扩散/流策略强化学习算法的统一分类法,构建模块化JAX框架,在多个基准上提供系统比较,为算法设计与应用提供指导。

Comments accepted by RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏