arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-14 至 2026-04-14 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 8 篇

2604.10165 2026-04-14 cs.RO 83%

MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks

MoRI:混合强化学习和模仿学习专家用于长 horizon � Manipulation 任务

Yaohang Xu, Lianjie Ma, Gewei Zuo, Wentao Zhang, Han Ding, Lijun Zhu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) DRAGON Lab, The University of Tokyo(东京大学DRAGON实验室) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 MoRI通过混合强化学习和模仿学习专家,动态切换处理粗略运动和精细操作,提高长horizon manipulation任务的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10962 2026-04-14 cs.RO 77%

ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching

ScoRe-Flow:通过基于分数的强化学习实现完整分布控制的流匹配

Xiaotian Qiu, Lukai Chen, Jinhao Li, Qi Sun, Cheng Zhuo, Guohao Dai

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出ScoRe-Flow方法,通过基于分数的强化学习微调,实现对流匹配中均值和方差的解耦控制,提升了训练效率和任务成功率。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10677 2026-04-14 cs.RO cs.CV 73%

LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment

LIDEA:通过隐式特征蒸馏和显式几何对齐的人机模仿学习

Yifu Xu, Bokai Lin, Xinyu Zhan, Hongjie Fang, Yong-Lu Li, Cewu Lu, Lixin Yang

专题命中 模仿学习与强化学习 :robot learning(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 LIDEA通过隐式特征蒸馏和显式几何对齐,解决人机交互中的表征对齐问题,提升机器人学习效率和域外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06540 2026-04-14 eess.SY cs.AI cs.LG cs.RO cs.SY math.OC 67%

Self-Organizing Dual-Buffer Adaptive Clustering Experience Replay (SODACER) for Safe Reinforcement Learning in Optimal Control

自组织双缓冲自适应聚类经验回放(SODACER)用于最优控制中的安全强化学习

Roya Khalili Amirabadi, Mohsen Jalaeian Farimani, Omid Solaymani Fard

机构 * Department of Applied Mathematics, Ferdowsi University of Mashhad(菲尔多西大学应用数学系) Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano(米兰理工大学电子、信息与生物工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出SODACER框架,结合自组织自适应聚类机制与控制屏障函数,实现非线性系统的安全高效控制,通过Sophia优化器提升收敛性和稳定性,验证了其在非线性HPV传播模型中的有效性。

Comments Published in Nature Scientific Reports (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO 62%

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 57%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10429 2026-04-14 cs.AI 57%

Safety Guarantees in Zero-Shot Reinforcement Learning for Cascade Dynamical Systems

在级联动力系统中零样本强化学习的安全保障

Shima Rabiei, Sandipan Mishra, Santiago Paternain

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文研究了级联动力系统中零样本安全保证问题,提出在简化模型上训练安全RL策略,并通过低层控制器跟踪RL策略的参考信号,理论分析了安全概率与内状态跟踪质量的关系。

Comments 8 pages, 2 figures; submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11019 2026-04-14 cs.LG 57%

Relative Entropy Pathwise Policy Optimization

相对熵路径策略优化

Claas Voelcker, Axel Brunnbauer, Marcel Hussing, Michal Nauman, Pieter Abbeel, Eric Eaton, Radu Grosu, Amir-massoud Farahmand, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) TU Wien(维也纳工业大学) University of Pennsylvania(宾夕法尼亚大学) University of Warsaw(华沙大学) UC Berkeley(加州大学伯克利分校) Polytechnique Montréal(蒙特利尔综合理工学院) Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出REPPO算法,通过路径策略梯度结合在线学习,提升训练稳定性与效率,展现优越的样本效率和内存表现。

详情

展开后加载摘要…

URL PDF HTML 收藏