arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4111 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4111 篇

2606.21271 2026-06-23 cs.LG 新提交 70%

Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

通过占据覆盖最大化进行强化学习的无奖励预训练

Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

机构 * Computational Statistics and Machine Learning - Istituto Italiano di Tecnologia(计算统计与机器学习 - 意大利技术研究院) AI Centre, Computer Science Department, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);world model(abstract);分类 cs.LG

AI总结 提出一种无奖励预训练方法ROVER,通过最大化状态占据测度的覆盖来学习可迁移探索策略,在稀疏奖励下游任务中快速适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11494 2026-06-23 cs.RO 版本更新 70%

SHIELD: Safety on Humanoids via CBFs In Expectation on Learned Dynamics

SHIELD: 基于学习动力学期望的控制障碍函数实现人形机器人安全

Lizhi Yang, Blake Werner, Ryan K. Cosner, David Fridovich-Keil, Preston Culbertson, Aaron D. Ames

机构 * Mechanical and Civil Engineering, California Institute of Technology(加州理工学院机械与土木工程系) Aerospace Engineering and Engineering Mechanics, UT Austin(德克萨斯大学奥斯汀分校航空航天工程与工程力学系) Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 模仿学习与强化学习 :robot learning(abstract);navigation(abstract);分类 cs.RO

AI总结 提出SHIELD框架,通过训练随机动力学残差模型并利用随机离散时间CBF在概率上保证安全,为黑箱RL控制器添加最小侵入式安全层,在Unitree G1人形机器人上实现安全导航。

Comments Accepted to the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025). Copyright transferred to IEEE. Video at https://youtu.be/-Qv1wR4jfj4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 70%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19525 2026-06-17 cs.RO 70%

Real-Time Reinforcement Learning for Dynamic Tasks with a Parallel Soft Robot

动态任务的实时强化学习与并行软机器人

James Avtges, Jake Ketchum, Millicent Schlafly, Helena Young, Taekyoung Kim, Allison Pinosky, Ryan L. Truby, Todd D. Murphey

机构 * Department of Mechanical Engineering, Northwestern University(西北大学机械工程系) Department of Materials Science and Engineering, Northwestern University(西北大学材料科学与工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于课程学习的实时强化学习方法,用于在单次部署中实现软机器人的动态平衡,通过并行软执行器和HSA结构实现高可靠性控制。

Comments Published at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16856 2026-06-16 cs.RO 新提交 70%

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

基于视频的最优传输用于反馈高效的离线偏好强化学习

Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出VOTP框架,利用视频基础模型和最优传输生成伪标签,仅需少量人类反馈即可学习有效奖励函数,显著降低标注成本。

Comments ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15918 2026-06-16 cs.RO 新提交 70%

Energy-Efficient Arm Reaching for a Humanoid Robot via Deep Reinforcement Learning with Identified Power Models

基于识别功率模型的深度强化学习实现人形机器人节能手臂伸展

Nestor N. Deniz, Simon Parsons, Fernando Auat Cheein

机构 * Harper Adams University(哈珀亚当斯大学) Lincoln Institute for Agri-Food Technology(林肯农业食品技术研究所) Lincoln Centre for Autonomous Systems(林肯自主系统中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种端到端能量感知强化学习框架,结合物理实验识别的电功率模型与SAC策略,在Unitree G1人形机器人上实现节能手臂伸展,仿真成功率69.9%,实物验证平均能耗71.5 J。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25025 2026-06-15 cs.RO cs.SY eess.SY 版本更新 70%

Micro-Swarm Locomotion Optimization in Dynamic Flow using Multi-Objective Multi-Agent Reinforcement Learning

动态流场中微群集运动优化的多目标多智能体强化学习方法

Josef Berman, Oren Gal

机构 * Hatter Department of Marine Technologies, Leon H. Charney School of Marine Sciences, University of Haifa(哈特尔海洋技术系,列昂·H·夏恩海洋科学学院,海法大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出混合CFD与多目标多智能体强化学习框架,通过PCGrad解决梯度冲突,在振荡流中优化微机器人集群的上游推进、能量效率和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00461 2026-06-11 cs.CV 版本更新 70%

ReMoT: Reinforcement Learning with Motion Contrast Triplets

ReMoT: 基于运动对比三元组的强化学习

Cong Wan, Zeyu Guo, Jiangyang Li, SongLin Dong, Yifan Bai, Lin Peng, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10825 2026-06-10 cs.LG 新提交 70%

MODIP: Efficient Model-Based Optimization for Diffusion Policies

MODIP:扩散策略的高效基于模型的优化

Zakariae El Asri, Philippe Gratias-Quiquandon, Nicolas Thome, Olivier Sigaud

机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学,法国国家科学研究中心,智能系统与机器人研究所,法国巴黎) Institut Universitaire de France (IUF)(法国大学研究院)

专题命中 模仿学习与强化学习 :robot learning(abstract);world model(abstract);分类 cs.LG

AI总结 提出MODIP框架,利用世界模型和模型预测控制生成高质量轨迹,以监督方式微调扩散策略,实现离线到在线的强化学习微调,在D4RL和RoboMimic任务上超越行为克隆基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06967 2026-06-08 cs.LG 新提交 70%

GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios

GenPO++:基于无雅可比似然比的生成式策略优化

Ke Hu, Shutong Ding, Panxin Tao, Jingya Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出GenPO++框架,利用高阶可逆ODE求解器中的历史状态作为辅助记忆,实现精确可逆映射,从而无偏且高效地计算生成流策略的似然比,在连续控制任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02194 2026-06-02 cs.LG 70%

Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards

基于学习奖励的大规模行为模型的一致性离策略改进

Christian Scherer, Joe Watson, Theo Gruner, Daniel Palenicek, Ingmar Posner, Jan Peters

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Oxford(牛津大学) Zuse School ELIZA(泽努斯学校ELIZA) hessian.AI(海西斯AI) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出一种逆强化学习方法,通过从专家演示中学习稠密奖励函数,结合一致性模仿学习理论保证,实现对预训练策略的离策略改进,在稀疏奖励操作任务中优于强化学习基线。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01672 2026-06-02 cs.LG 70%

RDA: Reward Design Agent for Reinforcement Learning

RDA:用于强化学习的奖励设计智能体

Hojoon Lee, Ajay Subramanian, Ben Abbatematteo, Vijay Veerabadran, Pedro Matias, Karl Ridgeway, Nitin Kamra

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度Mind)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出基于视觉语言模型的奖励设计智能体RDA,通过任务分解、视觉轨迹评估和失败模式总结迭代优化奖励函数,在操作任务中生成更符合指令的策略。

Comments Accepted to RLC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01036 2026-06-02 cs.RO 70%

Position: Good Embodied Reward Models Need Bad Behavior Data

立场:好的具身奖励模型需要不良行为数据

Ran Tian, Yilin Wu, Andrea Bajcsy

机构 * Ran Tian, Yilin Wu, Andrea Bajcsy

专题命中 模仿学习与强化学习 :robotics(abstract);embodied AI(abstract);分类 cs.RO

AI总结 本文主张为获得可靠的具身奖励模型,社区必须投资于“不良”机器人数据(失败、次优、易错甚至危险行为),并通过实验证明即使少量真实不良数据也能改善与人类偏好的一致性。

Comments This position paper has been accepted by the ICML 2026 position track as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07578 2026-06-02 cs.RO 70%

Approximate Imitation Learning for Event-based Quadrotor Flight in Cluttered Environments

基于事件的四旋翼飞行器在杂乱环境中的近似模仿学习

Nico Messikommer, Jiaxu Xing, Leonard Bauersfeld, Marco Cannici, Elie Aljalbout, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich, Switzerland(苏黎世联邦理工学院机器人与感知组)

专题命中 模仿学习与强化学习 :robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 提出近似模仿学习框架,通过分离表征学习与策略搜索,将事件相机四旋翼飞行策略训练时间从52.44小时降至1.86小时,实现28倍加速,并在仿真和真实环境中验证了高速飞行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01302 2026-06-02 cs.RO 70%

Hybrid TD3: Overestimation Bias Analysis and Stable Policy Optimization for Hybrid Action Space

混合TD3:混合动作空间中的过估计偏差分析与稳定策略优化

Thanh-Tuan Tran, Thanh Nguyen Canh, Nak Young Chong, Xiem HoangVan

机构 * Department of Computer Science, University of California, Berkeley(1. 加州大学伯克利分校计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对离散-连续混合动作空间中的强化学习挑战,提出Hybrid TD3算法,通过理论分析过估计偏差并引入加权裁剪Q学习目标,实现稳定策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19191 2026-06-02 cs.RO 70%

RCM-ACT: Imitation Learning with Dynamic RCM Calibration for Autonomous Intraocular Foreign Body Removal

RCM-ACT: 基于动态RCM校准的模仿学习用于自主眼内异物取出

Yue Wang, Wenjie Deng, Haotian Xue, Di Cui, Yiqi Chen, Mingchuan Zhou, Haochao Ying, Jian Wu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院血管植入设备国家重点实验室) Dessight Biomedical(Dessight生物医学公司) Center for Rehabilitation Medicine, Department of Ophthalmology, Zhejiang Provincial People’s Hospital(浙江省人民医院康复医学中心、眼科部门) School of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) School of Public Health and Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院公共卫生学院及第二附属医院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital and School of Public Health, Zhejiang University School of Medicine(浙江大学医学院第二附属医院及公共卫生学院血管植入设备国家重点实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出RCM-ACT模仿学习框架,通过动态RCM校准和动作分块变换器解决眼内手术中的运动学不确定性,实现自主环抓取与定位,平均3D抓取偏差0.686 mm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31273 2026-06-01 cs.LG 70%

Survival Reinforcement Learning: Toward Scalable Self-Supervised RL

生存强化学习:迈向可扩展的自监督强化学习

Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria and École Normale Supérieure PSL Research University(Inria 和 法国国家科学研究中心巴黎大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出生存强化学习(SRL),一种基于在线分类的方法,通过最大化智能体在目标状态停留时间来解决对比强化学习中的均匀性-容忍性困境,在长时程运动任务上性能提升2至8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30795 2026-06-01 cs.RO 70%

Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

Feat2Go: 面向具身强化学习的视觉特征基础价值估计

Junyang Shu, Zhiwei Lin, Bingqing Wei, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 提出Feat2Go框架,通过预训练视觉世界模型提取补丁级子目标相似度并聚类语义阶段,训练具身价值模型预测结构进度以重塑终端奖励,显著提升VLA模型在单臂和双臂操作任务中的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30503 2026-06-01 cs.RO cs.SY eess.SY stat.ML 70%

Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics

混合接触动力学下的物理信息目标条件强化学习

Vittorio Giammarino, Anastasios Manganaris, Ahmed H. Qureshi

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 针对接触丰富任务中混合动力学导致现有物理信息目标条件强化学习方法性能下降的问题,提出接触感知和分层公式,选择性应用物理信息归纳偏置,向接触丰富操作扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23847 2026-05-25 cs.RO 70%

Instrumentation for Imitation Learning: Enhancing Training Datasets for Clothes Hanger Insertion

模仿学习的仪器化:增强衣架插入训练数据集

Remko Proesmans, Thomas Lips, Francis wyffels

机构 * AI and Robotics Lab (IDLab-AIRO)(人工智能与机器人实验室(IDLab-AIRO)) Ghent University—imec(根特大学—imec)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文通过仪器化(在物体中集成传感器)提供状态信息,训练扩散策略进行衣架插入任务,实验表明仪器化策略比纯视觉策略成功率提高14-25%,且黑箱模仿学习能自动优先使用仪器信号。

Comments Accepted for presentation at ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21180 2026-05-21 cs.LG cs.SE 70%

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

用于密集奖励的领域可适应强化学习代码生成

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini

机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.LG

AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。

Comments 10 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18809 2026-05-14 cs.LG 70%

Test-time Offline Reinforcement Learning on Goal-related Experience

测试时的离线强化学习在目标相关经验上的应用

Marco Bagatella, Mert Albaba, Jonas Hübotter, Georg Martius, Andreas Krause

机构 * ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Max Planck Institute for Intelligent Systems, Tubingen, Germany(智能系统马克斯·普朗克研究所,图宾根,德国) University of Tubingen, Tubingen, Germany(图宾根大学,图宾根,德国)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 本文提出了一种基于目标的测试时训练方法,通过选择与当前状态和评估目标相关的经验来提升策略性能,适用于高维定位导航和操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12416 2026-05-13 cs.LG 70%

Aligning Flow Map Policies with Optimal Q-Guidance

对齐流映射策略与最优Q引导

Christos Ziakas, Alessandra Russo, Avishek Joey Bose

机构 * Imperial College London(帝国理工学院伦敦分校) Mila

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出流映射策略,通过学习任意大小的跳跃提升动作生成速度,并引入FMQ和QGBS方法,在12个机器人任务中实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12193 2026-04-29 cs.RO 70%

Continual Domain Randomization

持续领域随机化

Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

机构 * School of Computation Information and Technology, Technical University of Munich(技术大学慕尼黑计算信息与技术学院) Department of Computer Science, University of Innsbruck(因斯布鲁克大学计算机科学系) L3S Research Center, Leibniz Universität Hannover(汉诺威莱布尼茨大学L3S研究中心) Digital Science Center (DiSC), University of Innsbruck(因斯布鲁克大学数字科学中心)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出持续领域随机化方法,结合领域随机化与持续学习,通过逐步随机化参数提升机器人抓取任务的仿真训练效果和现实性能。

Comments Accepted at IROS 2024. Equal contribution from first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02644 2026-04-23 cs.AI 70%

D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss

D2PPO:带有分散损失的扩散策略策略优化

Guowei Zou, Weibing Li, Hejun Wu, Yukun Qian, Yuhang Wang, Haitao Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 本文提出D2PPO,通过引入分散损失正则化来解决扩散策略中表示崩溃问题,提升复杂机器人操控任务的性能,实验表明其在预训练和微调中均取得显著改进。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(22): 18891-18899, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-04-22 cs.RO 70%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16615 2026-04-15 cs.RO 70%

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning

基于大型语言模型的任务与能力层面探索的强化学习

Jelle Luijkx, Runyu Ma, Zlatan Ajanović, Jens Kober

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出LLM-TALE框架,利用大型语言模型的规划能力引导强化学习探索,提升学习效率和任务成功率,实验证明在抓取放置任务中表现出更高的样本效率和成功率。

Comments 8 pages, 7 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14377 2026-04-13 cs.RO 70%

Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight

梦想飞翔:基于模型的强化学习用于基于视觉的无人机飞行

Angel Romero, Ashwin Shenai, Ismail Geles, Elie Aljalbout, Davide Scaramuzza

机构 * Robotics and Perception Group, Department of Informatics, University of Zurich(苏黎世大学信息学系机器人感知组)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于模型的强化学习方法,通过像素观测实现无人机敏捷飞行,展示了在模拟和真实世界中的高效表现,推动了基于像素的自主飞行技术发展。

Comments 8 pages, 6 Figures, accepted to IEEE ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06748 2026-04-08 cs.RO 70%

On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning

实时VLA适应 via 测试时强化学习

Changyu Liu, Yiyang Liu, Taowen Wang, Qiao Zhuang, James Chenhao Liang, Wenhao Yang, Renjing Xu, Qifan Wang, Dongfang Liu, Cheng Han

机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) U. S. Naval Research Laboratory(美国海军研究实验室) Lamar University(拉马尔大学) Meta AI Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 模仿学习与强化学习 :robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出TT-VLA框架,通过测试时强化学习实现VLA模型的实时策略适应,提升机器人在动态环境中的适应性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15789 2026-04-03 cs.RO 70%

Emergent Dexterity via Diverse Resets and Large-Scale Reinforcement Learning

通过多样重置和大规模强化学习实现涌现的灵巧性

Patrick Yin, Tyler Westenbroek, Zhengyu Zhang, Joshua Tran, Ignacio Dagnino, Eeshani Shilamkar, Numfor Mbiziwo-Tiapo, Simran Bagaria, Xinlei Liu, Galen Mullins, Andrey Kolobov, Abhishek Gupta

机构 * University of Washington(华盛顿大学) NVIDIA(英伟达) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出OmniReset框架,通过模拟器重置和固定超参数,实现单奖励函数解决广泛灵巧操作任务,提升鲁棒性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏