arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 115 篇

2502.19544 2026-06-16 cs.LG cs.RO 版本更新 86%

Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data

通过非策划数据引导世界模型的高效强化学习

Yi Zhao, Aidan Scannell, Wenshuai Zhao, Yuxin Hou, Tianyu Cui, Le Chen, Dieter Büchler, Arno Solin, Juho Kannala, Joni Pajarinen

机构 * Aalto University(阿alto大学) University of Edinburgh(爱丁堡大学) ELLIS Institute Finland(芬兰ELLIS研究所) Deep Render Imperial College London(伦敦帝国理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所(Amii)) University of Oulu(奥卢大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出利用无奖励、混合质量、多本体的非策划离线数据,通过经验回放和执行引导技术解决分布偏移问题,显著提升在线强化学习的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 85%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :robotics(title);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08958 2026-06-12 cs.LG cs.AI cs.RO 版本更新 85%

WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning

WOMBET:基于世界模型的经验迁移实现鲁棒且样本高效的强化学习

Mintae Kim, Koushil Sreenath

机构 * Hybrid Robotics, UC Berkeley(混合机器人技术,伯克利大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出WOMBET框架,通过源任务中学习世界模型并生成不确定性惩罚的离线数据,再结合自适应采样进行在线微调,实现鲁棒且样本高效的强化学习迁移。

Comments 13 pages, 6 figures, 8th Annual Learning for Dynamics & Control Conference (L4DC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 85%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 模仿学习与强化学习 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16602 2026-07-22 cs.CV 版本更新 83%

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

PAVXploreRL:具有动作探索的物理动作视觉世界模型强化学习

Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fengjiao Cheng, Xiaodan Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Sun Yat-sen University(中山大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);embodied AI(abstract);分类 cs.CV

AI总结 研究针对动作条件世界模型泛化性差的问题,提出PAVXploreRL强化学习框架,基于预训练潜在世界模型,通过奖励驱动训练优化PAV目标,联合利用ID轨迹与OOD动作探索提升泛化能力,实验证明该方法性能更优。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23531 2026-07-16 cs.RO 版本更新 83%

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation

BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航

Jinsong Lin, Chi Kit Ng, Zhiyong Xiong, Zikang Pan, Yihan Hu, Tabassum Tamima, Ziyi Hao, Eddie Cheung, Jiewen Lai, Huxin Gao, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) University of Cambridge(剑桥大学) University of California, Davis(加州大学戴维斯分校)

专题命中 模仿学习与强化学习 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24121 2026-06-23 cs.RO 版本更新 83%

Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation

在线世界建模实现真实世界逆强化学习从观察中学习

Tyler Han, Bat Nemekhbold, Siyang Shen, Rohan Baijal, Richard Ebock, Harine Ravichandiran, Sanghun Jung, Kevin Huang, Byron Boots

机构 * University of Washington(华盛顿大学)

专题命中 模仿学习与强化学习 :world model(title);robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出MPAIL2方法,通过在线世界建模实现从观察中逆强化学习,首次在真实世界从零学习视觉操作任务,40分钟内达到82%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18464 2026-06-15 cs.LG 版本更新 83%

AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models

AcceRL: 面向视觉-语言-动作模型的分布式异步强化学习与世界模型框架

Chengxuan Lu, Shukuan Wang, Yanjie Li, Yingying Fang, Huoyan Wang, Tian Zhang, Wei Liu, Shiji Jin, Fuyuan Qian, Peiming Li, Chao Xu, Baigui Sun, Yang Liu

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(伊罗科技沃尔夫1069b实验室,三一集团)

专题命中 模仿学习与强化学习 :world model(title,abstract);embodied AI(abstract);分类 cs.LG

AI总结 提出AcceRL框架,通过物理隔离环境交互、模型推理和梯度更新实现分布式异步强化学习,消除同步系统的空闲气泡,提升硬件利用率,并支持即插即用的世界模型集成,在LIBERO任务上实现2.4倍吞吐加速和200倍样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06277 2026-08-07 cs.CV cs.LG 版本更新 82%

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

动态目标掩码作为视觉目标条件强化学习的目标表示

Fahim Shahriar, Cheryl Wang, Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, Colin Bellinger

机构 * University of Alberta(阿尔伯塔大学) McGill University(麦吉尔大学) University of Ottawa(渥太华大学) AMII CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) Vector Institute(向量研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13707 2026-07-31 cs.RO cs.AI cs.LG 版本更新 82%

REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning

REFINE-DP:通过强化学习实现人形机器人的动态-操作协调政策微调

Zhaoyuan Gu, Yipu Chen, Zimeng Chai, Alfred Cueva, Thong Nguyen, Yifan Wu, Huishu Xue, Minji Kim, Isaac Legene, Fukang Liu, KyoungMok Kim, Ayan Barula, Yongxin Chen, Ye Zhao

机构 * The Institute for Robotics and Intelligent Machines(机器人与智能机械研究所)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出REFINE-DP框架,通过联合优化扩散政策高层规划器和基于强化学习的低层动态-操作控制器,提升人形机器人在复杂环境中的任务成功率与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21638 2026-07-22 cs.AI cs.LG cs.MA cs.RO 版本更新 82%

Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics

Assistax: 一个用于辅助机器人的多智能体硬件加速强化学习基准

Leonard Hinckeldey, Elliot Fosong, Rimvydas Rubavicius, Elle Miller, Trevor McInroe, Fan Zhang, Patricia Wollstadt, Stefano V. Albrecht, Subramanian Ramamoorthy

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Assistax基准,利用JAX硬件加速和基于多智能体强化学习的辅助机器人任务,实现高达370倍加速,并测试机器人的零样本协调能力。

Comments Accepted at the Reinforcement Learning Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02867 2026-06-23 cs.LG cs.AI cs.RO 版本更新 82%

Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters

通过SHAP分析算法和超参数增强机器人学中强化学习的泛化能力

Lingxiao Kong, Cong Yang, Oya Deniz Beyan, Zeyd Boukhers

机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) University of Cologne(科隆大学) University Hospital of Cologne(科隆大学医院)

专题命中 模仿学习与强化学习 :robotics(title);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出基于SHAP的可解释框架,量化算法和超参数对强化学习泛化差距的贡献,并用于配置选择以提升泛化能力。

Comments 16 pages, 7 figures, accepted by ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26633 2026-06-17 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新 82%

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

OmniRetarget:面向人形全身运动操控与场景交互的交互保持数据生成

Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) MIT(麻省理工学院) UC Berkeley(伯克利大学) Stanford University(斯坦福大学) CMU(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出OmniRetarget引擎,通过交互网格显式建模并保持智能体、地形和物体间的空间与接触关系,将人类运动重定向为机器人运动,生成高质量轨迹以训练强化学习策略,实现长时间跑酷和操控技能。

Comments Project website: https://omniretarget.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07945 2026-06-25 cs.RO cs.AI 版本更新 81%

Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation

面向社交导航的真实世界学习的增量残差强化学习

Haruto Nagahisa, Kohei Matsumoto, Yuki Tomita, Yuki Hyodo, Ryo Kurazume

机构 * School of Engineering, Kyushu University(九州大学工学系) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系) School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出增量残差强化学习(IRRL),结合增量学习与残差强化学习,在无回放缓冲区的情况下实现与基于回放缓冲区方法相当的性能,并通过真实世界实验验证机器人适应新环境的能力。

Comments RO-MAN 2026, video https://youtu.be/NJOhv56CrPM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03963 2026-06-10 cs.RO cs.AI 版本更新 81%

AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation

面向视觉条件的无人机导航的自优化智能体强化学习

Roohan Ahmed Khan, Yasheerah Yaqoot, Amir Atef Habel, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出AgenticRL框架,利用多模态GPT智能体自动设计奖励函数、通过闭环自改进优化策略,在多种无人机导航任务中提升性能并实现高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06659 2026-06-09 cs.LG cs.AI 版本更新 81%

In-Context Reinforcement Learning via Communicative World Models

通过通信世界模型进行上下文强化学习

Fernando Martinez-Lopez, Tao Li, Yingdong Lu, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) IBM Research(IBM研究院)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CORAL框架,通过将潜在表示学习与控制分离,利用信息代理预训练世界模型并生成通信消息,使控制代理实现零样本适应和样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01072 2026-06-08 cs.RO cs.CV 版本更新 81%

Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs

利用场景图扩展机器人模仿学习的时空上下文

Jianing Qian, Qinhe Peng, Emmanuel Panov, Leonor Fermoselle, Dinesh Jayaraman, Bernadette Bucher, Tarik Kelestemur

机构 * University of Pennsylvania(宾夕法尼亚大学) RAI Institute(RAI研究院) University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出使用场景图作为显式结构化记忆机制,通过动态维护对象中心关系及其时间演化,解决机器人模仿学习中的部分可观测性和长时推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02953 2026-08-11 cs.CV 版本更新 79%

RealWeather: Realistic and Scene-Faithful Weather Translation with Driving World Models

RealWeather:基于驾驶世界模型的逼真且场景忠实的天气转换

Yuwei Ning, Liangzhi Wang, Yi Xiao, Zhenhua Wu, Yun Pang, Mingkun Chang, Jichang Li, Guanbin Li

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 RealWeather是一种驾驶世界模型,通过渐进式逼真度引导和场景忠实度强化学习优化实现逼真且场景忠实的天气转换,在视觉逼真度、结构保留等方面优于现有方法,支持长尾天气场景生成与零样本泛化。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13888 2026-08-05 cs.RO 版本更新 79%

Path-conditioned Reinforcement Learning-based Local Planning for Long-Range Navigation

基于路径条件的强化学习局部规划用于远距离导航

Mateo Haro, Julia Richter, Fan Yang, Cesar Cadena, Marco Hutter

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于强化学习的局部导航策略,利用路径信息作为上下文指导,提升远距离导航效率并保持在路径信息退化时的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10930 2026-07-16 cs.RO 版本更新 79%

Where to Touch, How to Contact: A Hierarchical RL-MPC Framework for Geometry-Aware Sim-to-Real Manipulation

何处触碰,如何接触:面向几何感知的长时间灵巧操作的分层RL-MPC框架

Zhixian Xie, Yu Xiang, Michael Posa, Wanxin Jin

机构 * Arizona State University(亚利桑那州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出分层RL-MPC框架,高层RL策略预测接触意图(接触位置和子目标位姿),低层接触隐式MPC优化局部接触模式并实时重规划,实现几何泛化的非抓取操作,数据效率提升10倍且零样本迁移到真实环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21543 2026-06-24 cs.RO 版本更新 79%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26974 2026-06-08 cs.RO 版本更新 79%

Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty

信任、几何与规则:不确定性下安全USV导航的可信感知强化学习框架

Yuhang Zhang, Shuqi Chai, Yukang Zhang, Liusha Yang, Mingchuan Zhang, Wei Wang, Qingjiang Shi, Quanbo Ge

机构 * School of Information Engineering, Henan University of Science and Technology(河南科技大学信息工程学院) Shenzhen Research Institute of Big Data(深圳大数据研究院) School of Logistics Engineering, Shanghai Maritime University(上海 Maritime University物流工程学院) Shenzhen Technology University(深圳科技大学) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Software Engineering, Tongji University(同济大学软件工程学院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 提出一种集成可信感知学习、几何安全屏蔽和连续规则感知嵌入的强化学习框架,以解决动态海洋环境中USV导航的安全性和COLREGs合规性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22423 2026-08-04 cs.LG cs.CR cs.RO 版本更新 79%

ARMOR: Robust Reinforcement Learning-based Control for UAVs under Physical Attacks

ARMOR:面向无人机物理攻击的鲁棒强化学习控制

Pritam Dash, Ethan Chan, Nathan P. Lawrence, Karthik Pattabiraman

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(abstract,abstract_cn);navigation(abstract);分类 cs.RO、cs.LG

AI总结 ARMOR是一种抗攻击的无模型强化学习控制器,通过两阶段训练框架学习鲁棒状态表示,可保障无人机在传感器受攻击时的安全运行,泛化能力更强且训练成本更低。

Comments Published at ICRA'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14828 2026-06-11 cs.AI cs.RO 版本更新 79%

RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning

RoboGPT-R1: 通过强化学习增强机器人任务规划

Jinrui Liu, Bingyan Nie, Boyu Li, Yaran Chen, Yuze Wang, Shunsen He, Haoran Li

机构 * Institute of Automation, CASIA(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) Huawei Cloud Technology Co., Ltd(华为云技术有限公司)

专题命中 模仿学习与强化学习 :embodied agent(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出RoboGPT-R1两阶段微调框架,先监督学习获取基础知识,再通过强化学习提升视觉空间理解和推理能力,在EmbodiedBench上超越GPT-4o-mini 21.33%。

Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), pp. 2827-2837, IFAAMAS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12560 2026-06-16 cs.CV cs.LG cs.RO 版本更新 78%

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

CoIRL-AD:面向自动驾驶的潜在世界模型中的协作-竞争模仿-强化学习

Xiaoji Zheng, Ziyuan Yang, Yanhao Chen, Yuhang Peng, Yuanrong Tang, Gengyuan Liu, Bokui Chen, Jiangtao Gong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :world model(title);分类 cs.RO、cs.CV、cs.LG

AI总结 提出CoIRL-AD框架,通过解耦模仿学习与强化学习、利用潜在世界模型进行长时程奖励估计以及引入竞争机制,在离线训练中提升自动驾驶的鲁棒性,尤其在跨城市泛化和长尾场景中表现优异。

Comments 19 pages, 22 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22169 2026-07-21 cs.RO 版本更新 77%

VersualRL: Closed-Loop Verbal Reinforcement Learning with Visual Execution Feedback for Task-Level Robot Planning

闭环言语强化学习用于任务级机器人规划

Dmitrii Plotnikov, Iaroslav Kolomiets, Dmitrii Maliukov, Dmitrij Kosenkov, Daniia Zinniatullina, Artem Trandofilov, Georgii Gazaryan, Kirill Bogatikov, Timofei Kozlov, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出闭环言语强化学习框架,通过大语言模型与视觉语言模型交互,在符号规划层迭代优化行为树,实现可解释的任务级规划与执行不确定性下的自适应。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新 77%

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16861 2026-07-13 cs.RO cs.AI cs.LG 版本更新 75%

ReinforceGen: Hybrid Skill Policies with Automated Data Generation and Reinforcement Learning

ReinforceGen:具有自动数据生成和强化学习的混合技能策略

Zihan Zhou, Animesh Garg, Ajay Mandlekar, Caelan Garrett

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Georgia Institute of Technology(佐治亚理工学院) NVIDIA Research(NVIDIA研究)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对机器人长期操纵挑战,ReinforceGen系统结合任务分解、数据生成、模仿学习与运动规划形成初始方案,经强化学习微调,在Robosuite数据集基准测试中成功率达80%,消融研究显示微调使性能平均提升89%,实际评估也有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09138 2026-08-12 cs.RO cs.AI 版本更新 74%

SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning

SpeedTuning:用轻量强化学习加速策略执行

David D. Yuan, Tony Z. Zhao, Kaylee Burns, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(journal_ref)

AI总结 SpeedTuning是一种轻量强化学习框架,可预测动作最优执行速度,在无需额外数据采集的情况下,将机器人操作策略加速超2.4倍且保持足够成功率,适用于多种动态精确任务。

Comments 10 pages, 12 figures. This arXiv version includes an appendix with qualitative simulation rollouts and additional ablations. Published at ICRA 2025

Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA), pp. 1184-1192, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05172 2026-06-17 cs.RO cs.AI 版本更新 74%

When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning

当生活给你行为克隆,就做Q函数:从行为克隆中提取Q值用于机器人强化学习

Lakshita Dodeja, Ondrej Biza, Shivam Vats, Stephen Hart, Stefanie Tellex, Robin Walters, Karl Schmeckpeper, Thomas Weng

机构 * Rai-Inst

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 提出Q2RL算法,通过从行为克隆策略中提取Q函数并利用Q门控切换策略,实现高效的离线到在线强化学习,在机器人操作任务中达到100%成功率和3.75倍提升。

Comments Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏