arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4113 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4113 篇

2605.22748 2026-06-19 cs.RO cs.AI cs.LG cs.MA 版本更新 67%

Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning

通过多智能体强化学习实现超人类安全且敏捷的赛车

Ismail Geles, Leonard Bauersfeld, Markus Wulfmeier, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人与感知组) Google DeepMind(谷歌DeepMind) Nomagic

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出通过多智能体强化学习在高速四旋翼赛车中实现安全且敏捷的性能,展示了多智能体交互对真实世界交互安全性的关键作用,同时在高速赛车中超越人类飞行员并减少碰撞率。

Comments 12 pages (+4 supplementary). Website: https://rpg.ifi.uzh.ch/marl

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16515 2026-06-16 cs.LG cs.AI cs.RO 新提交 67%

Direction-Conditioned Policies via Compositional Subgoal Scoring for Online Goal-Conditioned Reinforcement Learning

基于组合子目标评分的方向条件策略用于在线目标条件强化学习

Swaminathan S K, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan, Aritra Hazra

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur(计算机科学与工程系,印度理工学院Kharagpur分校) Department of Mechanical Engineering, Indian Institute of Technology Kharagpur(机械工程系,印度理工学院Kharagpur分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出方向条件策略(DCP),通过共享InfoNCE表示将目标达成分解为子目标评分和方向条件动作,理论证明方向充分性、训练与部署一致性及可控子空间失效条件,在九个环境中优于对比RL。

Comments 17 pages, Accepted to the 2nd Workshop on Compositional Learning at ICML 2026 (Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14801 2026-06-16 cs.LG cs.AI cs.RO 新提交 67%

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

QPILOTS:面向流策略的高效测试时Q引导

Yifan Ruan, Chenyang Cao, Andreas Burger, Ali Pesaranghader, Kaveh Kamali, Jaehong Kim, Nandita Vijaykumar, Alan Aspuru-Guzik, Igor Gilitschenski, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) LG Electronics(LG电子)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出QPILOTS方法,在推理时通过投影去噪中间状态到最终动作估计并计算评论家梯度来引导流匹配和扩散策略,无需修改原策略,在离线到在线RL基准上达到90%平均成功率。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14418 2026-06-15 cs.AI cs.LG cs.RO 新提交 67%

Causal Object-Centric Models for Planning with Monte Carlo Tree Search

用于蒙特卡洛树搜索规划的因果对象中心模型

Rodion Vakhitov, Leonid Ugadiarov, Alexey Skrynnik, Aleksandr Panov

机构 * MIRAI CogAILab

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出COMET算法,结合无监督对象中心编码器和Transformer世界模型,通过动作-槽融合机制和对象因果注意力实现高效规划,在多个基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09559 2026-06-09 cs.LG cs.AI cs.CR cs.RO 新提交 67%

Safe-RULE: Safe Reinforcement UnLEarning

Safe-RULE:安全强化反学习

Shixiong Jiang, Taozheng Zhu, Fanxin Kong

机构 * University of Notre Dame(圣母大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对离线安全强化学习易受数据投毒攻击的问题,提出Safe-RULE框架,通过反学习移除恶意样本影响,无需从头训练或访问原始环境,实验证明能有效提升安全性。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.08705 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

A General Framework for Structured Learning of Mechanical Systems

结构机械系统学习的通用框架

Jayesh K. Gupta, Kunal Menda, Zachary Manchester, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种通用框架,用于结构化学习机械系统,通过结合先验知识和训练表达式近似器来提高模型的准确性和效率。

Comments 10 pages, 7 figures. First two authors contributed equally. Submitted to IROS/RA-L. Code at https://github.com/sisl/mechamodlearn/

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.11706 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY stat.ML 67%

Supervised Policy Update for Deep Reinforcement Learning

深度强化学习中的监督策略更新

Quan Vuong, Yiming Zhang, Keith W. Ross

机构 * University of California, San Diego(加州大学圣地亚哥分校) New York University(纽约大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种新的样本效率高的方法,称为监督策略更新(SPU),用于深度强化学习。该方法通过当前策略生成的数据,在非参数化的近端策略空间中构建并求解一个约束优化问题,然后利用监督回归将最优的非参数化策略转换为参数化策略,从而生成新的样本。该方法适用于离散和连续动作空间,并能处理多种接近约束。本文展示了如何通过该方法解决自然策略梯度和信任区域策略优化(NPG/TRPO)以及近端策略优化(PPO)问题。SPU的实现比TRPO更简单,在样本效率方面,实验表明SPU在Mujoco模拟机器人任务中优于TRPO,在Atari视频游戏任务中优于PPO。

Comments Accepted as a conference paper at ICLR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.00748 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY 67%

Continuous Deep Q-Learning with Model-based Acceleration

基于模型的连续深度Q学习加速

Shixiang Gu, Timothy Lillicrap, Ilya Sutskever, Sergey Levine

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出连续深度Q学习算法NAF及基于模型的加速方法,用于提升连续控制任务的样本效率和学习速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.02312 2026-06-04 cs.AI cs.LG cs.RO cs.SY eess.SY 67%

A Framework for Constrained and Adaptive Behavior-Based Agents

一种用于约束和自适应行为基 agent 的框架

Renato de Pontes Pereira, Paulo Martins Engel

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种框架,通过强化学习节点整合到行为树中,解决约束 agent 的学习能力问题,并展示其与分层强化学习选项的关系,确保嵌套学习节点的收敛性。

Comments 2015; 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22138 2026-05-22 cs.AI cs.CL cs.LG cs.RO 67%

Efficient Agentic Reasoning Through Self-Regulated Simulative Planning

通过自我调节模拟规划实现高效的代理推理

Mingkai Deng, Jinyu Hou, Lara Sá Neves, Varad Pimpalkhute, Taylor W. Killian, Zhengzhong Liu, Eric P. Xing

机构 * Institute of Foundation Models (IFM)(基础模型研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出通过分解决策过程为三个系统:模拟推理、自我调节和反应执行,来提升代理推理的效率,并展示了SR$^2$AM模型在不同任务中的表现。

Comments Code and model artifacts are available at https://github.com/sailing-lab/sr2am

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26627 2026-05-21 cs.AI cs.LG cs.RO 67%

TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance

TimeRewarder: 通过帧间时间距离从被动视频中学习密集奖励

Yuyang Liu, Chuan Wen, Yihang Hu, Dinesh Jayaraman, Yang Gao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出TimeRewarder方法,通过帧间时间距离从被动视频中学习密集奖励,以提升强化学习在稀疏奖励任务中的性能,实验表明其在多个任务中显著提高了成功率和样本效率。

Comments ICML 2026 spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19469 2026-05-20 cs.LG cs.AI cs.RO 67%

Sampling-Based Safe Reinforcement Learning

基于采样的安全强化学习

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种基于采样的安全强化学习方法,通过在有限的动力学样本集上联合施加约束,确保学习过程中的安全性,并在连续域中提供实用的安全保证,同时通过限制认知不确定性实现了高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07969 2026-05-12 cs.LG cs.AI cs.RO stat.ML 67%

Reinforcement Learning with Action Chunking

基于动作分块的强化学习

Qiyang Li, Zhiyuan Zhou, Sergey Levine

机构 * UC Berkeley(伯克利大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出Q-chunking方法,通过动作分块技术提升长周期稀疏奖励任务的强化学习效率,实现离线到在线学习的样本效率优化。

Comments The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025); 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09096 2026-05-12 cs.RO cs.AI cs.LG 67%

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators

当机器人比人类更强大时:从受限演示中学习

Xinhu Li, Ayush Jain, Zhaojing Yang, Yigit Korkmaz, Erdem Bıyık

机构 * Thomas Lord Department of Computer Science, University of Southern California(汤姆·劳德计算机科学系,南加州大学) Meta AI Department of Computer Science & Engineering, University of California San Diego(计算机科学与工程系,加州大学圣地亚哥分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文探讨机器人能否超越受限专家的演示学习,通过探索更高效轨迹和自定义奖励信号,提升学习效率和任务完成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06761 2026-05-11 cs.AI cs.CV cs.LG 67%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18161 2026-04-21 cs.LG cs.AI cs.RO 67%

Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?

可微模拟器能否提供更好的策略梯度?

Ku Onoda, Paavo Parmas, Manato Yaguchi, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文探讨可微模拟器在策略梯度方法中的有效性,提出DDCG和IVW-H两种方法,通过切换估计器和控制方差提升鲁棒性与样本效率。

Comments ICLR2026

Journal ref The Fourteenth International Conference on Learning Representations. ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16683 2026-04-21 cs.RO cs.AI cs.CV 67%

Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning

Rewind-IL:在线故障检测与状态重置用于模仿学习

Gehan Zheng, Sanjay Seenivasan, Matthew Johnson-Roberson, Weiming Zhi

机构 * College of Connected Computing, Vanderbilt University(范德比尔特大学连接计算学院) School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney(悉尼大学机器人研究中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 Rewind-IL通过零样本故障检测和状态重置机制,提升模仿学习在长时域任务中的可靠性,解决执行漂移问题。

Comments 9 pages, 8 figures, 6 tables. Project page at https://sjay05.github.io/rewind-il

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15679 2026-04-20 cs.LG cs.AI cs.CV 67%

Hierarchical Active Inference using Successor Representations

基于成功表示的分层主动推断

Prashant Rangarajan, Rajesh P. N. Rao

机构 * Paul G. Allen Center for Computer Science and Engineering, University of Washington(保罗·G·阿伦计算机科学与工程中心,华盛顿大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出基于分层主动推断的行动规划模型,结合环境层次模型与成功表示实现高效规划,展示了如何通过低层表示学习高层抽象状态,并在多个规划和强化学习任务中验证了方法有效性。

Comments Accepted for publication in Neural Computation (MIT Press). 82 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06540 2026-04-14 eess.SY cs.AI cs.LG cs.RO cs.SY math.OC 67%

Self-Organizing Dual-Buffer Adaptive Clustering Experience Replay (SODACER) for Safe Reinforcement Learning in Optimal Control

自组织双缓冲自适应聚类经验回放(SODACER)用于最优控制中的安全强化学习

Roya Khalili Amirabadi, Mohsen Jalaeian Farimani, Omid Solaymani Fard

机构 * Department of Applied Mathematics, Ferdowsi University of Mashhad(菲尔多西大学应用数学系) Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano(米兰理工大学电子、信息与生物工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出SODACER框架,结合自组织自适应聚类机制与控制屏障函数,实现非线性系统的安全高效控制,通过Sophia优化器提升收敛性和稳定性,验证了其在非线性HPV传播模型中的有效性。

Comments Published in Nature Scientific Reports (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22292 2026-04-01 cs.LG cs.AI cs.RO 67%

Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning

超越硬约束:用于安全离线强化学习的预算条件可达性

Janaka Chathuranga Brahmanage, Akshat Kumar

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种预算条件可达性方法,用于安全离线强化学习,通过解耦奖励最大化与累积安全成本约束,实现安全策略学习。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17319 2026-03-19 cs.AI cs.LG cs.RO 67%

Physics-informed offline reinforcement learning eliminates catastrophic fuel waste in maritime routing

物理引导的离线强化学习消除海上航线中的灾难性燃油浪费

Aniruddha Bora, Julie Chalfant, Chryssostomos Chryssostomidis

机构 * MIT Sea Grant College Program(麻省理工学院海事研究生院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出PIER框架,通过物理校准的环境学习高效安全的航线策略,减少燃油消耗和碳排放,消除灾难性燃油浪费,适用于多种导航场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15388 2026-03-17 cs.LG cs.AI cs.RO stat.ML 67%

Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization

通过Stackelberg近端策略优化实现高效的形态-控制协同设计

Yanning Dai, Yuhui Wang, Dylan R. Ashley, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, King Abdullah University of Science and Technology (KAUST)(生成人工智能卓越中心,卡奥斯特大学) Dalle Molle Institute for Artificial Intelligence Research (IDSIA)(人工智能研究达勒莫利研究所) Università della Svizzera italiana (USI)(瑞士意大利大学) Scuola universitaria professionale della Svizzera italiana (SUPSI)(瑞士意大利专业大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出Stackelberg PPO方法,通过将形态与控制的内在耦合建模为Stackelberg博弈变体,解决形态与控制策略的协同优化问题,提升机器人设计效率。

Comments presented at the Fourteenth International Conference on Learning Representations; 11 pages in main text + 3 pages of references + 23 pages of appendices, 5 figures in main text + 11 figures in appendices, 16 tables in appendices; accompanying website available at https://yanningdai.github.io/stackelberg-ppo-co-design/ ; source code available at https://github.com/YanningDai/StackelbergPPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09378 2026-03-12 cs.LG cs.AI cs.RO 67%

SPAARS: Safer RL Policy Alignment through Abstract Exploration and Refined Exploitation of Action Space

通过抽象探索和动作空间精细化利用实现更安全的强化学习策略对齐

Swaminathan S K, Aritra Hazra

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 SPAARS通过抽象探索和动作空间精细化利用,提升强化学习策略对齐的安全性与效率

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05621 2026-03-12 cs.RO cs.AI cs.CL cs.LG cs.MA 67%

RACAS: Controlling Diverse Robots With a Single Agentic System

RACAS:通过单一代理系统控制多样化机器人

Dylan R. Ashley, Jan Przepióra, Yimeng Chen, Ali Abualsaud, Nurzhan Yesmagambet, Shinkyu Park, Eric Feron, Jürgen Schmidhuber

机构 * Center of Excellence in Generative AI, King Abdullah University of Science and Technology (KAUST), Saudi Arabia(沙特王国科学与技术大学生成人工智能卓越中心) Dalle Molle Institute for Artificial Intelligence Research (IDSIA), Switzerland(人工智能研究达勒莫利 institute) Università della Svizzera italiana (USI), Switzerland(瑞士意大利大学) Scuola universitaria professionale della Svizzera italiana (SUPSI), Switzerland(瑞士意大利专业大学) Robotics, Intelligent Systems, and Control Lab, King Abdullah University of Science and Technology (KAUST), Saudi Arabia(机器人、智能系统与控制实验室,沙特王国科学与技术大学(KAUST)) Department of Process Control, AGH University of Krakow, Poland(波兰克拉科夫AGH大学过程控制系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 RACAS通过单一代理系统实现跨平台机器人控制,无需修改代码或模型,有效降低机器人原型开发难度。

Comments 7 pages in main text + 1 page of appendices + 1 page of references, 5 figures in main text + 1 figure in appendices, 2 tables in main text; source code available at https://github.com/janprz11/robot-agnostic-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18140 2026-03-06 cs.RO cs.CV cs.LG 67%

Observer-Actor: Active Vision Imitation Learning with Sparse-View Gaussian Splatting

观察者-执行者:基于稀疏视角高斯点云的主动视觉模仿学习

Yilong Wang, Cheng Qian, Ruomeng Fan, Edward Johns

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 ObAct通过主动视觉探索提升双臂机器人模仿学习的鲁棒性,利用稀疏视角高斯点云增强观测清晰度,实验显示其在无遮挡和有遮挡情况下均显著优于固定相机设置。

Comments Accepted at ICRA 2026. Project Webpage: https://obact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01741 2026-03-04 cs.LG cs.AI cs.RO 67%

Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning

重新思考大规模强化学习中集成策略梯度中的策略多样性

Naoki Shitanda, Motoki Omura, Tatsuya Harada, Takayuki Osa

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出耦合策略优化方法,通过KL约束调节策略多样性,提升大规模强化学习中的探索效率和学习性能。

Comments In ICLR 2026. Website at https://naoki04.github.io/paper-cpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG 67%

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01292 2026-03-03 cs.LG cs.AI cs.LO cs.RO 67%

Integrating LTL Constraints into PPO for Safe Reinforcement Learning

将LTL约束整合到PPO中以实现安全强化学习

Maifang Zhang, Hang Yu, Qian Zuo, Cheng Wang, Vaishak Belle, Fengxiang He

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) School of Computer Science, Faculty of Engineering, University of Sydney(计算机科学学院,工程学院,悉尼大学) School of Engineering and Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞-瓦德大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出PPO-LTL框架,通过整合LTL约束提升强化学习的安全性,实验表明其在安全性和性能上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19698 2026-02-25 cs.LG cs.AI cs.RO 67%

Performance Asymmetry in Model-Based Reinforcement Learning

基于模型的强化学习中的性能不对称性

Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) National University of Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出JEDI世界模型,通过解决基于模型的强化学习中的性能不对称问题,在Human-Optimal任务和Breakout上取得最优成绩,同时提升计算效率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05346 2026-02-10 cs.AI cs.LG cs.RO 67%

Knowledge-Centric Metacognitive Learning

以知识为中心的元认知学习

Arun Kumar, Paul Schrater

机构 * Dept. of Computer Science University of Minnesota, Twin Cities(计算机科学系明尼苏达大学双城分校) Depts. of Computer Science and Psychology University of Minnesota, Twin Cities(计算机科学与心理学系明尼苏达大学双城分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种以知识为中心的元认知学习框架,通过自然抽象、知识引导交互和交互组合来提升人工智能系统的智能和适应性行为能力。

详情

展开后加载摘要…

URL PDF HTML 收藏