arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4111 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4111 篇

2510.11103 2026-06-29 cs.RO cs.AI 版本更新 73%

A Primer on SO(3) Action Representations in Deep Reinforcement Learning

深度强化学习中SO(3)动作表示入门

Martin Schuck, Sherif Samy, Angela P. Schoellig

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对SO(3)动作表示在强化学习中的选择问题,系统评估了多种表示在PPO、SAC、TD3算法下的效果,发现切向量表示最可靠。

Comments Published at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03389 2026-06-23 cs.LG cs.AI 版本更新 73%

Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL

Chain-of-Goals 分层策略用于长视界离线目标条件强化学习

Jinwoo Choi, Sang-Hyun Lee, Seung-Woo Seo

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(首尔国立大学电气与计算机工程系) Department of Automotive Engineering, Ajou University, Gyeonggi-do, South Korea(全州大学汽车工程系)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出 Chain-of-Goals 分层策略 (CoGHP),通过自回归生成潜在子目标序列,利用 MLP-Mixer 统一架构建模层次决策,在长视界任务中优于离线基线方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09603 2026-06-23 cs.RO cs.LG 版本更新 73%

DataMIL: Selecting Data for Robot Imitation Learning with Datamodels

DataMIL: 使用数据模型为机器人模仿学习选择数据

Shivin Dass, Alaa Khaddaj, Logan Engstrom, Aleksander Madry, Andrew Ilyas, Roberto Martín-Martín

机构 * UT Austin(得克萨斯大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出DataMIL框架,基于数据模型端到端选择对任务性能提升最大的数据点,避免基于人类质量标准的过滤,通过替代损失函数避免环境交互,在60+模拟和真实操作任务中验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15514 2026-06-16 cs.RO cs.LG 新提交 73%

Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities

强化学习引导的软融合检索用于缺失模态下的鲁棒多模态模仿学习

Hassan Ismkhan, Hamid Bouchahcia

机构 * Bournemouth University(伯恩茅斯大学)

专题命中 模仿学习与强化学习 :robotic(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 提出RL4IL方法,利用强化学习策略从训练库中检索最相关专家演示,并通过软交叉注意力融合生成动作,有效处理传感器缺失问题,在LIBERO基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21570 2026-06-12 cs.AI cs.RO 版本更新 73%

From Digital to Physical: Digital Agents as Autonomous Coaches for Physical Intelligence

从数字到物理:数字代理作为物理智能的自主教练

Zixing Lei, Genjia Liu, Yuanshuo Zhang, Qipeng Liu, Yuzhu Cai, Sixiang Chen, Jixian Wu, Yunhong Wang, Weixin Li, Chuan Wen, Bo Zhao, Shanghang Zhang, Wenzhao Lian, Siheng Chen

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院) School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 模仿学习与强化学习 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出EmboCoach-Bench基准,评估LLM代理自主设计具身策略的能力,通过迭代调试和优化,代理在平均成功率上超越人工基线26.5%,并具备自我修正能力。

Comments 53 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12372 2026-06-11 cs.RO cs.LG 新提交 73%

UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning

UniIntervene:用于高效现实世界强化学习的智能干预

Haoyuan Deng, Yitong Gao, Yudong Lin, Haichao Liu, Zhenyu Wu, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出UniIntervene智能干预模型,通过检测低效探索并自主恢复策略至高价值状态,在真实机器人操作任务中平均成功率提升8.6%,人类干预减少57%。

Comments Project page: https://denghaoyuan123.github.io/UniIntervene-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12334 2026-06-11 cs.LG cs.RO 新提交 73%

Fourier Features Let Agents Learn High Precision Policies with Imitation Learning

傅里叶特征让智能体通过模仿学习学习高精度策略

Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling, Enrico Krohmer, Nicolas Schreiber, Xiaogang Jia, Niklas Freymuth, Gerhard Neumann

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出在点云编码器中使用傅里叶特征映射,解决神经网络低频偏好导致的高精度操作问题,在多个基准和真实机器人上显著提升性能。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08610 2026-06-09 cs.RO cs.AI 新提交 73%

HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning

HARBOR:面向智能体机器人强化学习的框架

Zechu Li, Yufeng Jin, Xiaoyang Liu, Puze Liu, Vignesh Prasad, Carlo D'Eramo, Georgia Chalvatzaki

机构 * TU Darmstadt(达姆施塔特工业大学) Honda Research Institute Europe(本田欧洲研究所) Columbia University(哥伦比亚大学) Tongji University(同济大学) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) University of Würzburg(维尔茨堡大学) Hessian.AI(黑森人工智能中心)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出HARBOR框架,通过将机器人强化学习自动化视为框架工程问题,利用专用智能体、标准化命令和可复用知识,在模拟中自动完成从环境搭建到策略训练的全流程,并在6个基准测试和16个任务中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08513 2026-06-09 cs.RO cs.LG cs.SY eess.SY 新提交 73%

Towards End to End Motion Planning and Execution for Autonomous Underwater Vehicles Using Reinforcement Learning

面向自主水下机器人的端到端运动规划与执行:基于强化学习的方法

Elisei Shafer, Oren Gal

机构 * University of Haifa(海法大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出分层强化学习架构,将原始传感器数据直接映射为推进器指令,实现AUV端到端运动规划与执行,在HoloOcean仿真中轨迹长度接近RRT*基线(误差4%-6%),并具备鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 73%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :embodied agent(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17551 2026-06-01 cs.LG cs.AI 73%

SVL: Goal-Conditioned Reinforcement Learning as Survival Learning

SVL:目标条件强化学习作为生存学习

Franki Nguimatsia Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure, PSL Research University, Paris, France(巴黎高等师范学院,PSL研究大学)

专题命中 模仿学习与强化学习 :robotics(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出生存价值学习(SVL),通过将时间到目标建模为概率分布,将目标条件强化学习重构为生存学习问题,并利用危险模型进行最大似然估计,在离线基准上匹配或超越强基线方法。

Comments Accepted to the 43rd International Conference on Machine Learning, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01663 2026-05-29 cs.LG cs.RO 73%

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

基于流锚定噪声条件Q学习的离线强化学习:高效且表达力强的方法

Sungyoung Lee, Dohyeong Kim, Eshan Balachandar, Zelal Su Mustafaoglu, Keshav Pingali

机构 * The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Independent Researcher, Seoul, South Korea(首尔独立研究者)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出FAN算法,通过单次流策略迭代和单高斯噪声样本实现高效离线强化学习,在保持高性能的同时显著降低计算成本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28730 2026-05-27 cs.RO cs.CL cs.CV 73%

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

SOLE-R1:视频语言推理作为机器人强化学习的唯一奖励

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

机构 * MIT(麻省理工学院) RAI Institute(机器人智能研究所)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出SOLE-R1模型,通过视频语言时空推理生成密集任务进度估计作为唯一奖励信号,实现在无真实奖励、演示或任务特定调优下的零样本在线强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25477 2026-05-26 cs.RO cs.AI 73%

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调

Perry Dong, Kuo-Han Hung, Tian Gao, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21429 2026-05-21 cs.RO cs.LG 73%

roto 2.0: The Robot Tactile Olympiad

roto 2.0:机器人触觉奥林匹克

Elle Miller, Jayaram Reddy, Ayush Deshmukh, Trevor McInroe, David Abel, Oisin Mac Aodha, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出roto 2.0,一个基于触觉的强化学习基准,旨在通过四种不同的机器人形态(16-DOF到24-DOF)标准化触觉强化学习,专注于端到端的'盲'操作,仅使用本体感觉和触觉传感,不使用状态信息或蒸馏。研究展示了显著的性能提升,盲控代理在10秒内完成13次保定球旋转,比当前最先进的速度快了一个数量级。通过开源环境和经过充分调优的基线,降低了进入门槛,使研究人员能够优先考虑基本算法挑战而非繁琐的强化学习调优。

Comments Accepted to 7th ViTac Workshop, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15769 2026-05-18 cs.RO cs.AI 73%

Lamarckian Inheritance in Dynamic Environments: How Key Variables Affect Evolutionary Dynamics

动态环境中的拉马克继承:关键变量如何影响进化动态

K. Ege de Bruin, Kyrre Glette, Kai Olav Ellefsen

机构 * Department of Informatics, University of Oslo, Norway(奥斯陆大学信息学院) RITMO, University of Oslo, Norway(奥斯陆大学RITMO)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究动态环境中关键变量对进化动态的影响,通过虚拟软机器人和两种学习方法,发现拉马克继承在环境变化冲突且不可预测时表现欠佳,但添加环境感知传感器可恢复其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19128 2026-05-18 cs.LG cs.AI 73%

Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach

在强化学习中塑造稀疏奖励:一种半监督方法

Wenyun Li, Wenjie Huang, Chen Sun

机构 * Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系) Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系) Musketeers Foundation Institute of Data Science, HKU(穆斯克特基金会数据科学研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种半监督方法,通过利用非零奖励转移和数据增强学习轨迹空间表示,提升稀疏奖励下的奖励塑造效果,在Atari和机器人操控任务中优于监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11387 2026-05-13 cs.LG cs.RO 73%

Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies

多模态生成策略细调中的行为模式发现

Alberta Longhini, David Emukpere, Jean-Michel Renders, Seungsu Kim

机构 * Naver Labs Europe(纳维尔实验室欧洲分部) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种无监督的行为模式发现框架,用于在强化学习细调多模态生成策略时保持行为多样性,通过互信息作为内在奖励提升任务成功率。

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25898 2026-04-29 cs.LG cs.AI 73%

TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning

TSN-Affinity:基于相似性的参数复用用于连续离线强化学习

Dominik Żurek, Kamil Faber, Marcin Pietron, Paweł Gajewski, Roberto Corizzo

机构 * AGH University of Krakow(克拉科夫AGH大学) American University(美国美国大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TSN-Affinity方法,通过基于TinySubNetworks和Decision Transformer的策略,实现任务特定参数化和受控知识共享,提升连续离线强化学习中的多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20627 2026-04-23 cs.LG cs.RO 73%

Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

占用奖励塑造:改进离线目标导向强化学习中的信用分配

Aravind Venugopal, Jiayu Chen, Xudong Wu, Chongyi Zheng, Benjamin Eysenbach, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) INFIFORCE Intelligent Technology(INFIFORCE智能技术) Princeton University(普林斯顿大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出占用奖励塑造方法,通过提取世界模型中的时间信息,改进稀疏奖励下的信用分配问题,在13种长周期运动和操作任务中提升了2.2倍性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10677 2026-04-14 cs.RO cs.CV 73%

LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment

LIDEA:通过隐式特征蒸馏和显式几何对齐的人机模仿学习

Yifu Xu, Bokai Lin, Xinyu Zhan, Hongjie Fang, Yong-Lu Li, Cewu Lu, Lixin Yang

专题命中 模仿学习与强化学习 :robot learning(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 LIDEA通过隐式特征蒸馏和显式几何对齐,解决人机交互中的表征对齐问题,提升机器人学习效率和域外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14811 2026-03-17 cs.RO cs.CV 73%

Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning

从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理

Heng Zhou, Li Kang, Yiran Qin, Xiufeng Song, Ao Yu, Zilu Zhang, Haoming Song, Kaixin Xu, Yuchen Fan, Dongzhan Zhou, Xiaohong Liu, Ruimao Zhang, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13925 2026-03-17 cs.RO cs.AI 73%

SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization

SmoothVLA: 通过内在平滑性优化对齐视觉-语言-动作模型与物理约束

Jiashun Li, Xiaoyu Shi, Hong Xie, Mingsheng Shang, Yun Lu

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 SmoothVLA通过内在平滑性优化对齐视觉-语言-动作模型与物理约束,结合物理指导的混合奖励函数和GRPO方法,提升轨迹平滑度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08269 2026-03-10 cs.RO cs.AI 73%

SAIL: Test-Time Scaling for In-Context Imitation Learning with VLM

SAIL:基于VLM的上下文模仿学习的测试时扩展

Makoto Sato, Yusuke Iwasawa, Yujin Tang, So Kuroki

机构 * The University of Tokyo(东京大学) Sakana AI

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 SAIL通过测试时扩展提升上下文模仿学习的鲁棒性和通用性,利用蒙特卡洛树搜索和视觉语言模型实现轨迹优化。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07784 2026-03-10 cs.LG cs.AI 73%

ProgAgent:A Continual RL Agent with Progress-Aware Rewards

ProgAgent:一种具有进度感知奖励的持续强化学习代理

Jinzhou Tan, Gabriel Adineera, Jinoh Kim

机构 * University of California, San Diego(加州大学圣地亚哥分校) Texas A\&M University-Commerce(德克萨斯A&M大学-科摩斯)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 ProgAgent通过进度感知奖励机制,结合PPO与coreset回放和突触智能,有效解决持续学习中的遗忘问题,提升学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13810 2026-03-10 cs.LG cs.AI 73%

Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation

具有瞬时速度约束的一步动作生成均流策略

Guojian Zhan, Letian Tao, Pengcheng Wang, Yixiao Wang, Yiheng Li, Yuxin Chen, Hongyang Li, Masayoshi Tomizuka, Shengbo Eben Li

机构 * School of Vehicle and Mobility & College of AI, Tsinghua University(车辆与移动学院及人工智能学院,清华大学) Berkeley AI Research (BAIR), UC Berkeley(伯克利人工智能研究(BAIR),加州大学伯克利分校) The University of Hong Kong(香港大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出均速度策略(MVP),通过引入瞬时速度约束来提升动作生成效率,实现高效的一步动作生成并在机器人操作任务中取得最佳性能。

Comments ICLR Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17100 2026-03-06 cs.LG cs.AI 73%

Generative Models in Decision Making: A Survey

生成模型在决策中的应用:综述

Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Zhitang Chen, Jun Wang, Jianye Hao, Xiu Li, Yinchuan Li

专题命中 模仿学习与强化学习 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。

Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12046 2026-03-03 cs.LG cs.RO cs.SY eess.SY stat.ML 73%

Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning

基于Eikonal约束的分层准度量强化学习的目标达成

Vittorio Giammarino, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于Eikonal约束的分层准度量强化学习框架,通过连续时间改写和分层分解,提升目标条件导航和操作任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01107 2026-03-03 cs.RO cs.LG 73%

SLAP: Shortcut Learning for Abstract Planning

SLAP:抽象规划的快捷学习

Y. Isabel Liu, Bowen Li, Benjamin Eysenbach, Tom Silver

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 SLAP通过快捷学习方法自动发现抽象规划中的新选项,提升任务成功率和规划效率。

Comments Published at the International Conference on Learning Representations (ICLR) 2026. Code available at https://github.com/isabelliu0/SLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20517 2026-02-25 cs.AI cs.CL cs.LG 73%

Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination

内部言语作为行为引导:为人类-人工智能协调的可操控模仿

Rakshit Trivedi, Kartik Sharma, David C Parkes

机构 * Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 MIMIC通过语言作为内部表示,利用视觉语言模型和扩散策略实现人类-人工智能协调中的行为引导与多样化的模仿控制。

Comments Spotlight paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏