arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-21 至 2026-07-21 共收录 14 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 14 篇

2607.16204 2026-07-21 cs.AI cs.LG 新提交 81%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22169 2026-07-21 cs.RO 版本更新 77%

VersualRL: Closed-Loop Verbal Reinforcement Learning with Visual Execution Feedback for Task-Level Robot Planning

闭环言语强化学习用于任务级机器人规划

Dmitrii Plotnikov, Iaroslav Kolomiets, Dmitrii Maliukov, Dmitrij Kosenkov, Daniia Zinniatullina, Artem Trandofilov, Georgii Gazaryan, Kirill Bogatikov, Timofei Kozlov, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出闭环言语强化学习框架,通过大语言模型与视觉语言模型交互,在符号规划层迭代优化行为树,实现可解释的任务级规划与执行不确定性下的自适应。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17760 2026-07-21 cs.LG cs.AI cs.RO 新提交 75%

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

泛化与引导:用于少样本逆强化学习的奖励分解

Ziyi Liu, Grace Zhang

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究少样本逆强化学习(FM - IRL)问题,提出多任务判别器近邻引导的IRL(MPG)方法,通过学习两个互补奖励组件,在多种有显著变化的任务上验证有效性,平均成功率达81.2%,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07530 2026-07-21 cs.RO 版本更新 70%

ICLR: In-Context Imitation Learning with Visual Reasoning

ICLR: 基于视觉推理的上下文模仿学习

Toan Nguyen, Weiduo Yuan, Songlin Wei, Hui Li, Daniel Seita, Yue Wang

机构 * University of Southern California(南加州大学) Autodesk Research(Autodesk研究)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ICLR通过结合视觉推理与上下文模仿学习,提升机器人在复杂任务中的适应性和泛化能力。

Comments Accepted to IROS 2026. Project website: https://toannguyen1904.github.io/ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新 62%

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07032 2026-07-21 cs.LG cs.AI 版本更新 62%

A Systematic Investigation of RL-Jailbreaking in LLMs

LLMs中RL越狱的系统性研究

Montaser Mohammedalamen, Kevin Roice, Reginald McLean, Alyssa Lefaivre Škopac

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统分解RL越狱框架,通过分析奖励函数、动作空间、回合长度等环境形式化因素和算法措施,发现密集奖励和延长回合长度是越狱成功的主要驱动因素,并提供了提升RL越狱效率及强化模型防御的工具。

Comments Warning: This paper may contain unfiltered and potentially offensive jailbreaking examples. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17981 2026-07-21 cs.LG 新提交 57%

Information-Based Exploration via Random Features for Reinforcement Learning

基于随机特征的强化学习信息探索

Waris Radji, Odalric-Ambrym Maillard

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究如何在强化学习中进行信息探索,提出基于贝叶斯核方法理论的随机特征信息增益(RFIG),用随机傅里叶特征近似信息增益,给出误差界并避免黑箱问题,实践细节使其可扩展到深度RL场景,实验显示其性能有竞争力且理论解释优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17560 2026-07-21 cs.AI 新提交 57%

Reinforcement Learning: From Algorithms To Foundation Models

强化学习:从算法到基础模型

Zihan Ding

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。

Comments Princeton University PhD Thesis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17479 2026-07-21 cs.CV 新提交 57%

TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning

TraversRL:基于强化学习的可通行行人路径生成

Bin Han, Robert Wolfe, Bill Howe

机构 * University of Washington(华盛顿大学) Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 研究旨在从航拍图像生成行人路径,核心方法是用TraversRL视觉条件模型,通过特定动作空间和奖励机制迭代生长路径网络,主要贡献是相比基线提升交并比与连通性指标,结合奖励生成更优网络,证明该建模方法的有效性。

Comments Accepted to ECCV 2026, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17038 2026-07-21 cs.AI 新提交 57%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16421 2026-07-21 cs.AI 新提交 57%

When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

何时进行规划:学习在反应式控制和审慎规划之间进行选择

Adam Labiosa, Josiah P. Hanna

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 研究智能体如何学习元推理能力,引入基于反应式策略不确定性得分分配计算的强化学习方法训练元推理策略,通过实证研究表明该设计能让元推理策略学会何时采用反应式策略,何时进行决策时规划,且能随反应式策略改进转向完全反应式控制。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18447 2026-07-21 cs.LG 版本更新 57%

Supervised Reward Inference

监督奖励推理

Will Schwarzer, Jordan Schneider, Philip S. Thomas, Scott Niekum

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 研究人类通过多样行为表明目标时的奖励推理问题,提出监督奖励推理(SRI)方法,证明其理论上渐近贝叶斯最优,实证上在相关基准和机器人任务中表现出色,还展示了框架对动作和目标预测的通用性。

Comments 35 pages, 8 figures. Updated with public code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.00990 2026-07-21 cs.LG 版本更新 57%

Hierarchical Reinforcement Learning for Air Combat at DARPA's AlphaDogfight Trials

在DARPA的AlphaDogfight试验中用于空战的分层强化学习

Adrian P. Pope, Jaime S. Ide, Daria Micovic, Henry Diaz, David Rosenbluth, Lee Ritholtz, Jason C. Twedt, Thayne T. Walker, Kevin Alcedo, Daniel Javorsek

机构 * Primordial Labs Lockheed Martin Artificial Intelligence Center, Applied AI Team(洛克希德·马丁人工智能中心,应用人工智能团队) United States Air Force(美国空军)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 针对高维连续控制难题,在DARPA的AlphaDogfight试验中,采用由高级策略选择器和低级策略组成的分层深度强化学习方法,整合专家知识训练,超越人类专家飞行员,获ADT锦标赛第二名。

Comments 15 pages (main text) + 4 pages (supplementary material), 13 figures. This work has been accepted for publication in IEEE Transactions on Artificial Intelligence (IEEE-TAI). This replaces the previous conference-version presented at the 2021 International Conference on Unmanned Aircraft System (ICUAS 21), June 15-18, 2021, Athens, Greece

Journal ref IEEE Transactions on Artificial Intelligence (IEEE-TAI), vol. 4, no. 6, pp. 1371-1385, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17635 2026-07-21 eess.SY cs.SY 新提交 50%

On Optimal Event-Triggered Distributed Control for Stochastic Multi-Agent Systems via Reinforcement Learning

基于强化学习的随机多智能体系统最优事件触发分布式控制

Ziming Wang, Bingbing Li, Karl H. Johansson, Apostolos I. Rikos

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对含随机不确定性的多智能体系统,提出基于强化学习的最优分布式控制算法,采用 actor-critic-identifier 结构,用低通滤波器和混合事件触发控制策略,经稳定性证明,在仿真中验证正确性并与非最优算法比较突出优势。

详情

展开后加载摘要…

URL PDF HTML 收藏