arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4115 篇

2605.08757 2026-07-28 cs.RO 版本更新 57%

A Visuo-Tactile Data Collection System with Haptic Feedback for Coarse-to-Fine Imitation Learning

一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习

Yeseung Kim, Nayoung Oh, Jun Park, Teetat Thamronglak, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20834 2026-07-24 cs.LG 新提交 57%

Offline RL with Hierarchical Action Chunking

基于分层动作分块的离线强化学习

Ahad Jawaid

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究离线目标条件强化学习中扩展到长期任务的挑战,提出HiQC算法,结合高级潜在规划与低级动作分块,实现无偏k步价值备份,理论证明其价值误差界限更紧,实证表明在OGBench套件中性能最佳。

Comments RLC/RLJ 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19628 2026-07-23 cs.LG 新提交 57%

HypEMBER: Hypernetwork-based Ensemble for Robust Policy Learning of Parametrized Dynamical Systems

HypEMBER:基于超网络的集成方法用于参数化动态系统的稳健策略学习

Nicolò Botteghi, Gabriele Pascali, Urban Fasel, Andrea Manzoni

机构 * MOX, Department of Mathematics Politecnico di Milano(米兰理工大学数学MOX系) Department of Aeronautics Imperial College London(伦敦帝国理工学院航空系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究在测量和模型不确定下参数化动态系统的稳健控制,提出基于超网络与集成学习结合的HypEMBER框架,通过超网络表示策略和价值函数实现参数泛化,用逼近器集成量化不确定性,实验表明该框架能提升训练稳定性等,增强对不确定性的稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19232 2026-07-22 cs.LG cs.MA 新提交 57%

S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning

S3:通过约束分层强化学习中粗粒度动力学的不确定性进行稳定子目标选择

Kshitij Kumar Srivastava, Kshitij Jerath

机构 * University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究分层强化学习中高层智能体子目标选择问题,提出用粗粒度动力学提供动力学感知内在动机,通过最小化预测不确定性稳定高层策略,经实验验证该方法在非平稳长期环境中表现优于现有方法。

Comments Manuscript accepted to the Eighteenth Workshop on Adaptive and Learning Agents (ALA), at the 25th International Conference of Autonomous Agents and Multi Agent Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17981 2026-07-21 cs.LG 新提交 57%

Information-Based Exploration via Random Features for Reinforcement Learning

基于随机特征的强化学习信息探索

Waris Radji, Odalric-Ambrym Maillard

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究如何在强化学习中进行信息探索,提出基于贝叶斯核方法理论的随机特征信息增益(RFIG),用随机傅里叶特征近似信息增益,给出误差界并避免黑箱问题,实践细节使其可扩展到深度RL场景,实验显示其性能有竞争力且理论解释优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17560 2026-07-21 cs.AI 新提交 57%

Reinforcement Learning: From Algorithms To Foundation Models

强化学习:从算法到基础模型

Zihan Ding

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。

Comments Princeton University PhD Thesis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17479 2026-07-21 cs.CV 新提交 57%

TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning

TraversRL:基于强化学习的可通行行人路径生成

Bin Han, Robert Wolfe, Bill Howe

机构 * University of Washington(华盛顿大学) Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 研究旨在从航拍图像生成行人路径,核心方法是用TraversRL视觉条件模型,通过特定动作空间和奖励机制迭代生长路径网络,主要贡献是相比基线提升交并比与连通性指标,结合奖励生成更优网络,证明该建模方法的有效性。

Comments Accepted to ECCV 2026, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17038 2026-07-21 cs.AI 新提交 57%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16421 2026-07-21 cs.AI 新提交 57%

When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

何时进行规划:学习在反应式控制和审慎规划之间进行选择

Adam Labiosa, Josiah P. Hanna

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 研究智能体如何学习元推理能力,引入基于反应式策略不确定性得分分配计算的强化学习方法训练元推理策略,通过实证研究表明该设计能让元推理策略学会何时采用反应式策略,何时进行决策时规划,且能随反应式策略改进转向完全反应式控制。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18447 2026-07-21 cs.LG 版本更新 57%

Supervised Reward Inference

监督奖励推理

Will Schwarzer, Jordan Schneider, Philip S. Thomas, Scott Niekum

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 研究人类通过多样行为表明目标时的奖励推理问题,提出监督奖励推理(SRI)方法,证明其理论上渐近贝叶斯最优,实证上在相关基准和机器人任务中表现出色,还展示了框架对动作和目标预测的通用性。

Comments 35 pages, 8 figures. Updated with public code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.00990 2026-07-21 cs.LG 版本更新 57%

Hierarchical Reinforcement Learning for Air Combat at DARPA's AlphaDogfight Trials

在DARPA的AlphaDogfight试验中用于空战的分层强化学习

Adrian P. Pope, Jaime S. Ide, Daria Micovic, Henry Diaz, David Rosenbluth, Lee Ritholtz, Jason C. Twedt, Thayne T. Walker, Kevin Alcedo, Daniel Javorsek

机构 * Primordial Labs Lockheed Martin Artificial Intelligence Center, Applied AI Team(洛克希德·马丁人工智能中心,应用人工智能团队) United States Air Force(美国空军)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 针对高维连续控制难题,在DARPA的AlphaDogfight试验中,采用由高级策略选择器和低级策略组成的分层深度强化学习方法,整合专家知识训练,超越人类专家飞行员,获ADT锦标赛第二名。

Comments 15 pages (main text) + 4 pages (supplementary material), 13 figures. This work has been accepted for publication in IEEE Transactions on Artificial Intelligence (IEEE-TAI). This replaces the previous conference-version presented at the 2021 International Conference on Unmanned Aircraft System (ICUAS 21), June 15-18, 2021, Athens, Greece

Journal ref IEEE Transactions on Artificial Intelligence (IEEE-TAI), vol. 4, no. 6, pp. 1371-1385, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15660 2026-07-20 cs.AI 新提交 57%

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

ToolVerse:为智能强化学习解锁大规模环境和长时任务

Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) Peking University(北京大学) Fudan University(复旦大学) Wuhan University(武汉大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16177 2026-07-20 cs.LG math.OC 新提交 57%

Physics-enhanced reinforcement learning for real-time optimal control of dynamical systems

用于动态系统实时最优控制的物理增强强化学习

Matteo Tomasetto, Nicolò Botteghi, Gabriele Bruni, Andrea Manzoni

机构 * Politecnico di Milano(米兰理工大学) MOX - Department of Mathematics, Politecnico di Milano(米兰理工大学数学MOX系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究针对高维和参数化动态系统控制,提出物理增强强化学习(PEARL)范式,利用其动力学可微性,采用演员-伴随算法,经实验验证该方法能减少环境交互、样本效率高、可泛化并能扩展到高维空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14708 2026-07-17 cs.RO 新提交 57%

Reinforcement Learning for the Full Strawberry Harvesting Process: Obstacle Separation, Detachment, and Placement

用于完整草莓收获过程的强化学习:障碍物分离、采摘和放置

Changyou Miao, Teng Li, Ya Xiong

机构 * Beijing Academy of Agriculture and Forestry Sciences(北京市农林科学院) Huazhong Agricultural University(华中农业大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 针对机器人草莓采摘中复杂接触动力学问题,开发含启发式阶段协调的强化学习框架,通过共享策略、观察空间及分层架构实现任务,采用相关技术支持模拟到现实转移,实验验证了该方法在不同平台的有效性。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02255 2026-07-17 cs.LG 版本更新 57%

SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems

SafeOR-Gym:用于实际运筹学问题的安全强化学习算法的基准套件

Asha Ramanujam, Adam Elyoumi, Hao Chen, Sai Madhukiran Kompalli, Akshdeep Singh Ahluwalia, Shraman Pal, Dimitri J. Papageorgiou, Can Li

机构 * Davidson School of Chemical Engineering, Purdue University(普渡大学化学工程学院) Energy Sciences, ExxonMobil Technology and Engineering Company(埃克森美孚技术与工程公司能源科学部)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 针对现有安全强化学习基准与高风险领域相关性有限的问题,提出SafeOR-Gym基准套件,含九个运筹学环境,集成CMDP接口,评估多种算法,揭示性能差异,为安全强化学习研究提供实用测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13938 2026-07-16 cs.RO 新提交 57%

Discriminative Barrier Functions for Safe Adversarial Imitation Learning from Observation

用于从观察中进行安全对抗模仿学习的判别障碍函数

Anubhav Vishwakarma, Bhaumik Mehta, Caleb Hsu, Byron Boots, Karen Leung, Tyler Han

机构 * University of Washington(华盛顿大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 研究针对逆强化学习不安全及控制障碍函数设计难的问题,通过将奖励函数候选限制在CBF空间,实现安全在线控制与经验改进,能从无标签观察中恢复障碍函数,模拟实验显示其安全性能提升,并研究了不同IRL方法的权衡。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13799 2026-07-16 cs.RO 新提交 57%

Vision-Based Obstacle Separation for Strawberry Harvesting in Clusters Using Hierarchical Reinforcement Learning

基于视觉的分层强化学习在成簇草莓采摘中的障碍物分离

Teng Li, Hanfei Shi, Chunjiang Zhao, Ya Xiong

机构 * The Intelligent Equipment Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京市农林科学院智能装备研究中心) School of Intelligence Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院) Happy Elements Ltd.(乐元素科技有限公司)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 针对成簇草莓采摘中果实易被遮挡的问题,提出分层强化学习框架VGPA,集成视觉引导决策机制和PAES,将任务分解为两阶段。模拟实验策略成功率96.7%,模拟到现实转移实验成功率71.7% - 88.3%,优于直接采摘,验证了方法有效性、泛化能力和实际潜力。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12963 2026-07-15 cs.AI 版本更新 57%

Calculating Mutual Information between a Reward Maximizer and its Environment

信息论视角下最优奖励最大化世界模型的分析

Alfred Harwood, Jose Faustino, Alex Altair

机构 * Dovetail Research(Dovetail研究公司) University of Sao Paulo(圣保罗大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文从信息论角度分析了最优奖励最大化中世界模型的信息量,证明最优策略对环境的信息量为n log m比特,并适用于多种奖励最大化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05559 2026-07-14 cs.LG cs.ET math.PR physics.optics 版本更新 57%

Autocorrelation effects in a stochastic-process model for solving two-armed bandit problems

在基于时间序列的决策模型中自相关效应的影响

Tomoki Yamagami, Mikio Hasegawa, Takatomo Mihana, Ryoichi Horisaki, Atsushi Uchida

机构 * Department of Information and Computer Sciences, Saitama University(Saitama大学信息与计算机科学系) Department of Electrical Engineering, Tokyo University of Science(东京科学大学电气工程系) Department of Information Physics and Computing, The University of Tokyo(东京大学信息物理与计算系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本研究通过分析基于时间序列的决策模型,揭示了自相关性质在多臂老虎机问题中的影响,发现环境依赖性及自相关对决策性能的关键作用。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09331 2026-07-14 cs.RO cs.MA 版本更新 57%

CoRL-MPPI: Enhancing MPPI With Learnable Behaviours For Efficient And Provably-Safe Multi-Robot Collision Avoidance

CoRL-MPPI: 通过可学习行为增强MPPI以实现高效且可证明安全的多机器人避障

Stepan Dergachev, Artem Pshenitsyn, Aleksandr Panov, Alexey Skrynnik, Konstantin Yakovlev

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 CoRL-MPPI通过结合协同强化学习与MPPI,提升多机器人避障的效率与安全性。

Comments Comments: 8 pages, 6 figures. Substantially revised version. The manuscript, algorithm description, and figures have been extensively updated. The experimental evaluation has been redesigned with new scenarios, ablation study and an additional car-like motion model

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15353 2026-07-14 stat.AP cs.LG stat.ML 版本更新 57%

Reinforcement Learning in the Real World: A Survey of Statistical Challenges and Future Directions

现实世界中的强化学习:统计挑战与未来方向综述

Asim H. Gazi, Yongyi Guo, Daiqi Gao, Ziping Xu, Kelly W. Zhang, Susan A. Murphy

机构 * Department of Computer Science, Harvard University(哈佛大学计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系) Department of Statistics, Harvard University(哈佛大学统计学系) School of Data Science and Society, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校数据科学与社会学院) Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文综述现实世界强化学习应用,指出其研究与部署存在差距及两大挑战。将应用框架化为三部分过程,回顾应对统计挑战的进展,涵盖在线、离线方法及持续改进设计,还概述受应用启发的未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09042 2026-07-13 cs.LG 新提交 57%

Learning More from Less: Reinforcement Learning from Hindsight

从更少中学习更多:事后诸葛亮式强化学习

Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28320 2026-07-13 cs.RO 新提交 57%

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

WARP-RM: 一种用于数据筛选的扭曲增强相对进度奖励模型

Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) XDOF

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出WARP-RM,通过时间扭曲增强从成功演示中自监督学习密集相对进度信号,用于行为克隆中加权高优势动作块,在机器人叠衣任务中显著提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13879 2026-07-09 cs.LG 版本更新 57%

Lipschitz-Regularized Critics Lead to Policy Robustness Against Transition Dynamics Uncertainty

李普希茨正则化评论家导致策略对转移动态不确定性具有鲁棒性

Xulin Chen, Ruipeng Liu, Zhenyu Gan, Garrett E. Katz

机构 * College of Engineering & Computer Science, Syracuse University(工程与计算机科学学院,苏利文大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 研究针对强化学习中转移动态不确定性致策略性能下降问题,提出基于近端策略优化的PPO-PGDLC算法,集成投影梯度下降与李普希茨正则化评论家,实验表明该算法在环境扰动下性能更好且动作更平滑。

Journal ref Vol. 39 No. 1 (2026): Proceedings of FLAIRS-39

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02965 2026-07-08 cs.LG cs.SY eess.SP eess.SY stat.ML 版本更新 57%

Joint Energy Management and Coordinated AIGC Workload Scheduling for Distributed Data Centers: A Diffusion-Aided Reward Shaping Approach

分布式数据中心的联合能源管理与协同AIGC工作负载调度:一种扩散辅助奖励塑造方法

Yang Fu, Peng Qin, Liming Chen, Zihao Zhang, Hao Yu, Yifei Wang

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 针对AIGC在数据中心带来的能源管理与工作负载调度挑战,提出联合调度框架,考虑多种能源资源,制定系统效用最大化问题。因奖励稀疏限制DRL算法,开发扩散模型辅助奖励塑造方法,实验表明该方案能有效适应波动和异质性,实现高效学习收敛和系统效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05064 2026-07-07 cs.AI 新提交 57%

Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization

扩散引导的不确定性感知延迟策略优化

Junqi Tu, Zejiao Liu, Fangfei Li, Yang Tang

机构 * The Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, East China University of Science and Technology, Shanghai, China(能源化工过程智能制造重点实验室,教育部,东华大学,上海,中国) The School of Mathematics, East China University of Science and Technology, Shanghai, China(东华大学数学学院,上海,中国)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 针对现实环境强化学习因延迟反馈性能严重下降问题,提出DUPO方法。用扩散模型明确延迟状态与当前状态关系,利用差异估计加权延迟策略,实验表明该方法优于现有方法。

Comments Preprint; appendices included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03512 2026-07-07 cs.RO 新提交 57%

High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning

基于分层混合物理信息深度强化学习的异构多机器人系统高精度编队控制

Yanzhou Li, Guangli Chen, Xiao-Meng Li, Wenjian Zhong, Yongkang Lu, Shenghuang He

机构 * Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能产业重点实验室,大湾区大学先进工程学院) Technische Universität Dresden(德累斯顿工业大学) School of Mechanical and Electrical Engineering, Guangzhou University(广州大学机电工程学院) University of Science and Technology of China(中国科学技术大学) College of Computer Science, Dongguan University of Technology(东莞理工学院计算机科学与技术学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 针对异构多机器人系统编队控制问题,提出分层混合物理信息深度强化学习框架。上层用深度强化学习设计领导者导航策略网络,下层整合多种控制器构建编队控制策略网络,设计分层奖励函数训练跟随者,实验验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24633 2026-07-07 cs.RO 新提交 57%

Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

超越单调进展:面向机器人模仿的重试监督值学习

Xinyao Qin, Junjie Lu, Kaixin Wang, Chuheng Zhang, Sinjae Kang, Kimin Lee, Min Xu, Bin Liang, Jun Yang, Li Zhao

机构 * Tsinghua University(清华大学) University of Technology Sydney(技术科技大学) Microsoft Research Asia(微软亚洲研究院) KAIST(韩国科学技术院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 针对机器人模仿学习中演示数据包含错误与修正行为的问题,提出ReTVL框架,利用重试事件作为稀疏监督学习对错误敏感的值函数,通过全局进度校准与局部偏好学习捕捉错误-恢复结构,优化下游行为克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12569 2026-07-07 eess.SP cs.AI 版本更新 57%

Active Sensing with Meta-Reinforcement Learning for Emitter Localization from RF Observations

基于元强化学习的主动感知用于从射频观测定位发射源

M. Shamail J. Khan, Nisha L. Raichur, Lucas Heublein, Christian Wielenberg, Alexander Mattick, Tobias Feigl, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所) Positioning Systems Lab, University of Technology Nürnberg (UTN)(定位系统实验室,图恩大学) Center for Artificial Intelligence, Technical University of Applied Sciences Würzburg-Schweinfurt(人工智能中心,应用技术大学魏玛-施魏尔堡)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出利用元强化学习框架,通过序列探索环境,从射频观测中定位发射源,解决GNSS干扰下的定位问题,实验显示80.1%的成功率。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11907 2026-07-07 cs.RO 版本更新 57%

A Graph-Based Reinforcement Learning Approach with Frontier Potential Based Reward for Safe Cluttered Environment Exploration

一种基于前沿势奖励的基于图的强化学习方法用于安全杂乱环境探索

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology(计算机科学、电气与航天工程系,吕勒奥技术大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 提出结合图神经网络探索贪心策略与安全护盾的方法,用近端策略优化算法训练网络,最大化探索效率并减少护盾干预,还提出奖励函数,能在杂乱环境高效安全探索。

Comments 6 pages, 4 figures, accepted at the 24th European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏