arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4116 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4116 篇

2008.00524 2022-03-09 cs.RO cs.LG 54%

Interactive Imitation Learning in State-Space

Snehal Jauhri, Carlos Celemin, Jens Kober

专题命中 模仿学习与强化学习 :robot learning(comments,journal_ref);分类 cs.RO、cs.LG

Comments Presented at the 4th Conference on Robot Learning (CoRL) 2020, 11 pages, 4 figures

Journal ref Proceedings of the 2020 Conference on Robot Learning, PMLR 155:682-692

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28533 2026-08-11 cs.CL 版本更新 50%

GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum

GraphWalker: 通过合成轨迹课程实现基于知识图谱的代理问答

Shuwen Xu, Yao Xu, Jiaxiang Liu, Chenhao Yuan, Wenshuo Peng, Jun Zhao, Kang Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 GraphWalker通过自动化轨迹合成和分阶段微调解决知识图谱问答中的探索与泛化问题,提升轻量强化学习性能,在CWQ和WebQSP上取得最优效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04902 2026-08-06 cs.DB 版本更新 50%

AegisTS: An Agent-Driven Hierarchical Reinforcement Learning System for Multivariate Time Series Data Cleaning

AegisTS: 一种基于强化学习的层次化智能体系统用于多变量时间序列数据清洗

Yuhan Shi, Yuanyuan Yao, Lu Chen, Mourad Khayati, Yushuai Li, Tianyi Li

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对多变量时间序列中同时存在的多种质量问题,提出基于强化学习的层次化智能体系统AegisTS,通过联合优化问题处理顺序和清洗模型选择,实现无需真值的高效数据清洗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21145 2026-08-05 eess.SY cs.SY 版本更新 50%

Deep Reinforcement Learning for Adaptive Gain Tuning in Control of Teleoperation Manipulators with Joint Flexibility and Time-Varying Delays

具有关节灵活性和时变延迟的遥操作机器人控制中自适应增益调整的深度强化学习

Armin Attarzadeh, Mohammad Ali Ghaemifar, Alireza Khanzadeh, Soheil Ganjefar

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对含有关节灵活性和时变延迟的遥操作机器人控制问题,提出结合稳定P+d控制器与基于TD3算法的深度强化学习智能体的混合控制方法,可实时调整增益减少振动,为相关遥操作系统提供实用方案。

Comments 7 pages, 6 figures. Source code available at: https://github.com/ArminAttarzadeh/DRL-Controller-Gain-Tuner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26697 2026-07-30 physics.acc-ph 新提交 50%

Reinforcement Learning applied to Optimization of LHC beams in the CERN Proton Synchrotron

强化学习在欧洲核子中心质子同步加速器(CERN PS)LHC束流优化中的应用

Joel Axel Wulff, Alexandre Lasheen

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 本研究将卷积神经网络与Soft-Actor-Critic强化学习智能体结合,实现CERN PS纵向三重分裂的自动化优化,其2025年部署的自主控制器为CERN注入器复合体首批强化学习束流质量优化系统之一。

Comments 15 pages, 14 figures, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22541 2026-07-28 math.OC cs.NA math.NA math.PR 新提交 50%

SDE Guided Monte Carlo Reinforcement Learning: A Stochastic Maximum Principle Approach for Robust Decision Making in Noisy Environments

随机微分方程引导的蒙特卡罗强化学习:一种用于噪声环境中稳健决策的随机最大值原理方法

Juncai Wang

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 研究探讨SMP定性最优条件能否指导稳健表格型强化学习算法,提出SDE-MC-AC框架,通过建立对应关系及自适应温度调度整合多种方法,经实验验证了相关假设,揭示导航模式,为随机最优控制与强化学习搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18481 2026-07-22 cs.CL cs.IR 新提交 50%

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Halmstad University College(哈尔姆斯塔德大学学院)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17635 2026-07-21 eess.SY cs.SY 新提交 50%

On Optimal Event-Triggered Distributed Control for Stochastic Multi-Agent Systems via Reinforcement Learning

基于强化学习的随机多智能体系统最优事件触发分布式控制

Ziming Wang, Bingbing Li, Karl H. Johansson, Apostolos I. Rikos

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对含随机不确定性的多智能体系统,提出基于强化学习的最优分布式控制算法,采用 actor-critic-identifier 结构,用低通滤波器和混合事件触发控制策略,经稳定性证明,在仿真中验证正确性并与非最优算法比较突出优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10830 2026-07-14 cs.CR 新提交 50%

Automated Stealthy Wear-Out Attack on Digital Twins With Deep Reinforcement Learning

基于深度强化学习的数字孪生自动隐身磨损攻击

Joshua Haworth, Aryan Pasikhani, George Pavlides, Prosanta Gope, John Clark

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 研究利用深度强化学习对数字孪生进行隐身磨损攻击,通过操纵控制信号加速特定关节磨损并躲避检测。测试多种算法发现SAC性能最佳,在工业环境中用UR10e机器人手臂评估,证明攻击有效,强调了该攻击对数字孪生环境的风险及防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02533 2026-07-07 eess.SP cs.SY eess.SY 新提交 50%

Centralized PPO-Based DRL for Multi-UAV-BS Positioning and Trajectory Optimization in Disaster Response Networks

基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化

Azim Akhtarshenas, Mario Rico Ibanez, Matteo Bernabe, David Lopez-Perez, Merouane Debbah

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。

Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02171 2026-07-03 cond-mat.stat-mech cond-mat.soft 新提交 50%

Theory of collective learning in populations of adaptive agents

自适应智能体群体中的集体学习理论

Gerhard Jung, Johann Asnacios, Misaki Ozawa, Olivier Dauchot, Eric Bertin

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 通过扩展动力学理论,研究同质活性智能体群体通过交换策略和记忆进行分散式学习以实现宏观目标的过程,推导出策略分布的演化方程,并揭示有效奖励函数的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31372 2026-07-01 cs.SE 新提交 50%

Failure-Based Testing for Deep Reinforcement Learning Agents

基于失败的深度强化学习智能体测试方法

Weibin Lin, Jiangtao Meng, Zheng Zheng

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08566 2026-07-01 cond-mat.soft cond-mat.stat-mech 版本更新 50%

Homing through Reinforcement Learning

通过强化学习实现归巢

Riya Singh, Pratikshya Jena, Anish Kumar, Shradha Mishra

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01849 2026-06-26 cs.CL 版本更新 50%

From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion

从猜测到占位:一种基于代价理论的不确定性感知代码补全框架

Liang Zhu, Haolin Chen, Lidong Zhao, Xian Wu

机构 * Tencent, Shenzhen, China(腾讯深圳公司)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13891 2026-06-15 eess.SY cs.SY 新提交 50%

TetraRL: A Self-Adaptive Runtime for On-Device Deep Reinforcement Learning Systems

TetraRL:面向设备上深度强化学习系统的自适应运行时

Zexin Li, Soheil Shirvani, Cong Liu

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 提出TetraRL框架,通过偏好条件强化学习控制器动态平衡实时性、任务奖励、内存和能耗四个目标,实现资源受限设备上DRL的自适应优化。

Comments Extension version of RTSS'23 and RTSS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13834 2026-06-15 cs.PF cs.DC cs.SY eess.SY 新提交 50%

Solving Subgraph Extraction Problems Using $Δ$Search

使用$\Delta$Search解决子图提取问题

Rebin Silva Valan Arasu, Rajiv Gupta

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 提出通用启发式框架$\Delta$Search,基于奖励-惩罚优化解决一类子图提取问题,仅需用户提供可行性约束和最优性标准,可加速精确方法,在多个图问题上匹配或超越现有启发式算法。

Comments 23 pages, 13 figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25531 2026-06-09 eess.SP 版本更新 50%

From Denoising to Decision Making: A Survey on Diffusion Model-Enabled Deep Reinforcement Learning for Wireless Networks

从去噪到决策:面向无线网络的扩散模型赋能深度强化学习综述

Nguyen Cong Luong, Zeping Sui, Jie Cao, Min Xu, Nguyen Duc Hai, Zhihao Dong, Nguyen Duc Duy Anh, Qiushi Zhao, Nguyen Quoc Khanh, Zhe Fu, Shaohan Feng, Bo Ma

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文综述了扩散模型与深度强化学习结合的方法,通过捕捉无线资源管理中的复杂多模态动作结构,提升决策质量,并系统总结了其在移动边缘计算、无人机辅助、车联网、AIGC驱动系统、无线资源分配、物理层安全及机器人/无人机规划等领域的应用。

Comments 22 pages, 7 figures, Author list corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08719 2026-06-04 eess.SY cs.SY 50%

Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing

基于深度强化学习的六自由度行星powered着陆与着陆

Brian Gaudet, Richard Linares, Roberto Furfaro

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本文提出了一种新型的集成引导与控制算法,利用强化学习原理学习策略,以实现精确且燃料高效的轨迹,同时通过不同的折扣率提升优化性能。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.06491 2026-06-04 eess.SY cs.SY stat.ML 50%

Data-Efficient Reinforcement Learning with Probabilistic Model Predictive Control

基于概率模型预测控制的数据高效强化学习

Sanket Kamthe, Marc Peter Deisenroth

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出基于概率模型预测控制的强化学习框架,通过高斯过程学习转移模型以处理约束,实现数据高效和最优控制。

Comments Accepted at AISTATS 2018,

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.02441 2026-06-04 eess.SY cs.SY stat.ML 50%

A Novel Model for Arbitration between Planning and Habitual Control Systems

一种用于规划与习惯控制系统的仲裁新模型

Farzaneh S. Fard, Thomas P. Trappenberg

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出一种结合规划与习惯控制的仲裁模型,通过模拟双关节机械臂任务展示其在动态环境中的高效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09055 2026-06-04 eess.SY cs.SY 50%

Simultaneous active parameter estimation and control using sampling-based Bayesian reinforcement learning

基于采样式贝叶斯强化学习的同时主动参数估计与控制

Patrick Slade, Preston Culbertson, Zachary Sunberg, Mykel Kochenderfer

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 本文提出利用蒙特卡洛树搜索和扩展卡尔曼滤波处理高斯过程噪声和参数不确定性,实现机器人任务中的同时估计与控制,通过比较确定性等价模型预测控制的仿真结果验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.07279 2026-06-04 eess.SY cs.SY 50%

Myopic Policy Bounds for Information Acquisition POMDPs

短视策略界限用于信息获取POMDPs

Mikko Lauri, Nikolay Atanasov, George J. Pappas, Risto Ritala

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文研究了机器人传感系统在环境监测、搜索救援和侦察等场景中的自主信息采集问题,通过部分可观测马尔可夫决策过程(POMDP)建模,提出基于短视计算的策略上下界方法,用于加速最优策略的求解。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.3038 2026-06-04 eess.SY cs.SY 50%

Model-based Path Integral Stochastic Control: A Bayesian Nonparametric Approach

基于模型的路径积分随机控制:一种贝叶斯非参数方法

Yunpeng Pan, Evangelos A. Theodorou, Michail Kontitsis

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出一种基于路径积分和高斯过程的模型驱动随机优化控制框架,通过有限样本数据自主学习时间变化的最优控制,提升高维复杂任务的控制效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17919 2026-06-02 cs.CE 50%

Training Diffusion Language Models for Black-Box Optimization

训练扩散语言模型用于黑盒优化

Zipeng Sun, Can Chen, Ye Yuan, Haolun Wu, Jiayao Gu, Christopher Pal, Xue Liu

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 针对离线黑盒优化问题,提出通过扩散语言模型的双向建模能力,结合统一语料构建和两阶段后训练框架,实现高效设计生成,在Design-Bench上达到最优性能。

Comments Accepted at ICML 2026 as a Spotlight Paper (top 2.2% of submissions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30690 2026-06-01 cs.CL 50%

ElasticMem: Latent Memory as a Learnable Resource for LLM Agents

ElasticMem: 将潜在记忆作为LLM智能体的可学习资源

Tao Feng, Chongrui Ye, Tianyang Luo, Jingjun Xu, Xueqiang Xu, Haozhen Zhang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract)

AI总结 提出ElasticMem框架,通过可学习的弹性潜在记忆分配策略,在记忆密集型问答和具身智能体控制任务中显著提升准确率并降低token开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24265 2026-05-01 cs.MA 50%

R3DM: Enabling Role Discovery and Diversity Through Dynamics Models in Multi-agent Reinforcement Learning

R3DM:通过动态模型在多智能体强化学习中实现角色发现与多样性

Harsh Goel, Mohammad Omama, Behdad Chalaki, Vaishnav Tadiparthi, Ehsan Moradi Pari, Sandeep Chinchali

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 R3DM通过动态模型最大化智能体角色、观察轨迹与预期未来行为间的互信息,提升多智能体协作效率,实验表明其在SMAC和SMACv2环境中显著提升胜率。

Comments 21 pages, To appear in the International Conference of Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05846 2026-04-08 cs.CL 50%

AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning

AgentGL: 通过强化学习实现基于LLM的代理图学习

Yuanfu Sun, Kang Li, Dongzhe Fan, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 AgentGL通过强化学习框架实现图学习,结合图导航与LLM推理,提升复杂关系环境下的自主导航与推理能力,优于现有基线方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27364 2026-03-31 cs.NI 50%

DRASTIC: A Dynamic Resource Allocation Framework over 6G Network Slicing in Task-aware Closed-Loop Tactile Internet Applications

DRASTIC:一种面向6G网络切片的动态资源分配框架,用于任务感知闭环触觉互联网应用

Narges Golmohammadi, Madan Mohan Rayguru, Sabur Baidya

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出DRASTIC框架,通过强化学习动态分配资源,满足延迟要求并提高吞吐量,适用于eMBB和HRLLC用户。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22880 2026-03-25 q-fin.GN cs.CE q-fin.PM 50%

Portfolio Optimization under Recursive Utility via Reinforcement Learning

通过强化学习进行递归效用下的投资组合优化

Minkey Chang

专题命中 模仿学习与强化学习 :world model(abstract)

AI总结 本文研究递归效用是否能提升投资组合分配的强化学习效果,通过蒙特卡洛方法近似递归效用中的确定等价,改进了PPO和A2C算法,实验显示在夏普比率、最大回撤和累计收益上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11582 2026-03-13 eess.SY cs.MA cs.SY 50%

Multi-Agent Reinforcement Learning for UAV-Based Chemical Plume Source Localization

基于无人机的化学烟雾源定位的多智能体强化学习

Zhirun Li, Derek Hollenbeck, Ruikun Wu, Michelle Sherman, Sihua Shao, Xiang Sun, Mostafa Hassanalian

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本研究提出基于多智能体深度强化学习的框架,用于无人机在化学烟雾源定位中的高效检测与精准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏