arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4115 篇

2606.08104 2026-06-09 cs.RO 新提交 57%

Reinforcement learning in linear embedding space unlocks generalizable control across soft robot configurations

线性嵌入空间中的强化学习解锁软体机器人配置的通用控制

Xinglong Zhang, Cong Li, Hangjie Mo, Yue Jiang, Xin Xu, Wei Jiang, Zhenshan Bing, Yihe Yang, Xiaojian Li, Yueneng Yang, Huimin Lu, Ling-li Zeng, Alois Knoll, Dewen Hu, Li Wen, Wei Pan

机构 * National University of Defense Technology(国防科技大学) Hefei University of Technology(合肥工业大学) Nanjing University (Suzhou Campus)(南京大学(苏州校区)) Technical University of Munich(慕尼黑工业大学) Beihang University(北京航空航天大学) Newcastle University(纽卡斯尔大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 提出基于共享线性Koopman嵌入空间的强化学习框架,将控制策略与机器人形态解耦,实现跨33种软体机器人配置的快速迁移,样本量减少75倍,并支持高速运动、重载和多执行器故障下的鲁棒控制。

Comments An updated version of this paper has been accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08064 2026-06-09 cs.RO 新提交 57%

Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning

基于多智能体强化学习的协作长绳跳绳

Zihao Wang, Shijie Peng, Kerui Wu, Yu Huang, Ruiqi Xue, Dong Liu, Tian Xu, Lei Yuan, Yang Yu

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Beijing Academy of Artificial Intelligence, BAAI(北京智源人工智能研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出Marope框架,采用分层强化学习实现多个人形机器人的协作长绳跳绳,通过多智能体强化学习训练分散的摇绳策略,上层调度策略协调执行,并融入多样跳跃策略提升泛化能力,在仿真和真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10102 2026-06-08 cs.RO cs.SY eess.SY 版本更新 57%

A Human-Sensitive Controller: Adapting to Human Musculoskeletal Disorder-Related Constraints via Reinforcement Learning

一种人类敏感控制器:通过强化学习适应人类肌肉骨骼疾病相关约束

Vitor Martins, Sara M. Cerqueira, Mercedes Balcells, Elazer R Edelman, Cristina P. Santos

机构 * Fundação para a Ciência e Tecnologia(葡萄牙科学与技术基金会) Centro de Microssistemas Eletromecânicos da Universidade do Minho(University of Minho微机电系统中心) Massachusetts Institute of Technology(麻省理工学院) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布莱尔妇女医院) GEVAB, IQS School of Engineering(GEVAB,IQS工程学院) LABBELS-Associate Laboratory, University of Minho(University of Minho关联实验室)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出基于强化学习的人类敏感机器人控制策略,使用Q学习和深度Q网络优化协作机器人的人机工效,在保持零疼痛风险下平均缩短38%任务完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05468 2026-06-05 cs.RO 57%

FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

FlowPRO:通过近端偏好优化对流匹配VLA进行无奖励强化微调

Yihao Wu, He Zhang, Junbo Tan, Xueqian Wang, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯机器人X实验室) Futian Laboratory(福田实验室) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出FlowPRO框架,通过近端偏好优化(RPRO)和干预-回滚数据收集方法,实现无奖励的离线强化微调,在四类长时程双臂任务中取得最高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09706 2026-06-05 cs.LG 57%

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

通过强化学习训练一个模型以掌握跨层级的代理行为

Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。

Comments Accepted to CVPR 2026 as a Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04634 2026-06-04 cs.LG 57%

Explainably Safe Reinforcement Learning

可解释的安全强化学习

Sabine Rieder, Stefan Pranger, Debraj Chakraborty, Jan Křetínský, Bettina Könighofer

机构 * Masaryk University(马萨里克大学) Graz University of Technology(格拉茨技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 提出一种基于分层决策树的可解释安全强化学习方法,通过世界模型分析状态风险并构建屏蔽策略,生成可理解的解释,同时保持安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.11411 2026-06-04 eess.SY cs.LG cs.MA cs.SY 57%

Observer-based Adaptive Optimal Output Containment Control problem of Linear Heterogeneous Multi-agent Systems with Relative Output Measurements

基于观测器的自适应最优输出包容控制问题:线性异构多智能体系统中的相对输出测量

Majid Mazouchi, Mohammad Bagher Naghibi-Sistani, Seyed Kamal Hosseini Sani, Farzaneh Tatari, Hamidreza Modares

机构 * Department of Electrical Engineering, Ferdowsi University of Mashhad, Mashhad, Iran(马什哈德法尔多西大学电气工程系) Department of Electrical Engineering, University of Semnan, Semnan, Iran(塞姆南大学电气工程系) Missouri University of Science(密苏里科技大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种基于相对输出反馈的最优解法,用于线性异构多智能体系统的包容控制问题,通过分布式最优控制协议确保跟随器输出处于领导者输出的凸包内并优化暂态性能,采用分布式观测器估计不可用的状态和凸包。

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.06460 2026-06-04 eess.SY cs.RO cs.SY 57%

Robust Satisfaction of Temporal Logic Specifications via Reinforcement Learning

通过强化学习实现时序逻辑规范的鲁棒满足

Austin Jones, Derya Aksaray, Zhaodan Kong, Mac Schwager, Calin Belta

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出通过强化学习最大化满足信号时序逻辑规范的概率和鲁棒性,通过机器人导航仿真验证其在概率和鲁棒性上的优越性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03335 2026-06-03 cs.RO 57%

GPU-Parallel Multi-Task Reinforcement Learning with Demonstration Guided Policy Optimization

GPU并行多任务强化学习与演示引导的策略优化

Rui Zhang, Qiwei Wu, Zhengyu Zhang, Tao Li, Yunrong Guo, Junjie Lai, Renjing Xu, Weihua Zhang

机构 * NVIDIA The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出一种将结构化操作任务族转化为GPU并行多任务强化学习基准的构建方法MT-LIBERO,并设计演示引导策略优化算法DGPO,结合重要性加权PPO与自适应行为克隆,实现异构任务套件的高效并行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02643 2026-06-03 cs.CR cs.AI cs.DB 57%

Inference Cost Attacks for Retrieval-Augmented Large Language Models

检索增强型大语言模型的推理成本攻击

Chengliang Liu, Liangbo Ning, Yujuan Ding, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 提出RA-ICA攻击范式,通过向外部知识库注入恶意文档,利用CREEP框架和MA-GRPO算法,使RAG增强的LLM系统推理时token消耗增加高达13.12倍且成功率超过90%。

Comments Accepted at The ACM Web Conference 2026 (WWW '26)

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02337 2026-06-02 cs.AI 57%

Coordination Graphs for Constrained Multi-Agent Reinforcement Learning

约束多智能体强化学习的协调图

Santiago Amaya-Corredor, Miguel Calvo-Fullana, Anders Jonsson

机构 * Department of Electrical and Computer Engineering, Linköping University(1 链çe普大学电气与计算机工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出CG-CMARL框架,利用协调图和拉格朗日对偶分解联合动作空间与约束耦合问题,实现独立于智能体数量的模型学习,并通过Max-Sum消息传递和拉格朗日乘子控制目标-约束权衡,生成帕累托前沿。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 40 pages (12 main + 28 appendix), 5 figures, 16 tables, 7 theorems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02280 2026-06-02 cs.RO 57%

Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation

动力学是学出来的,不是告诉的:零样本策略适应的潜在动力学几何半监督发现

Zhiming Xu, Weitao Zhou, Xianghui Pan, Nanshan Deng, Chengju Liu, Qijun Chen, Chenpeng Yao

机构 * Zhiming Xu(徐志明) Weitao Zhou(周伟涛) Xianghui Pan(潘向辉) Nanshan Deng(邓南山) Chengju Liu(刘成军) Qijun Chen(陈齐军) Chenpeng Yao(姚晨鹏)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对机器人强化学习中动力学变化导致策略失效的问题,提出基于对比学习的半监督方法,通过构建平滑、任务相关的潜在拓扑结构,实现零样本策略适应,在MuJoCo基准上优于参数中心方法。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01868 2026-06-02 cs.LG 57%

Task-Induced Representational Invariances Depend on Learning Objective in Deep RL

任务诱导的表征不变性依赖于深度强化学习中的学习目标

Manu Srinath Halvagal, Sebastian Lee, SueYeon Chung

机构 * Department of Physics, Harvard University(哈佛大学物理系) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) Center for Computational Neuroscience, Flatiron Institute(Flatiron研究所计算神经科学中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文通过MDP约简理论分析深度强化学习中的表征,发现基于价值的方法(DQN)学习对MDP同态对称性不变的表征,而基于策略梯度的方法(PPO)学习对动作对称性不变的表征,这些差异影响迁移学习并在LLM中呈现提示依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01363 2026-06-02 cs.LG cs.SY eess.SY 57%

All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning

所有模型都是错的,知道哪里有用:强化学习中的模型不确定性

Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele, Friedrich Solowjow, Sebastian Trimpe

机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) Robotics Institute Germany (RIG)(德国机器人研究所) Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00730 2026-06-02 cs.RO 57%

Infeasible optimization problems and the hierarchical augmented Lagrangian method in imitation learning

模仿学习中的不可行优化问题与分层增广拉格朗日方法

Roland Andrews, Justin Carpentier, Ajay Sathya

机构 * University of Cambridge(剑桥大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对模仿学习中约束不可行导致训练不稳定的问题,提出基于增广拉格朗日方法的解决方案,将策略引导至最近可行约束问题的解,并在驾驶示例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00427 2026-06-02 cs.LG 57%

Topology-Aware State Abstraction with Tangle Cores for Markov Decision Processes

基于纠缠核的马尔可夫决策过程拓扑感知状态抽象

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 提出纠缠核抽象框架,利用经验转移图的图纠缠构建重叠状态抽象,在动作一致性条件下保证价值保持,并通过实验证明其在瓶颈领域优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14709 2026-06-02 cs.CV 57%

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器

Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li, Feng Wang, Shuochen Chang, Shaobo Wang, Yali Wang, Keming Ye, Jiangtong Li, Li Niu

机构 * Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31256 2026-06-01 cs.RO 57%

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

在封闭停车场之前:面向自动驾驶高效具身大语言模型的强化学习时间剪枝

Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

机构 * Department of Control and Computer Engineering(控制与计算机工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出一种在强化学习过程中进行剪枝的策略BPF,通过任务特定监督和闭环反馈压缩具身大语言模型控制器,在自动驾驶控制管道中实现了更好的性能-内存-吞吐量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30576 2026-06-01 cs.AI 57%

Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving

自动驾驶强化学习中不确定性感知与时间调控的专家建议

Ahmed Abouelazm, Felix Klingebiel, Philip Schörner, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出一种不确定性感知框架,通过自适应阈值触发专家建议并采用承诺-冷却策略调控指导时长,结合离线策略隐式分位数网络实现安全高效的探索,在CARLA中成功率提升5-7%。

Comments Accepted in The IEEE International Conference on Intelligent Transportation Systems (ITSC) September 15-18, 2026 -- Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02217 2026-06-01 cs.LG 57%

Population-Free Pareto Tracking for Sample-Efficient Multi-Policy MORL

无种群的帕累托跟踪:面向样本高效的多策略多目标强化学习

Zeyu Zhao, Yueling Che, Kaichen Liu, Jian Li, Junmei Yao

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 提出MPFT框架,通过无自进化种群的帕累托跟踪机制,结合单目标极端策略初始化,高效逼近完整帕累托前沿,显著提升样本效率并减少智能体-环境交互。

Comments 37 pages, 10 figures, ICML26 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12815 2026-05-29 cs.LG 57%

TrojanTO: Action-Level Backdoor Attacks against Trajectory Optimization Models

TrojanTO:针对轨迹优化模型的行动级后门攻击

Yang Dai, Oubo Ma, Longfei Zhang, Xingxing Liang, Xiaochun Cao, Shouling Ji, Jiaheng Zhang, Jincai Huang, Li Shen

机构 * Laboratory for Big Data and Decision, National University of Defense Technology(大数据与决策实验室,国防科技大学) Zhejiang University(浙江大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) National University of Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出TrojanTO,首个针对轨迹优化模型的行动级后门攻击方法,通过交替训练增强触发与目标动作关联,并利用轨迹过滤和批量投毒实现高隐蔽性,在低攻击预算下有效植入后门。

Comments 23 pages, 6 figures

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29324 2026-05-29 cs.CL cs.CV 57%

STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments

STAMP:在可控且可扩展的虚拟环境中训练移动GUI代理的显式记忆

Junyang Wang, Haiyang Xu, Xi Zhang, Zhaoqing Zhu, Ming Yan, Jieping Ye, Jitao Sang

机构 * Tongyi AI Lab, Alibaba Group(通义实验室,阿里巴巴集团) Beijing Jiaotong University(北京交通大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 提出STAMP框架,通过可控虚拟环境注入确定性记忆变量,生成可验证监督数据并支持在线强化学习,解决移动GUI代理在长时任务中因上下文窗口限制和缺乏显式记忆导致的失败问题。

Comments 24 pages, 4figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13238 2026-05-29 cs.NI cs.LG 57%

Securing SIM-Assisted Wireless Networks via Quantum Reinforcement Learning

通过量子强化学习保护SIM辅助无线网络

Le-Hung Hoang, Quang-Trung Luu, Dinh Thai Hoang, Diep N. Nguyen, Van-Dinh Nguyen

机构 * Smart Green Transformation Center, VinUniversity(Vin大学智能绿色转型中心) Université Paris-Saclay - CNRS - CentraleSupélec - L2S(巴黎萨克雷大学 - CNRS - 中央超导实验室 - L2S) School of Electrical and Data Engineering, University of Technology Sydney(悉尼技术大学电气与数据工程学院) School of Computer Science and Statistics, Trinity College Dublin, The University of Dublin(都柏林大学三一学院计算机科学与统计学学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 针对SIM辅助无线网络中高维优化和动态环境挑战,提出混合量子近端策略优化框架,联合优化功率分配和SIM相位,实现约15%保密率提升和30%收敛加速。

Comments Submitted to IEEE TCOM: 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06970 2026-05-28 eess.SY cs.LG cs.SY 57%

Falsification-driven reinforcement learning for maritime motion planning

基于证伪驱动的强化学习用于海上运动规划

Marlon Müller, Florian Finkeldei, Hanna Krasowski, Murat Arcak, Matthias Althoff

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Berkeley(加州大学伯克利分校) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 提出一种证伪驱动的强化学习方法,通过生成对抗性训练场景(违反信号时态逻辑规范的海上交通规则)来提升自主船舶的规则遵守能力,实验表明该方法能提供更相关的训练场景并实现更一致的规则遵守。

Comments 11 pages, 9 figures. Code available at https://fdrl-maritime.github.io

Journal ref Ocean Engineering 361 (2026) 125579

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26282 2026-05-27 cs.LG 57%

Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization

通过扩散策略优化扩展世界模型强化学习

Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu, Yuanzhao Zhang, Yiming Yang, Hai Wang, Zhuo Sun, Che Liu

机构 * Dynamic Systems Lab, University College London(伦敦大学学院动态系统实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Santa Fe Institute(圣塔菲研究所) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 针对世界模型强化学习中搜索与价值学习之间的结构错位问题,提出基于扩散策略优化的模型基方法MBDPO,统一搜索与策略优化,实现可扩展的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24152 2026-05-27 cs.AI 57%

Neuro-Inspired Inverse Learning for Planning and Control

神经启发式逆向学习用于规划与控制

Maryna Kapitonova, Tonio Ball

机构 * NeuroMentum AI IMBIT, University of Freiburg, Germany(NeuroMentum AI IMBIT,弗赖堡大学,德国)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 提出一种神经启发式框架Inverter,通过逆向学习(IL)结合前向/逆向内部模型、开环多步运动指令和层次化动作组织,在规划与控制任务中实现高效推理,平均性能提升24.2%且计算时间降低一到两个数量级。

Comments Version 2, minor fix in online version of the abstract, pdf unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03785 2026-05-27 cs.AI cs.MA 57%

Communication Gain and Delay Cost Under Cross-Timestep Delays in Cooperative Multi-Agent Reinforcement Learning

跨时间步延迟下合作多智能体强化学习中的通信增益与延迟代价

Zihong Gao, Hongjian Liang, Lei Hao, Liangjun Ke

机构 * The State Key Laboratory for Manufacturing Systems Engineering(制造系统工程国家重点实验室) School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 针对部分可观测环境中跨时间步通信延迟导致的信息错位问题,提出通信增益与延迟代价(CGDC)度量,并基于此设计演员-评论家框架CDCMA,通过预测未来观测和注意力融合延迟消息来提升合作多智能体强化学习的性能、鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21845 2026-05-27 cs.LG 57%

Constrained Meta Reinforcement Learning with Provable Test-Time Safety

具有可证明测试时安全性的约束元强化学习

Tingting Ni, Maryam Kamgarpour

机构 * Sycamore Lab, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院萨克森实验室,瑞士拉瓦尔)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出一种约束元强化学习算法,在测试任务上以可证明的安全性和样本复杂度保证学习近似最优策略,并证明样本复杂度下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20957 2026-05-27 cs.SE cs.AI 57%

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

一个工具就够了:面向仓库级LLM智能体的强化学习

Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(北京大学计算机科学学院) Zhongguancun Institute of Artificial Intelligence (ZGCI)(中关村人工智能研究院(ZGCI)) Baidu Inc(百度公司)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 提出RepoNavigator,一个仅配备单一执行感知工具(跳转到调用符号定义)的LLM智能体,通过强化学习端到端训练,在仓库级问题定位中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04310 2026-05-27 cs.AI 57%

EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation

EvoEmo:面向多轮价格谈判中对抗性LLM智能体的进化情感策略

Yunbo Long, Liming Xu, Lukas Beckenbauer, Yuhan Liu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) TUM School of Management, Technical University of Munich(慕尼黑技术大学管理学院) The Alan Turing Institute, London, UK(伦敦阿尔安·图灵研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 提出EvoEmo进化强化学习框架,通过将情感状态转移建模为马尔可夫决策过程并采用种群遗传优化,动态优化多轮谈判中的情感表达,显著提升LLM智能体的谈判成功率、效率和买家节省。

详情

展开后加载摘要…

URL PDF HTML 收藏