Temporal Self-Imitation Learning
时间自我模仿学习
机构 * Duke University(杜克大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 提出时间自我模仿学习框架,通过挖掘高效成功轨迹并转化为可重用监督信号,提升长时域机器人操作任务的学习效率与鲁棒性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
时间自我模仿学习
机构 * Duke University(杜克大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 提出时间自我模仿学习框架,通过挖掘高效成功轨迹并转化为可重用监督信号,提升长时域机器人操作任务的学习效率与鲁棒性。
逆向Q学习
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 提出逆向Q学习(RQL)算法,通过扩展MDP框架和逆向流生成虚拟在线轨迹,结合偏差-方差缩减技术,实现基于流策略的离线强化学习,在50个机器人任务中取得最佳平均性能。
HOLO-MPPI:通过分层策略优化的多场景运动规划
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Honda Research Institute, USA(本田研究所(美国))
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI
AI总结 提出HOLO-MPPI框架,结合离线高层策略学习与在线低层随机最优控制,实现多场景运动规划,无需针对每个场景重新调整参数,在自动驾驶中优于MPPI和端到端RL基线。
可证明安全且可扩展的强化学习
机构 * MIT(麻省理工学院)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG
AI总结 提出PS2-RL框架,通过两阶段架构(学习备份策略隐式构造控制不变集,再通过可微投影层训练RL策略)实现可证明安全且可扩展的强化学习,在高达10维状态空间中保持性能与安全性。
基于多智能体强化学习的任意物体协同运输中的形状形成
机构 * University of Technology Nuremberg(纽伦堡工业大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 提出一种多智能体强化学习方法,使多机器人系统自主形成支撑任意形状和非均匀质量分布物体的编队,同时避免障碍物,实现可靠且泛化的协同运输。
基于密度传输的流匹配策略强化学习
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 提出在线强化学习算法RLDT,利用Stein变分梯度下降构建传输场,微调预训练流匹配策略,通过期望目标估计稳定训练,在连续控制任务中优于基线方法。
基于位置动力学(PBD)和物质点法(MPM)的手术缝合模拟用于机器人强化学习
机构 * University of Alberta(阿尔伯塔大学)
专题命中 模仿学习与强化学习 :robotics(abstract,comments);分类 cs.RO
AI总结 该研究提出基于PBD与MPM的缝合模拟环境,优化GPU执行并构建RL缝合子任务环境,训练的RL智能体在进针、拔针任务中分别达到80%、68%的成功率。
Comments 7 pages, 9 figures, accepted for the IEEE RAS/EMBS 11th International Conference on Biomedical Robotics and Biomechatronics (BioRob 2026)
Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享
机构 * HKUST(香港科技大学) ; Alibaba Inc(阿里巴巴公司)
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.LG
AI总结 Rollplex是一种跨阶段GPU空间共享运行时,通过解耦RL后训练的参考与训练阶段、优化内存与并行度,提升VLMs后训练的GPU利用率与训练速度。
Comments 16 pages, 10 figures
PILOT:部分可观测条件下自主无人机端到端运动规划的特权模仿学习方法
机构 * School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空航天学院) ; Sun Yat-sen University(中山大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO
AI总结 本文提出PILOT框架,通过特权模仿学习结合TCN时空感知融合模块,实现部分可观测下无人机端到端运动规划,性能接近最优控制专家且计算开销降超80%,零样本部署验证其可行性与泛化性。
Comments 13 Pages, 12 figures
OGR-MARL:面向受限港口水道中异构无人水面艇协同追踪的选项引导式残差多智能体强化学习
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI
AI总结 本文提出OGR-MARL框架,将其实例化为多款连续控制MARL算法,经厦门港水道实验验证,OGR-MASAC捕获率达75.0%,规则依从性与异构协同表现最优,且具备良好泛化潜力。
Comments 6 pages,5 figures, accepted by ICUS 2026
面向安全强化学习的边界搜寻策略梯度算法
机构 * School of EECS, Washington State University(华盛顿州立大学电子工程与计算机科学学院)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本文提出BSPG算法,针对安全强化学习中标准梯度法易收敛到可行域内部的问题,结合切向与法向分量,在Safety-Gymnasium导航任务中实现更高奖励与更紧密的边界跟踪。
Comments CDC 2026
面向任务的编队决策:通过强化学习实现对攻击型集群的驱赶
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文针对攻击型集群驱赶任务,提出基于强化学习的编队决策方法,通过参数化编队形状缓解防御者机动性劣势,在仿真与物理平台上验证了方法的可行性与扩展性。
Comments Accepted for publication in IEEE Transactions on Automation Science and Engineering
平均奖励强化学习的有限常数前沿与可审计后悔证书
机构 * Iowa State University(爱荷华州立大学) ; BRAC University(BRAC大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。
时空敏捷性:面向视觉引导的动态四足机器人拦截的时间约束强化学习
机构 * Zhejiang University(浙江大学) ; LimX Dynamics Technology Co., Ltd.(灵蜥动力科技有限公司)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文针对四足机器人动态接球任务,提出结合视觉模块与直接目标条件RL策略的集成框架,构建实时闭环拦截系统,提升了接球成功率并减小了sim-to-real性能差距。
EnvACE:通过世界预演内化环境动态以实现智能体强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-sen University(中山大学) ; Central South University(中南大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent Inc.(腾讯公司)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI
AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。
State2State:面向大语言模型智能体的环境衍生式中间训练
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Institute for AI, Tsinghua University(清华大学人工智能研究院) ; Institute of Intelligent Computing, Alibaba Group(阿里巴巴集团智能计算研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG
AI总结 该研究提出State2State环境衍生式中间训练方法,无需外部任务与监督,可提升LLM智能体性能及学习效率,具备跨环境泛化潜力。
Comments Work in progress
EvoHIL:用于鲁棒交互式强化学习的自演化奖励与流匹配策略优化
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 EvoHIL是适配奖励模型、动作生成器和视觉域的统一交互式学习框架,在六类机械臂操纵任务中提升了成功率、运动平滑度等性能。
NeuroSynth:一种受生物启发的持续强化学习架构,用于缓解灾难性遗忘
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本研究提出受生物启发的持续强化学习架构NeuroSynth,通过双路径巩固机制缓解灾难性遗忘,实验显示其在多个顺序导航任务中相比PPO、EWC保留更多早期任务知识,改善了持续学习的稳定性-可塑性平衡。
Comments Disclaimer. This manuscript is provided as an arXiv preprint to establish a public record of the NeuroSynth continual reinforcement learning architecture and its evaluation on the NeuroMaze-CL benchmark. This full manuscript has been submitted to the Journal of High School Science for peer review
视觉-语言模型能否对图像中的AI编辑进行推理?
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; IBM Research(IBM研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV
AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。
FaithEyes:通过多智能体过程图像验证实现可信的工具使用
机构 * Samsung Research(三星研究院) ; Peking University(北京大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV
AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。
MARS-RA:基于具身多智能体协作中多模态比较的信用分配排序聚合
机构 * Newcastle University(纽卡斯尔大学) ; University of Auckland(奥克兰大学)
专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI
AI总结 本研究针对具身多智能体协作的信用分配难题,提出MARS-RA框架,将其转化为多模态模型生成的成对比较排序聚合问题,经理论与实验验证可引导智能体有效协作。
Comments ACL 2026 Main
通过物理感知策略蒸馏实现可解释强化学习
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。
Comments 6 pages, 7 figures
评估强化学习智能体的模糊测试
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 研究针对强化学习智能体模糊测试评估差异问题,通过在三种环境下统一配置对五种方法及随机测试进行基准测试,从多角度评估,揭示不同方法特点,表明模糊测试能提升智能体鲁棒性等,还给出可操作指导。
用于RoboRacer平台自主赛车中泛化的持续强化学习
机构 * Center for Project-Based Learning, D-ITET, ETH Zurich(基于项目的学习中心,分布式信息技术与电气工程学院,苏黎世联邦理工学院)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO
AI总结 针对现代机器人适应变化环境的挑战,提出基于持续反向传播的持续强化学习框架,仅用现实世界数据训练通用策略并微调超越经典控制器,还提出离线强化学习比较方法并进行模拟分析。
Comments 8 pages, conference
使用后继表示的约束强化学习
机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) ; Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) ; Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) ; University of Technology Nuremberg (UTN)(纽伦堡工业大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。
Comments published in Transactions for Machine Learning Research 2026
Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research
基于分层动作分块的离线强化学习
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 研究离线目标条件强化学习中扩展到长期任务的挑战,提出HiQC算法,结合高级潜在规划与低级动作分块,实现无偏k步价值备份,理论证明其价值误差界限更紧,实证表明在OGBench套件中性能最佳。
Comments RLC/RLJ 2026
HypEMBER:基于超网络的集成方法用于参数化动态系统的稳健策略学习
机构 * MOX, Department of Mathematics Politecnico di Milano(米兰理工大学数学MOX系) ; Department of Aeronautics Imperial College London(伦敦帝国理工学院航空系)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 研究在测量和模型不确定下参数化动态系统的稳健控制,提出基于超网络与集成学习结合的HypEMBER框架,通过超网络表示策略和价值函数实现参数泛化,用逼近器集成量化不确定性,实验表明该框架能提升训练稳定性等,增强对不确定性的稳健性。
S3:通过约束分层强化学习中粗粒度动力学的不确定性进行稳定子目标选择
机构 * University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 研究分层强化学习中高层智能体子目标选择问题,提出用粗粒度动力学提供动力学感知内在动机,通过最小化预测不确定性稳定高层策略,经实验验证该方法在非平稳长期环境中表现优于现有方法。
Comments Manuscript accepted to the Eighteenth Workshop on Adaptive and Learning Agents (ALA), at the 25th International Conference of Autonomous Agents and Multi Agent Systems 2026
基于随机特征的强化学习信息探索
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 研究如何在强化学习中进行信息探索,提出基于贝叶斯核方法理论的随机特征信息增益(RFIG),用随机傅里叶特征近似信息增益,给出误差界并避免黑箱问题,实践细节使其可扩展到深度RL场景,实验显示其性能有竞争力且理论解释优。
强化学习:从算法到基础模型
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI
AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。
Comments Princeton University PhD Thesis 2026