Mitigating Planner Overfitting in Model-Based Reinforcement Learning
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.AI、cs.LG
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.AI、cs.LG
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.LG、cs.RO
Comments Accepted at RA-L
专题命中 模型式强化学习 :dynamics model(title,abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.LG、cs.RO
Comments IROS 2019
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.AI、cs.LG
Comments ACML 2019. Recipient of the Best Student Paper Award
专题命中 模型式强化学习 :model-based RL(title);分类 cs.AI、cs.LG
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.LG;predictive model(abstract)
Comments Accepted at the Workshop on Multi-Task and Lifelong Reinforcement Learning, 36th International Conference on Machine Learning, Long Beach, California, 2019
专题命中 模型式强化学习 :model-based RL(title);分类 cs.AI、cs.LG
Comments Accepted to the ICML 2019 workshop on Workshop on Generative Modeling and Model-Based Reasoning for Robotics and AI
专题命中 模型式强化学习 :dynamics model(title,abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.LG、cs.RO
Comments NIPS 2018, video and code available at https://sites.google.com/view/drl-in-a-handful-of-trials/
机构 * Coventry University(科文特大学)
专题命中 模型式强化学习 :model-based RL(abstract);world model(comments);world models(comments);分类 cs.AI、cs.LG
Comments World Models @ ICLR 2025
专题命中 模型式强化学习 :latent dynamics(abstract);environment model(abstract);分类 cs.AI、cs.LG;dynamics model(abstract)
Comments UAI 2024 (Oral). The first two authors contributed equally
专题命中 模型式强化学习 :latent dynamics(abstract);model-based RL(abstract);分类 cs.LG、cs.RO;dynamics model(abstract)
专题命中 模型式强化学习 :model-based reinforcement learning(abstract);model-based RL(abstract);分类 cs.LG、cs.RO;dynamics model(abstract)
Comments Accepted by IROS2022
基于模型的强化学习控制反应扩散问题
机构 * Universidad Politécnica de Madrid(马德里理工大学) ; IMDEA Materials Institute(IMDEA材料研究所)
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.LG
AI总结 本文提出了一种基于模型的强化学习方法,用于解决反应扩散问题中的初始边界值问题,通过引入新的奖励函数和随机策略梯度方法,实现了对热力和疾病传播的控制。
Comments 23 pages, 12 figures
Journal ref Optimal Control Applications and Methods, 45(6):2897-2914 (2024)
解缠连续时间潜在动力学:通过扩散偏移实现潜在SDE的可辨识性
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; The University of Melbourne(墨尔本大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.LG
AI总结 针对连续时间潜在随机微分方程模型的可辨识性问题,利用环境引起的扩散协方差偏移,证明在漂移无稀疏性假设下,对角扩散机制可识别潜在坐标至置换和缩放,并估计潜在解缠与因果图。
通过多视图对比学习从潜在动力学中提取控制方程
机构 * EPFL(瑞士联邦理工学院洛桑)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.LG
AI总结 提出DYSCO算法,利用多视图时间对比学习从噪声高维观测中联合恢复潜在轨迹和动力学方程,并通过结构化基函数实现符号恢复,理论保证强可识别性。
近似在线最优的高效基于模型的强化学习
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.LG
AI总结 本文提出基于状态跟随核方法的在线近似最优控制策略,通过局部小邻域近似值函数实现稳定性和最优性的高效控制。
动力学是学出来的,不是告诉的:零样本策略适应的潜在动力学几何半监督发现
机构 * Zhiming Xu(徐志明) ; Weitao Zhou(周伟涛) ; Xianghui Pan(潘向辉) ; Nanshan Deng(邓南山) ; Chengju Liu(刘成军) ; Qijun Chen(陈齐军) ; Chenpeng Yao(姚晨鹏)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.RO
AI总结 针对机器人强化学习中动力学变化导致策略失效的问题,提出基于对比学习的半监督方法,通过构建平滑、任务相关的潜在拓扑结构,实现零样本策略适应,在MuJoCo基准上优于参数中心方法。
Comments Proceedings of the 43rd International Conference on Machine Learning
观测密度对冲击主导流动中潜变量动态贝叶斯反演的影响
机构 * Department of Mechanical and Aerospace Engineering, University of Tennessee, Knoxville(田纳西大学机械与航空航天工程系)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.LG
AI总结 本文提出了一种非侵入式降阶建模框架,用于高效贝叶斯初始状态反演与不确定性量化,通过卷积自编码器和学习的潜空间前向算子结合,以提高冲击主导流动中潜变量动态的反演精度和效率。
基于平滑核的改进模型基于强化学习
机构 * School of Statistics, KLATASDS-MOE(统计学学院,KLATASDS-MOE) ; East China Normal University(华东师范大学)
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.LG
AI总结 本文提出了一种基于核平滑的模型驱动强化学习方法,利用mdp的平滑性,通过伯恩斯坦式探索奖励改进了有限时间 horizon 下的 regret 绑定。
Comments 38 pages, 5 figures
基于双 oracle 效率的模型驱动强化学习:在策略优化和离线估计中的应用
机构 * Laboratory for Information and Decision Systems(信息与决策系统实验室) ; Massachusetts Institute of Technology(麻省理工学院) ; The University of Hong Kong(香港大学)
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.LG
AI总结 本文提出一种新的算法,通过 log-barrier 和 log-determinant 正则化,在离线 oracle 效率的 episodic RL 中实现最优 regret 绑定,且 oracle 复杂度与状态和动作空间大小无关,适用于大规模和连续环境。
HALO:混合自动编码 locomotion 与学习的潜在动态、庞加莱映射和吸引区域
机构 * Caltech(加州理工学院) ; NC State University(北卡罗来纳州立大学)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.RO
AI总结 HALO通过从轨迹数据中学习低维潜在线性模型,结合庞加莱映射和吸引区域分析,提升混合动力系统稳定性与安全性。
Comments 20 pages, 8 figures
梦想飞翔:基于模型的强化学习用于基于视觉的无人机飞行
机构 * Robotics and Perception Group, Department of Informatics, University of Zurich(苏黎世大学信息学系机器人感知组)
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.RO
AI总结 本文提出基于模型的强化学习方法,通过像素观测实现无人机敏捷飞行,展示了在模拟和真实世界中的高效表现,推动了基于像素的自主飞行技术发展。
Comments 8 pages, 6 Figures, accepted to IEEE ICRA 2026
CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划
机构 * KAIST(韩国科学技术院)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.RO
AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。
Comments Project page: https://andrewwwj.github.io/clad
从表示角度更易于泛化动态建模
机构 * College of Software and Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University, China(软件学院,教育部符号计算与知识工程重点实验室,吉林大学,中国) ; School of Computing, Belfast, Northern Ireland, UK(computing 学院,贝尔法斯特,北爱尔兰,英国)
专题命中 模型式强化学习 :dynamics model(title,abstract);latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PDEDER方法,通过预训练语言模型和Lyapunov指数目标,实现更稳定的潜在空间动态建模,提升跨系统泛化能力。
兰格朗日流用于建模神经潜在动态
机构 * Caltech, Vision Lab(加州理工学院视觉实验室) ; The Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(自然与人工智能研究学院,哈佛大学) ; University of Amsterdam, Institute for Informatics(阿姆斯特丹大学信息学院)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.LG
AI总结 LangevinFlow通过引入物理先验和振荡器网络,有效建模神经群体的潜在动态及其未观测影响。
Comments Full version of the Cognitive Computational Neuroscience (CCN) 2025 poster
降阶控制与学习拉格朗日潜变量的动力学几何结构
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.RO
AI总结 本文提出了一种基于学习的结构保持降阶动态的潜控制框架,用于高维拉格朗日系统,通过量化建模误差来源推导稳定性与收敛性条件,并在模拟和现实系统中验证了控制器的准确性。
Comments 20 pages, 15 figures
基于扩散模型的强化学习用于版本信息年龄调度:平均与尾风险敏感控制
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院) ; Department of Mathematics and Information Technology, The Education University of Hong Kong(香港教育大学数学与信息技术系)
专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.AI
AI总结 本文提出基于扩散模型的强化学习方法,用于多用户无线系统中平均和尾风险敏感的版本信息年龄调度,通过分布性critic和扩散-based actor实现稳健的尾风险优化。
Comments 16 pages, 11 figures
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; PSTP Technoscience(PSTP科技公司)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.LG
机构 * UC San Diego(加州大学圣迭戈分校) ; RWTH Aachen University(亚琛工业大学) ; FZ Jülich(焦耳ich研究中心)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.LG
机构 * Cornell(康奈尔大学) ; Imperial College London(伦敦帝国学院) ; U Washington(华盛顿大学)
专题命中 模型式强化学习 :latent dynamics(title);分类 cs.LG