Autoregressive Dynamics Models for Offline Policy Evaluation and Optimization
专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.AI、cs.LG
Comments ICLR 2021. 17 pages
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.AI、cs.LG
Comments ICLR 2021. 17 pages
专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.LG、cs.RO
Comments Accepted at 4th Conference on Robot Learning (CoRL 2020)
专题命中 模型式强化学习 :dynamics model(title);分类 cs.LG、cs.CV、cs.RO
Comments Accepted at the 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.LG、cs.RO
Comments IEEE Robotics and Automation Letters, presented at International Conference on Intelligent Robots and Systems (IROS 2020)
专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at CoRL 2019
专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.LG、cs.CV
Comments short paper (4 pages, two figures), accepted to NeurIPS 2019 Graph Representation Learning workshop
专题命中 模型式强化学习 :dynamics model(title);分类 cs.LG、cs.RO;predictive model(abstract)
具有不确定性的预测安全过滤器用于概率神经网络动态
机构 * Institute for Data Science in Mechanical Engineering (DSME), RWTH Aachen University(机械工程数据科学研究所(DSME),亚琛工业大学) ; Institute of Climate and Energy Systems (ICE), Energy Systems Engineering (ICE-1), Forschungszentrum Jülich GmbH(气候与能源系统研究所(ICE),能源系统工程(ICE-1),焦耳研究中心有限公司)
专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG;dynamics model(abstract)
AI总结 本文提出了一种具有不确定性的预测安全过滤器(UPSi),通过将未来结果建模为可达集,利用概率集合(PE)神经网络动态模型提供严格的安全预测,从而在模型基于强化学习(MBRL)中提升探索安全性,同时保持与标准MBRL相当的性能。
Comments Reinforcement Learning Journal, 2026. Reinforcement Learning Conference (RLC), Montréal, August 2026
状态间的流动:用于强化学习的神经常微分方程正则化方法
机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) ; Technical University of Munich(慕尼黑工业大学)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出一种基于神经ODE的正则化方法,将其集成到Actor-Critic算法中,在A2C的Atari基准和PPO的网格世界环境中显著提升了强化学习智能体的性能。
想象如何改变:用于变化描述的显式过程建模
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Department of Computer Science, Aalto University(阿alto大学计算机科学系) ; Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.CV
AI总结 ProCap通过动态过程建模改进变化描述,利用关键帧和可学习查询提升描述准确性与效率。
Comments Accepted to ICLR 2026. Code and models are available at https://github.com/BlueberryOreo/ProCap
Journal ref International Conference on Learning Representations (ICLR), 2026
基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现
机构 * Imperial College London(伦敦帝国学院)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。
Comments 33 pages, 13 figures, 10 tables
具有$ω$-正则目标和约束的强化学习
机构 * NTU Singapore(南洋理工大学)
专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种结合$ω$-正则目标与约束的强化学习算法,以解决安全性和性能之间的权衡问题。
随机波动率下的涌现潜态计算
机构 * Temple University(天普大学) ; Dickinson College(迪金森学院)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 研究序列模型在部分可观测下如何表示潜在随机动态,发现在随机波动率设置中有两阶段计算,Transformer中潜态可解码性在特定阶段出现,输出头替换揭示部分退化原因,为机械可解释性提供有用基准。
LatentChem: 从文本思维链到化学推理中的潜在思考
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 针对化学大语言模型依赖显式思维链导致的模态不匹配问题,提出LatentChem推理接口,通过连续思维向量和动态感知解耦化学逻辑与语言生成,在ChemCoTBench上以59.88%非平局胜率超越强CoT基线,并实现平均10.84倍推理步骤开销降低(5.96倍实际加速)。
Comments Accepted at ICML 2026
完全离线强化学习
专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG
AI总结 研究完全离线强化学习问题,提出基于贝叶斯模型的SOReL方法及扩展的TOReL方法,通过学习动力学后验、预测不确定性估计策略值实现完全离线超参数选择,建立实用且有理论基础的完全离线强化学习框架。
局部运动至关重要:一种用于从视频中进行强化学习预训练的解构-重组范式
机构 * Beijing Jiaotong University(北京交通大学) ; Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG;dynamics model(abstract)
AI总结 提出解构-重组范式(DRP),通过解构全局运动为原子动作学习局部运动表示,再重组以加速下游策略学习,在机器人控制任务中显著提升样本效率。
Comments 20 pages, 16 figures
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pages 9859-9868
TANDEM:基于缺失数据的时序分类的时序注意力引导神经微分方程
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Ulsan National Institute of Science and Technology(蔚山科学技术院)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出TANDEM框架,通过注意力机制整合观测数据、插值控制路径和连续潜在动态,提升时序分类中缺失数据的处理能力,实验显示其优于现有方法。
Comments CIKM '25: Proceedings of the 34th ACM International Conference on Information and Knowledge Management. https://doi.org/10.1145/3746252.3760996
直接优势估计:可扩展且样本高效的深度强化学习
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG;dynamics model(abstract)
AI总结 针对直接优势估计(DAE)在部分可观测域和高维观测下的局限性,本文扩展其理论框架并引入离散潜动态模型降低计算复杂度,在Arcade学习环境中验证了DAE的可扩展性和样本效率。
Comments Accepted at RLC2026
研究潜在神经活动动力学的机器学习方法
机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) ; Department of Computer Science, Cornell University(康奈尔大学计算机科学系) ; Department of Neurobiology and Behavior, Cornell University(康奈尔大学神经生物学与行为学系) ; Department of Ecology and Evolutionary Biology, Cornell University(康奈尔大学生态学与进化生物学系) ; School of Computer Science and Artificial Intelligence, Foshan University(佛山大学计算机科学与人工智能学院)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 综述从状态空间模型到深度生成模型的潜在变量模型,涵盖单区域动力学、多区域通信和行为对齐建模,并讨论大规模神经基础模型及未来挑战。
Comments Accepted by IJCAI 2026 survey track
所有模型都是错的,知道哪里有用:强化学习中的模型不确定性
机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) ; Robotics Institute Germany (RIG)(德国机器人研究所) ; Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) ; NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)
专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.LG;dynamics model(abstract)
AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。
循环语言模型中测试时可扩展潜在推理的稳定循环动力学
机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,南京,中国) ; School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) ; School of Intelligence Science and Technology, Nanjing University, Nanjing, China(智能科学与技术学院,南京大学,南京,中国)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 提出STARS训练框架,通过雅可比谱半径正则化约束潜在状态趋近渐近稳定不动点,解决循环语言模型深度递归时性能崩溃问题,实现可靠的测试时扩展并提升峰值性能。
Comments ICML 2026
潜在Q-屏障屏蔽用于安全上下文强化学习
机构 * University of Virginia(弗吉尼亚大学)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 提出一种潜在Q-屏障屏蔽方法,通过学习上下文表示、潜在动力学和集成成本评论家,在部署时无需参数更新即可根据剩余预算和预测未来成本过滤或软重加权候选动作,从而改善安全上下文强化学习在分布外转移下的奖励-安全权衡。
生成式OOD正则化的基于模型的策略优化
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Abiomed(阿比omed)
专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG
AI总结 提出GORMPO算法,利用生成式密度估计在稀疏状态-动作空间中限制策略更新到高密度区域,以解决离线强化学习中的分布外动作问题,并在真实医疗数据集和离线RL数据集上优于基线方法。
从稀疏横截面快照中学习个体动力学
机构 * Statistics and Machine Learning, German Center for Neurodegenerative Diseases (DZNE)(统计与机器学习,德国神经退行性疾病中心(DZNE)) ; MediaTek Research(联发科技研究) ; Department of Mechanical Engineering & AI Institute in Dynamic Systems, University of Washington, Seattle(机械工程与人工智能动态系统研究所,华盛顿大学,西雅图) ; DZNE & University of Bonn, Bonn, Germany and University of Cambridge, Cambridge, United Kingdom(DZNE与波恩大学,波恩,德国和剑桥大学,剑桥,英国)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 提出CADENCE框架,通过将潜在动力学锚定到静态个体上下文,从孤立快照中恢复连续个体轨迹,并证明单时间点轨迹推断的可识别性。
两次序贯蒙特卡洛用于树搜索
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Twice Sequential Monte Carlo Tree Search(TSMCTS)方法,通过减少方差和缓解路径退化问题,提高了在离散和连续环境中比SMC基线和现代MCTS版本更优的性能,同时在顺序计算上具有良好的扩展性。
离线强化学习中的通用时间 horizon 模型
机构 * Interdisciplinary Program in Artificial Intelligence and ASRI, Seoul National University(人工智能交叉学科项目及首尔国立大学ASRI) ; Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通用时间 horizon 模型,通过灵活预测任意时间 horizon 的未来状态,改进了传统几何时间 horizon 模型在远期状态建模上的不足,并在100个OGBench任务中验证了其有效性。
Comments ICML 2026
特征根分析与线性时间序列预测中的正则化
机构 * Bosch Center for AI (BCAI) & Bosch (China) Investment Co., Ltd.(博世人工智能中心(BCAI)及博世(中国)投资有限公司) ; Robert Bosch GmbH(罗伯特·博世有限公司)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 本文研究线性模型在时间序列预测中的特征根作用,提出鲁棒根重构策略,通过实验验证了其有效性,实现了高性能的预测模型。
Comments Accepted for publication at ICLR 2026
去偏的基于模型的表示用于样本高效的连续控制
机构 * Tencent Hunyuan(腾讯文言) ; McGill University(麦吉尔大学) ; School of Computer Science, Peking University(北京大学计算机学院)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DR.Q算法,通过最大化当前状态-动作对表示与下一状态之间的互信息,并采用衰减优先经验回放,以减少表示和actor-critic学习中的偏差,从而在连续控制任务中取得优于现有方法的性能。
Comments ICML 2026
RopeDreamer:一种用于柔性可变形线性物体动态的运动学递归状态空间模型
机构 * Technical University of Darmstadt(德意志技术大学) ; School of Electrical and Computer Engineering, Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学电气与计算机工程学院) ; Instituto de Pesquisas Eldorado(Eldorado研究所) ; Honda Research Institute Europe GmbH(本田欧洲研究院) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; Robotics Institute Germany (RIG)(德国机器人研究所) ; Centre for Cognitive Science(认知科学研究中心) ; Artificial Ingelligence Lab, Recod.ai(Recod.ai人工智能实验室)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.RO;dynamics model(abstract)
AI总结 本文提出结合递归状态空间模型与四元数运动链表示的潜变量框架,用于预测柔性可变形线性物体的状态,通过约束物理有效流形减少自交和非物理变形,提升长周期预测性能。
PINN-Cast:探索连续深度NODE在Transformer中的作用及物理信息损失作为短期天气预报中的软物理约束
机构 * University of New South Wales(新南威尔士大学)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG、cs.CV
AI总结 本文提出连续深度Transformer编码器,结合Neural ODE动态和物理信息损失,提升短期天气预报的准确性与物理一致性。
Comments 14 pages, 4 Figures, Accepted in 26th International Conference on Computational Science (ICCS 2026)