arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 25 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 模型式强化学习 25 篇

2604.25416 2026-07-28 cs.LG 版本更新 82%

Biased Dreams: Limitations to Epistemic Uncertainty Quantification in Latent Dynamics Models

有偏的梦境:潜在空间模型中知识不确定性量化限制

Julia Berger, Bernd Frauenknecht, Sebastian Trimpe, Bastian Leibe

专题命中 模型式强化学习 :latent dynamics(title,abstract);dynamics model(title,abstract);model-based reinforcement learning(abstract);分类 cs.LG

AI总结 研究探讨了潜在空间模型中知识不确定性量化存在的偏差问题,指出潜在过渡偏向于高代表性的区域,导致环境动态差异在潜在空间中不显现,影响不确定性估计的可靠性。

Comments Reinforcement Learning Conference (RLC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21816 2026-06-23 cs.RO 版本更新 76%

Self-Curriculum Model-based Reinforcement Learning for Shape Control of Deformable Linear Objects

基于自课程模型的可变形线性物体形状控制强化学习

Zhaowei Liang, Song Wang, Zhao Jin, Shirui Wu, Dan Wu

机构 * Department of Mechanical Engineering, Tsinghua University(清华大学机械工程系)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);分类 cs.RO;dynamics model(abstract)

AI总结 提出两阶段框架,结合基于模型强化学习与在线视觉伺服,通过自课程目标生成机制实现可变形线性物体高效精确的形状控制,在仿真和真实任务中优于主流方法。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14617 2026-06-10 cs.LG cs.AI 版本更新 76%

Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes

离散动作非马尔可夫奖励决策过程中基于模型的强化学习

Alessandro Trapasso, Luca Iocchi, Fabio Patrizi

机构 * Fondazione Bruno Kessler(布雷诺·科塞拉基金会) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title);model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 提出QR-MAX算法,通过奖励机分解马尔可夫转移学习与非马尔可夫奖励处理,首次在离散NMRDP中获得PAC收敛到ε-最优策略的多项式样本复杂度,并扩展至连续状态空间。

Comments Accepted at IJCAI-ECAI 2026. 19 pages, 32 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12676 2026-07-16 cs.LG 版本更新 74%

Disentangled Latent Dynamics Manifold Fusion for Solving Parameterized PDEs

解耦潜在动态流形融合用于求解参数化偏微分方程

Zhangyong Liang, Huanhuan Gao

机构 * National Center for Applied Mathematics, Tianjin University(应用数学国家中心,天津大学)

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.LG

AI总结 本文提出DLDMF框架,通过解耦空间、时间和参数,利用连续时间潜在方法和动态流形融合机制,提升参数泛化和时间外推的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17709 2026-08-06 cs.LG cs.AI 版本更新 60%

Bi-Level Reinforcement Learning Pathway for Sim-to-Real Optimality

面向仿真到真实最优性的双层强化学习路径

Akhil S Anand, Shambhuraj Sawant, Paavo Parmas, Jasper Hoffmann, Dirk Reinhardt, Sebastien Gros

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG;simulation model(abstract)

AI总结 针对仿真到真实RL的目标不匹配问题,提出双层RL方法,通过分析策略对仿真参数的敏感性,结合真实策略性能梯度调整仿真模型,提升真实环境下的策略性能。

Journal ref RLJ, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14232 2026-07-02 cs.LG cs.AI cs.CV 版本更新 60%

KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning

KAGE-Bench:面向强化学习的已知轴视觉泛化快速评估

Egor Cherepanov, Daniil Zelezetsky, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX, Moscow, Russia(AXXX,莫斯科,俄罗斯) MIRAI, Moscow, Russia(MIRAI,莫斯科,俄罗斯)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG、cs.CV

AI总结 提出KAGE-Bench基准,通过解耦视觉轴独立评估像素策略在视觉分布偏移下的泛化能力,发现背景和光度偏移严重影响性能,而智能体外观偏移影响较小。

Comments 41 pages, 47 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20939 2026-08-04 eess.SY cs.AI cs.RO cs.SY 版本更新 58%

Interaction Dynamics Modeling and Predictive Control for Safe Steerable Catheter--Tissue Interaction

用于安全可控导管-组织相互作用的相互作用动力学建模与预测控制

Yongyan Cao

机构 * Voryx Robotic LLC

专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.AI、cs.RO

AI总结 研究安全可控导管-组织相互作用动力学问题,通过建立模型、采用部分物理前馈、预测优化器及增强卡尔曼滤波器等方法,实现无偏移运动调节与接触力安全,模拟结果验证了方法有效性,硬件验证待开展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26836 2026-08-11 cs.LG cs.SY eess.SY 版本更新 56%

Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics

具有不确定性的预测安全过滤器用于概率神经网络动态

Bernd Frauenknecht, Lukas Kesper, Daniel Mayfrank, Henrik Hose, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering (DSME), RWTH Aachen University(机械工程数据科学研究所(DSME),亚琛工业大学) Institute of Climate and Energy Systems (ICE), Energy Systems Engineering (ICE-1), Forschungszentrum Jülich GmbH(气候与能源系统研究所(ICE),能源系统工程(ICE-1),焦耳研究中心有限公司)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG;dynamics model(abstract)

AI总结 本文提出了一种具有不确定性的预测安全过滤器(UPSi),通过将未来结果建模为可达集,利用概率集合(PE)神经网络动态模型提供严格的安全预测,从而在模型基于强化学习(MBRL)中提升探索安全性,同时保持与标准MBRL相当的性能。

Comments Reinforcement Learning Journal, 2026. Reinforcement Learning Conference (RLC), Montréal, August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19849 2026-08-04 cs.AI cs.LG 版本更新 56%

Near-Optimal Reinforcement Learning for Constrained Recurrence Objectives

具有$ω$-正则目标和约束的强化学习

Dominik Wagner, Leon Witzman, Luke Ong

机构 * NTU Singapore(南洋理工大学)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合$ω$-正则目标与约束的强化学习算法,以解决安全性和性能之间的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22442 2026-07-17 cs.LG cs.AI 版本更新 56%

Fully Offline Reinforcement Learning

完全离线强化学习

Mattie Fellows, Clarisse Wibault, Uljad Berdica, Johannes Forkel, Maike Osborne, Jakob N. Foerster

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 研究完全离线强化学习问题,提出基于贝叶斯模型的SOReL方法及扩展的TOReL方法,通过学习动力学后验、预测不确定性估计策略值实现完全离线超参数选择,建立实用且有理论基础的完全离线强化学习框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17519 2026-07-02 cs.LG cs.AI 版本更新 56%

TANDEM: Temporal Attention-guided Neural Differential Equations for Missingness in Time Series Classification

TANDEM:基于缺失数据的时序分类的时序注意力引导神经微分方程

YongKyung Oh, Dong-Young Lim, Sungil Kim, Alex Bui

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TANDEM框架,通过注意力机制整合观测数据、插值控制路径和连续潜在动态,提升时序分类中缺失数据的处理能力,实验显示其优于现有方法。

Comments CIKM '25: Proceedings of the 34th ACM International Conference on Information and Knowledge Management. https://doi.org/10.1145/3746252.3760996

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20248 2026-07-28 cs.CY cs.AI cs.HC cs.MA 版本更新 53%

Stability of AI Governance Systems: A Coupled Dynamics Model of Public Trust and Social Disruptions

AI治理系统的稳定性:公众信任与社会动荡的耦合动力学模型

Jiaqi Lai, Hou Liang, Weihong Huang

专题命中 模型式强化学习 :dynamics model(title);分类 cs.AI、cs.MA

AI总结 本文提出耦合动力学模型,分析公众信任与社会动荡的相互作用,揭示信任崩溃的临界条件及网络结构对治理失效的影响。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02762 2026-07-03 cs.LG 版本更新 53%

On the Sample Efficiency of Inverse Dynamics Models for Semi-Supervised Imitation Learning

关于半监督模仿学习中逆动力学模型样本效率的研究

Sacha Morin, Moonsub Byeon, Alexia Jolicoeur-Martineau, Sébastien Lachapelle

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Samsung AI Lab, Montreal(蒙特利尔三星人工智能实验室)

专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.LG

AI总结 本文分析半监督模仿学习中逆动力学模型(IDM)的样本效率优势,归因于IDM假设复杂度低且随机性小,并基于此改进LAPO算法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25691 2026-06-24 cs.RO 版本更新 53%

Learning-Based Dynamics Modeling and Robust Control for Tendon-Driven Continuum Robots

基于学习的动力学建模与鲁棒控制的腱驱动连续机器人

Ziqing Zou, Ke Qiu, Fei Wang, Haojian Lu, Rong Xiong, Yue Wang

机构 * Department of Control Science and Engineering, Zhejiang University(控制科学与工程系,浙江大学)

专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.RO

AI总结 本文提出一种可微学习框架,结合高保真动力学建模与鲁棒神经控制,通过GRU模型抑制长周期自回归预测中的误差,实验证明在腱驱动连续机器人上实现高精度跟踪和强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05352 2026-06-16 cs.LG math.SG 版本更新 53%

Smoothness Errors in Dynamics Models and How to Avoid Them

动力学模型中的平滑误差及如何避免

Edward Berman, Luisa Li, Jung Yeon Park, Robin Walters

专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.LG

AI总结 本文研究了不同GNN在动力学建模中的平滑效应,证明了单位ary卷积对这类任务有害,并提出放松的单位ary卷积以平衡平滑性保留与物理系统需求。

Comments Ecstatic to share relaxed unitary mesh convolutions with the community :D! This version contains the camera ready for ICML 2026. Send me an email with your thoughts! I love getting mail :^)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12763 2026-08-19 cs.LG math.DS math.OC q-bio.NC 版本更新 50%

Center-Manifold Reduction of Learning at Bifurcations: Interference and Rich Learning in Recurrent Neural Networks

状态空间NTK在接近分岔点时的坍缩

James Hazelden, Eric Shea-Brown

机构 * University of Washington(华盛顿大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 研究通过经验状态空间神经 tangent 核(sNTK)分析梯度下降在分岔点附近的动态,发现分岔点主导并简化了学习过程,通过分解sNTK揭示了高维递归系统的学习几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06323 2026-08-19 cs.LG 版本更新 50%

How (Not) to Hybridize Neural and Mechanistic Models for Epidemiological Forecasting

如何(不)将神经模型与机制模型混合用于流行病预测

Yiqi Su, Ray Lee, Jiaming Cui, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 针对流行病预测中神经-机制混合模型在部分可观测和非平稳动态下失效的问题,提出通过显式分解感染序列的多尺度结构作为控制信号,驱动受控神经ODE与流行病模型耦合,实现最优预测和时变参数推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19612 2026-08-14 cs.LG cs.AI cs.RO 版本更新 50%

Safe Exploration via Policy Priors

通过策略先验进行安全探索

Manuel Wendl, Yarden As, Manish Prajapat, Anton Pollak, Stelian Coros, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 模型式强化学习 :分类 cs.AI、cs.LG、cs.RO;dynamics model(abstract)

AI总结 提出SOOPER方法,利用次优但保守的策略先验,结合概率动力学模型进行乐观探索和悲观回退,在保证安全的同时收敛到最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02363 2026-08-11 cs.LG stat.ML 版本更新 50%

Minimax-Optimal Policy Regret in Partially Observable Markov Games

部分可观测马尔可夫博弈中的极小化最优策略遗憾

Raman Arora

机构 * Raman Arora

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 针对部分可观测马尔可夫博弈,提出基于epoch的乐观最大似然算法,实现了与聚合Eluder维数相关的$ ilde{O}(\sqrt{T})$策略遗憾,并证明了匹配的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00669 2026-08-10 cs.LG math.DS 版本更新 50%

Embedded Variational Neural Stochastic Differential Equations for Learning Heterogeneous Dynamics

嵌入变分神经随机微分方程用于学习异质动态

Sandeep Kumar Samota, Reema Gupta, Snehashish Chakraverty

机构 * National Institute of Technology, Rourkela, India(印度国立理工学院鲁尔克拉分校) Poverty Alleviation Research Centre, National Institute of Technology, Rourkela, India(印度国立理工学院鲁尔克拉分校扶贫研究中心)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 本文提出V-NSDE模型,结合神经SDE的动态表达与VAE的生成能力,用于学习异质动态,通过编码器和解码器处理时间序列数据,提升复杂模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15363 2026-07-24 stat.ML cs.LG 版本更新 50%

Non-Stationary Functional Bilevel Optimization

非平稳函数双层优化

Jason Bohne, Ieva Petrulionyte, Michael Arbel, Julien Mairal, Paweł Polak

机构 * Applied Mathematics and Statistics, Stony Brook University, Stony Brook, NY, USA(应用数学与统计学系,史泰文布鲁克大学) Inria, CNRS, Grenoble INP, LJK, Université Grenoble Alpes(法国国家信息与自动化技术研究院、国家科学研究中心、格勒诺布尔INP、LJK、格勒诺布尔阿尔卑斯大学)

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.LG

AI总结 SmoothFBO是首个在非平稳函数双层优化中具有理论保证和实际可扩展性的算法,通过时间平滑的随机超梯度估计器提升稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01475 2026-07-20 eess.SY cs.LG cs.SY 版本更新 50%

Comparative Field Deployment of Reinforcement Learning and Model Predictive Control for Residential HVAC

强化学习与模型预测控制在住宅暖通空调中的现场对比部署

Ozan Baris Mulayim, Elias N. Pergantis, Levi D. Reyes Premer, Bingqing Chen, Guannan Qu, Kevin J. Kircher, Mario Bergés

机构 * College of Engineering, Carnegie Mellon University, 5000 Forbes Ave, Pittsburgh, PA 15213, USA Wilton E. Scott Institute for Energy Innovation, Carnegie Mellon University, 5000 Forbes Ave, Pittsburgh, PA 15213, USA Center for High Performance Buildings, Purdue University, 177 S Russell St, West Lafayette, IN 47907, USA Trane Technologies, Residential R\&D Group, 6200 Troup Hwy, Tyler, TX 75707, USA Bosch Center for Artificial Intelligence

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG

AI总结 研究对比强化学习与模型预测控制应用于住宅暖通空调的情况,通过在寒冷气候住宅中各部署一个月,对比两者节能效果、居住者舒适度及数据需求等,发现RL节能略优、部署工作量少但面临初始化等困难。

Comments 26 pages, 9 figures, 5 tables. Under review for Applied Energy

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18606 2026-07-01 quant-ph cs.LG 版本更新 50%

Quantum Bayesian Networks Can Speed up Reinforcement Learning in Partially Observable Environments

量子贝叶斯网络可以加速部分可观察环境中的强化学习

Gilberto Cunha, Alexandra Ramôa, André Sequeira, Michael de Oliveira, Luís Barbosa

机构 * High-Assurance Software Laboratory (HASLab), INESC TEC, Portugal(高可信软件实验室(HASLab),INESC TEC,葡萄牙) Department of Computer Science, University of Minho, Portugal(米尼奥大学计算机科学系,葡萄牙) International Iberian Nanotechnology Laboratory (INL), Portugal(国际伊比利亚纳米技术实验室(INL),葡萄牙)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG

AI总结 提出量子贝叶斯强化学习(QBRL),利用量子拒绝采样和幅度放大加速稀疏贝叶斯网络上的推理,实现部分可观察环境中基于模型的强化学习,在稀疏动力学环境下获得亚二次加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10137 2026-06-17 cs.LG math.DG stat.CO stat.ML 版本更新 50%

Variational autoencoders with latent high-dimensional steady geometric flows for dynamics

具有潜在高维稳态几何流的变分自编码器用于动力学

Andrew Gracyk

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 提出VAE-DLM方法,在潜在空间中引入稳态几何流,通过物理信息方法求解高维流,增强潜在表示的表达能力,在PDE型数据上降低OOD误差15%-35%。

Comments Edits and improved tables

Journal ref 23rd International Conference of Numerical Analysis and Applied Mathematics (ICNAAM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05857 2026-06-10 cs.LG 版本更新 50%

Offline Reinforcement Learning for Rotation Profile Control in Tokamaks

托卡马克旋转剖面控制的离线强化学习

Rohit Sonker, Hiro Josep Farre Kaga, Jiayu Chen, Andrew Rothstein, Ian Char, Ricardo Shousha, Egemen Kolemen, Jeff Schneider

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Princeton University(普林斯顿大学) Princeton Plasma Physics Lab(普林斯顿等离子物理实验室) The University of Hong Kong(香港大学) Lila Sciences

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG

AI总结 针对托卡马克等离子体旋转剖面控制难题,提出基于历史数据的离线强化学习方法,利用概率模型生成轨迹训练策略,并在DIII-D托卡马克上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏