arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-11 至 2026-08-11 共收录 3 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 模型式强化学习 3 篇

2505.11578 2026-08-11 cs.LG cs.AI physics.comp-ph 70%

Physics Consistency and Latent Dynamics in Spatiotemporal Physics Field Generation

基于混合Mamba-Transformer的时空场生成

Peimian Du, Jiabin Liu, Xiaowei Jin, Wangmeng Zuo, Hui Li

专题命中 模型式强化学习 :latent dynamics(title);分类 cs.AI、cs.LG

AI总结 本文提出基于混合Mamba-Transformer架构的时空物理场生成模型,并通过物理信息微调机制有效减少物理误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26836 2026-08-11 cs.LG cs.SY eess.SY 版本更新 56%

Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics

具有不确定性的预测安全过滤器用于概率神经网络动态

Bernd Frauenknecht, Lukas Kesper, Daniel Mayfrank, Henrik Hose, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering (DSME), RWTH Aachen University(机械工程数据科学研究所(DSME),亚琛工业大学) Institute of Climate and Energy Systems (ICE), Energy Systems Engineering (ICE-1), Forschungszentrum Jülich GmbH(气候与能源系统研究所(ICE),能源系统工程(ICE-1),焦耳研究中心有限公司)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG;dynamics model(abstract)

AI总结 本文提出了一种具有不确定性的预测安全过滤器(UPSi),通过将未来结果建模为可达集,利用概率集合(PE)神经网络动态模型提供严格的安全预测,从而在模型基于强化学习(MBRL)中提升探索安全性,同时保持与标准MBRL相当的性能。

Comments Reinforcement Learning Journal, 2026. Reinforcement Learning Conference (RLC), Montréal, August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02363 2026-08-11 cs.LG stat.ML 版本更新 50%

Minimax-Optimal Policy Regret in Partially Observable Markov Games

部分可观测马尔可夫博弈中的极小化最优策略遗憾

Raman Arora

机构 * Raman Arora

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 针对部分可观测马尔可夫博弈,提出基于epoch的乐观最大似然算法,实现了与聚合Eluder维数相关的$ ilde{O}(\sqrt{T})$策略遗憾,并证明了匹配的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏