arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-10 至 2026-08-10 共收录 16 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 11 篇

2608.07420 2026-08-10 cs.LG 新提交 95%

Beyond Myopic World Models: Long-Horizon End-to-End Training for Direct Future Prediction

超越近视世界模型:面向直接未来预测的长视端到端训练

Xinyi Li, Zaishuo Xia, Chenjie Hao, Yubei Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 该研究针对世界模型训练中局部与长视目标不匹配的问题,提出DPWM非递归架构,采用端到端长视终点目标训练,显著提升了连续控制等基准的长时预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06799 2026-08-10 cs.RO cs.CV 新提交 95%

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

前向预测足够吗?面向JEPA世界模型的物理状态 grounding

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06706 2026-08-10 cs.LG cs.AI 新提交 94%

Dueling World Models: Advantage-Style Action Channels for Common-Mode Distractor Rejection

对决世界模型:用于共模干扰项抑制的优势式动作通道

Jiazhuo Li, Yiming Fei, Zhiruo Zhou, Heikichi Hayashi

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 该研究提出对决世界模型,通过在潜在动态中减去动作预测的平均效应来抑制共模干扰项,无需额外机制,在多个任务中可恢复智能体自身效应,适用于各类动作条件世界模型。

Comments 17 pages, 6 figures, 11 tables. Includes supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06544 2026-08-10 cs.AI cs.CV cs.LG 新提交 94%

TaskSense: Focusing on What Matters in World Models

TaskSense:聚焦世界模型中的关键内容

SM Mazharul Islam, Manfred Huber

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 TaskSense是一种以任务为中心的世界建模框架,通过可微随机空间注意力机制结合辅助逆动力学目标,提升了视觉控制模型对干扰环境的鲁棒性,在Distracting Control Suite上性能优于DreamerV3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00559 2026-08-10 cs.AI 版本更新 93%

Social World Models

社交世界模型

Xuhui Zhou, Jiarui Liu, Akhila Yerukola, Hyunwoo Kim, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学语言技术研究所) NVIDIA, Santa Clara, CA, USA(英伟达)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出社交世界模型(SWMs)及结构化社交世界表示形式(S3AP),通过显式建模隐藏心理状态提升AI在社交推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07265 2026-08-10 math.OC 新提交 93%

Metric Non-Collapse in Learned World Models for Control: Approximation Theory, Finite-Sample Geometric Guarantees, and Deterministic Planning Transfer

用于控制的学习型世界模型中的度量非崩溃:逼近理论、有限样本几何保证与确定性规划迁移

Alain Bensoussan, Minh-Nhat Phung, Minh-Binh Tran

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 该研究为非线性确定性控制系统的学习型世界模型构建三部分数学理论,含逼近理论、有限样本几何保证及确定性规划迁移方法,通过数值实验验证了相关方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 93%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 92%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world-model(abstract)

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07107 2026-08-10 cs.AI 新提交 92%

MemWM: Memory-Augmented Text-Based World Model

MemWM:记忆增强的基于文本的世界模型

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究中心) Zhejiang University(浙江大学) Technical University of Munich (TUM)(慕尼黑工业大学) TU Berlin(柏林工业大学) Kiel University(基尔大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world-model(abstract)

AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07301 2026-08-10 cs.LG 新提交 91%

From Optimal Actions to World Models: Identifiability of Transition Kernels in Discounted MDPs

从最优动作到世界模型:折扣马尔可夫决策过程中转移核的可识别性

Neal Batra

专题命中 通用世界模型 :world model(title);world models(title);world model(title);world models(title)

AI总结 该研究探讨折扣马尔可夫决策过程中仅从最优动作可恢复的转移概率信息,明确了不同形式奖励对转移核可识别性的影响,证明了转移核的可识别条件及相关维度特性。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07409 2026-08-10 cs.CV 新提交 90%

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

UniJEPA:面向任务无关视觉世界建模的统一联合嵌入预测架构

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 UniJEPA是统一JEPAs,共享潜在空间联合学习图像级与视频级预测,抗坍塌,经后训练可零样本规划,在多基准上性能相当或更优,规划速度更快。

Comments 10 pages, 7 figures; Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2608.07408 2026-08-10 cs.CV cs.LG 新提交 96%

Addressable Memory for Video World Models

视频世界模型的可寻址内存

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

机构 * NVIDIA(英伟达) Princeton University(普林斯顿大学) University of Toronto(多伦多大学) Vector Institute(矢量研究院)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 针对交互式视频世界模型超出训练时序后内存寻址失效及压缩缓存破坏内存的问题,提出无训练框架 WorldTrace,含两种压缩方法,在新基准 LoopBench 上分别提升时序一致性 15.5%、情景回忆 19.5%。

Comments Project page: https://research.nvidia.com/labs/sil/projects/WorldTrace/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 1 篇

2509.06296 2026-08-10 cs.RO cs.AI 版本更新 60%

Learning to Walk With Less: A Dyna-Style Approach to Quadrupedal Locomotion

少数据驱动的四足机器人行走学习:一种Dyna式方法

Francisco Affonso, Felipe Tommaselli, João H. Aléssio, Vivian S. Medeiros, Mateus V. Gasparino, Girish Chowdhary, Marcelo Becker

专题命中 具身与机器人 :model-based reinforcement learning(abstract);分类 cs.AI、cs.RO;predictive model(abstract)

AI总结 该研究提出一种Dyna式方法,结合基于模型的技术改进PPO,在Unitree Go1等四足机器人模拟实验中,大幅减少收敛所需模拟步数与训练时间,同时保持策略性能。

Comments Accepted for publication in IEEE Access. 13 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 2 篇

2608.06595 2026-08-10 cs.LG cs.AI 新提交 56%

Flowing Through States: Neural ODE Regularization for Reinforcement Learning

状态间的流动:用于强化学习的神经常微分方程正则化方法

Mohamed Ghanem, Bernd Finkbeiner

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Technical University of Munich(慕尼黑工业大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出一种基于神经ODE的正则化方法,将其集成到Actor-Critic算法中,在A2C的Atari基准和PPO的网格世界环境中显著提升了强化学习智能体的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00669 2026-08-10 cs.LG math.DS 版本更新 50%

Embedded Variational Neural Stochastic Differential Equations for Learning Heterogeneous Dynamics

嵌入变分神经随机微分方程用于学习异质动态

Sandeep Kumar Samota, Reema Gupta, Snehashish Chakraverty

机构 * National Institute of Technology, Rourkela, India(印度国立理工学院鲁尔克拉分校) Poverty Alleviation Research Centre, National Institute of Technology, Rourkela, India(印度国立理工学院鲁尔克拉分校扶贫研究中心)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 本文提出V-NSDE模型,结合神经SDE的动态表达与VAE的生成能力,用于学习异质动态,通过编码器和解码器处理时间序列数据,提升复杂模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真与规划 1 篇

2506.19592 2026-08-10 cs.AI cs.RO 56%

Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning

Harisankar Babu, Philipp Schillinger, Tamim Asfour

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 仿真与规划 :environment model(abstract);分类 cs.AI、cs.RO

Comments Accepted at IEEE CASE 2025, 8 pages, 8 figures

Journal ref 2025 IEEE 21st International Conference on Automation Science and Engineering (CASE), 2025, pp. 1701-1708

详情

展开后加载摘要…

URL PDF HTML 收藏