arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-06-26 至 2026-06-26 共收录 12 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 11 篇

2606.27326 2026-06-26 cs.LG cs.CV cs.RO 新提交 94%

Hallucination in World Models is Predictable and Preventable

世界模型中的幻觉是可预测且可预防的

Nicklas Hansen, Xiaolong Wang

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文发现世界模型中的幻觉源于状态-动作空间的低覆盖区域,提出三种可预测幻觉的信号,并开发覆盖感知采样和好奇心奖励方法,仅需50条真实轨迹即可微调模型适应新环境。

Comments Interactive paper, live demo, code, dataset, and models: https://www.nicklashansen.com/mmbench2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交 94%

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26969 2026-06-26 cs.AI cs.CL cs.CV 新提交 94%

Einstein World Models

爱因斯坦世界模型

Munachiso Samuel Nwadike, Zangir Iklassov, Ali Mekky, Zayd M. Kawakibi Zuhri, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP, Japan(日本理化学研究所革新智能综合研究中心) Tohoku University(东北大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出爱因斯坦世界模型(EWM),通过将视觉时间展开嵌入推理轨迹,使LLM能利用视觉化反事实事件增强复杂推理能力。

Comments 12 pages (9 without references), 2 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交 94%

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27325 2026-06-26 cs.CV 新提交 90%

Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model

并非所有动作都同等重要:重新思考灵巧世界模型的条件化

Zizhao Yuan, Zhengtu Liang, Taowen Wang, Qiwei Liang, Yichi Wang, Yunheng Wang, Yuetong Fang, Lusong Li, Zecui Zeng, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing University of Technology(北京工业大学) JD Explore Academy(京东探索研究院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 针对高自由度灵巧动作中不同分量重要性不均导致优化失衡的问题,提出DexAC-WM,通过动作标记化保留维度级语义,结合局部细化与全局调制对齐动作与视觉动态,并引入语义分支提供物体场景先验,显著提升视频预测的真实感和动作一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27277 2026-06-26 cs.AI cs.CV 新提交 88%

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

EO-WM: 一种用于概率性地球观测预测的物理信息世界模型

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。

Comments 28 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26922 2026-06-26 cs.RO cs.AI 新提交 88%

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模

Daosheng Qiu, Haozhuang Chi, Hao Su, Shu Long, Xinyue Miao, Yongle Dong, Wei Zhang

机构 * Hubei University(湖北大学) Nanyang Technological University(南洋理工大学) Osaka University(大阪大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO

AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26713 2026-06-26 cs.AI 新提交 88%

LithoDreamer: A Physics-Informed World Model for Multi-Stage Computational Lithography

LithoDreamer: 一种用于多阶段计算光刻的物理信息世界模型

Yuqi Jiang, Yumeng Liu, Zimu Li, Jinyuan Deng, Qian Jin, Yucheng Cui, Yu Li, Xunzhao Yin, Qi Sun, Cheng Zhuo

机构 * Zhejiang University(浙江大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 提出首个物理信息世界模型LithoDreamer,将光刻流程建模为决策驱动的多步演化系统,通过对比变分优化实现可解释干预,在正向演化和逆向规划中达到最优性能。

Comments Correspondence to: Qi Sun <qisunchn \at zju \dot edu \dot cn>

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Jul. 6-11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27364 2026-06-26 cs.CV 新提交 86%

PhysiFormer: Learning to Simulate Mechanics in World Space

PhysiFormer: 在世界空间中学习模拟力学

Yiming Chen, Yushi Lan, Andrea Vedaldi

专题命中 通用世界模型 :world model(abstract);world models(abstract);video world model(abstract);world model(abstract)

AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。

Comments Project page: https://yimingc9.github.io/physiformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26217 2026-06-26 cs.LG cs.CV cs.RO 新提交 83%

Fast LeWorldModel

快速LeWorldModel

Yuntian Gao, Xiangyu Xu

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26410 2026-06-26 cs.CV 新提交 81%

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

神经体素动力学:通过体素特征平流学习隐式3D物理

Zican Wang, Niloy Mitra

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出自监督框架,将视频预测瓶颈从2D提升到3D体素潜在空间,通过体素特征平流学习隐式3D物理,无需显式物理引擎,实现异构现象的统一模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 1 篇

2606.26321 2026-06-26 cs.RO 新提交 81%

KRVF: A Source-Aware Semantic Voxel World Representation for Edge Mobile Manipulation

KRVF:面向边缘移动操作的源感知语义体素世界表示

Runfeng Ling

机构 * The University of Manchester(曼彻斯特大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出KRVF,一种源感知语义体素表示,用于边缘移动操作,通过任务导向体素编码占用、语义、时间新鲜度和证据源,实现深度故障感知推理和映射-感知闭环。

Comments Technical report, 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏