arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-07 至 2026-08-07 共收录 26 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 19 篇

2608.05371 2026-08-07 cs.LG 新提交 95%

Quantum-Structured World Models (QSWMs) for Predictive Latent Dynamics

用于预测潜在动力学的量子结构化世界模型(QSWMs)

Hailong Jiang, Emran Hossain, Feng Yu, Jianfeng Zhu, Guilin Zhang, Wulan Guo

机构 * Youngstown State University(扬斯敦州立大学) Kent State University(肯特州立大学) George Washington University(乔治·华盛顿大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出量子结构化世界模型(QSWMs),研究量子启发结构对世界建模的作用,在基本元胞自动机上评估其变体,发现复值QSWM局部预测潜力良好但类密度矩阵变体存在长时序预测局限。

Comments 19 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 95%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05799 2026-08-07 cs.RO cs.CV 新提交 94%

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?

XEWorld:基于动作的世界模型能否泛化至未见过的机器人 embodiment?

Yixiang Chen, Jiabing Yang, Yuan Xu, Qisen Ma, Keji He, Peiyan Li, Kai Wang, Ziheng He, Xiangnan Wu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 该研究针对XEWorld测试平台,发现基于动作的世界模型因视觉与物理动力学解耦不足,难以跨机器人 embodiment 泛化,需架构创新突破瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05720 2026-08-07 cs.CV 新提交 93%

PhyLatent: Learning Dynamics-Relevant Representations for JEPA World Models

PhyLatent:为JEPA世界模型学习与动力学相关的表征

Xi Zeng, Haojie Ren, Ziying Song

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) The University of Sheffield(谢菲尔德大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 PhyLatent为JEPA世界模型设计训练目标,解决其三类失效模式,在OGBench-Cube等数据集上显著降低失效率、提升MPC成功率,证明全局非坍塌不足以学习可靠的JEPA状态空间。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05706 2026-08-07 cs.CV 新提交 93%

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05523 2026-08-07 cs.CV 新提交 93%

HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models

HERA:用于潜在世界模型中物理预测的历史证据路由适配器

Yuanruyi, Yue Cao, Haojia Gao, Guanqiu Guo, Ziyuezhang, Shangqin, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本研究提出 HERA 框架,通过 RRPM 适配器为冻结潜在预测器路由历史证据,在 IntPhys2 数据集上显著提升 V-JEPA 2-G 的物理预测准确率,验证了该策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21910 2026-08-07 cs.AI cs.DB 版本更新 93%

TRW: TRACE-RealWorld---An Auditable Consistency Contract for World Models as Materialized Views

TRW: TRACE-RealWorld——作为物化视图的世界模型的可审计一致性契约

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 TRACE-RealWorld解决在变化物理世界中维护物化视图的问题,提出承诺级有效性抽象等数据管理方法,通过端到端评估测量多方面指标,贡献是为部署世界表示提供一致性、恢复和问责契约。

Comments v2 propagates declared point and extended hazards through the composition theorem and separates point-event from interval-risk budgets. It aligns Flood-SAR adjudication with each hazard class, sharpens calibration-slack and drift claims, adds bootstrap Monte Carlo error and joint-coverage requirements, revises terminology, and expands related-work context

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13460 2026-08-07 cs.CV 版本更新 93%

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

VISA: VLM引导的实例语义审计用于3D占据世界模型

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Nanjing University of Posts and Telecommunications(南京邮电大学) Stanford University(斯坦福大学) Motional AD Inc.(Motional AD公司)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出VISA方法,利用离线VLM对每个物理对象实例进行结构化语义审计,并通过可靠性加权损失蒸馏到3D占据模型中,无需VLM推理即可提升封闭集占据mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 93%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08991 2026-08-07 cs.CV cs.LG 版本更新 93%

Deterministic World Models for Closed-loop Reachability Analysis of End-to-End Vision-based Control

确定性世界模型用于闭环视觉系统验证

Yuang Geng, Zhongzheng Zhang, Chengzhen Jiang, Yanru Li, Xinyang Wang, Zhuoyang Zhou, Hoang-Dung Tran, Ivan Ruchkin

机构 * University of Florida(佛罗里达大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 本文提出确定性世界模型,通过直接映射系统状态到生成图像,消除不可解释的潜在变量,提升闭环视觉系统验证的精度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05891 2026-08-07 cs.AI cs.CL 新提交 92%

AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents

AppDeltaWorld:面向移动GUI智能体的基于转换的增量代码世界模型

Weikai Xu, Yunren Feng, Haoxiang Lei, Kun Huang, Yuxuan Liu, Kang Zhao, Xiaolin Hu, Shuo Shang, Bo An

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world-model(abstract)

AI总结 针对移动GUI智能体轨迹获取难、模拟环境扩展难等问题,提出AppDeltaWorld增量代码世界模型,在CMGUIBench-500评估中表现最优,支撑的AppDeltaAgent在多基准达SOTA,测试时强化学习可进一步提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05597 2026-08-07 cs.CV 新提交 92%

Uncertainty-Aware World Model for Aerial Image-Goal Navigation

面向航拍图像目标导航的不确定性感知世界模型

Deyi Zhu, Haoyu Fan, Yinan Zhu, Weichen Zhang, Shilin Ma, Xinlei Chen, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world-model(abstract)

AI总结 针对航拍图像目标导航中现有世界模型的未来状态预测不足问题,提出UA-NWM模型,将轨迹评分建模为条件分布外检测,仅用不可解释残差评分,实验验证其性能与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06332 2026-08-07 cs.RO 新提交 90%

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

GeniWorld:一种用于机器人操作的可泛化交互式世界模型

Chenghao Gu, Hanyang Yu, Jingbo Zhang, Haitao Lin, Wenyao Zhang, Jinghe Wang, Hanglei Jin, Shuzhao Xie, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent Robotics X(腾讯Robotics X实验室) The Hong Kong University of Science and Technology(香港科技大学) Shenzhen Technology University(深圳技术大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 针对通用机器人策略在复杂环境中鲁棒性不足的问题,提出GeniWorld交互式世界模型,通过解耦本体与环境动态、构建自回归视频预测模型实现泛化,可用于策略评估并提升下游操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 88%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05792 2026-08-07 cs.AI 新提交 81%

When Agentic AI Meets Integrated Sensing and Communication

当智能体AI遇上集成感知与通信

Kai Li, Conggai Li, Sarah Ali Siddiqui, Syed Sohail Ahmed, Xin Yuan, Shenghong Li, Wei Ni

机构 * University of Luxembourg(卢森堡大学) CSIRO(联邦科学与工业研究组织) Qassim University(卡西姆大学) Edith Cowan University(伊迪丝·考恩大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本综述提出智能体AI与集成感知通信结合的AISAC范式,构建六阶段闭环框架与五成熟度等级,梳理相关领域进展,分析交叉需求,发现现有系统智能体成熟度不足,并指出多方面开放挑战。

Comments 35 pages, 132 references, 10 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06227 2026-08-07 cs.NI cs.AI cs.IT cs.SY eess.SY math.IT 新提交 81%

From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks

从被动镜像到主动智能体:面向网络物理AI的 holonic 数字孪生

Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文针对当前AI嵌入物理系统失效、无线网络架构无法支持实时物理AI协调的问题,提出HDT-Nets框架,通过holonic数字孪生实现实时物理AI推理,为网络物理AI提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交 69%

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 69%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05230 2026-08-07 stat.ML cs.AI cs.LG cs.NE 新提交 50%

Quality Diversity for Reliable Data Driven Time-Use Optimization

面向可靠数据驱动时间使用优化的质量多样性方法

Aneta Neumann, Ty Stanford, Dorothea Dumuid, Frank Neumann

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 该研究针对时间使用优化中忽略预测不确定性的问题,提出不确定性量化质量多样性框架,平衡健康收益与模型置信度,生成更可靠的时间使用建议。

Comments To appear in the Proceedings of Parallel Problem Solving from Nature (PPSN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2608.05948 2026-08-07 cs.AI cs.CV cs.RO 新提交 96%

GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models

GAUGE:面向仿真引擎与视频世界模型物理保真度的、基于测量的基准

Shuai Wang, Yaxin Feng, Xuekun Jiang, Shihan Tian, Ningyu Yan, Xing Shen, Chaoyang Lyu, Hui Wang, Yunsong Zhou, Hanqing Wang, Jiangmiao Pang, Yang Xiang, Xing Gao, Chunhua Shen, Weinan Zhang

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 本研究提出基于真实世界的GAUGE基准,联合评估数值仿真器与生成式视频世界模型的物理保真度,发现无统一保真的物理引擎,视频模型存在轨迹形式正确但物理量错误的问题,为开发高保真仿真器奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 2 篇

2607.26657 2026-08-07 cs.RO cs.CV 版本更新 85%

Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control

Enfold:将世界生成器计算融入预测表示以实现高效具身控制

Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Xiaokang Yang, Yichao Yan

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 具身与机器人 :world model(title);world model(title);分类 cs.CV、cs.RO

AI总结 Enfold将世界生成器计算融入预测表示,在LIBERO等多任务中实现高效具身控制,大幅降低动作延迟,且能适应场景变化,为具身控制提供了新范式。

Comments project page, https://zwl666666.github.io/enfold/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05674 2026-08-07 cs.RO 新提交 69%

JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment

JoyAI-RA 0.5:通过双动作对齐扩展机器人操纵学习

RA Team

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 针对机器人操纵学习中异构数据的负迁移问题,提出 JoyAI-RA 0.5 框架,通过双动作对齐结合 VLWA 与强化学习,在 AgiBot 基准上实现性能提升,证明人类弱标注数据可作为扩展操纵能力的核心资源。

Comments Project Page: https://joyai-ra-05.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 1 篇

2603.05969 2026-08-07 cs.CV cs.AI cs.CL 56%

Imagine How To Change: Explicit Procedure Modeling for Change Captioning

想象如何改变:用于变化描述的显式过程建模

Jiayang Sun, Zixin Guo, Min Cao, Guibo Zhu, Jorma Laaksonen

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Computer Science, Aalto University(阿alto大学计算机科学系) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.CV

AI总结 ProCap通过动态过程建模改进变化描述,利用关键帧和可学习查询提升描述准确性与效率。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/BlueberryOreo/ProCap

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真与规划 3 篇

2605.04568 2026-08-07 cs.LG cs.AI cs.RO 版本更新 78%

Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination

Dream-MPC:基于梯度与潜在想象的模型预测控制

Jonathan Spieler, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) Robotics, Center for Robotics(机器人学,机器人中心) the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)

专题命中 仿真与规划 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。

Comments Accepted for International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06008 2026-08-07 cs.RO 新提交 69%

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划

Sining Ang, Yuguang Yang, Yan Wang

专题命中 仿真与规划 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 69%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏