arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 4308 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4308 篇

2603.27449 2026-03-31 cs.CV 88%

LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model

LOME:基于动作条件的视点世界模型学习人类-物体操控

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, Yue Wang

机构 * University of Southern California(南加州大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 LOME通过结合空间人类动作与环境上下文,生成逼真的人-物交互视频,提升动作跟随精度与泛化能力,实现物理效果如液体倒出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25216 2026-03-27 cs.NI cs.AI eess.SP 88%

A Wireless World Model for AI-Native 6G Networks

面向AI原生6G网络的无线世界模型

Ziqi Chen, Yi Ren, Yixuan Huang, Qi Sun, Nan Li, Yuhong Huang, Chih-Lin I, Yifan Li, Liang Xia

机构 * China Mobile Research Institute(中国移动研究院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 本文提出无线世界模型(WWM),通过内化三维几何与信号动态的因果关系,预测无线信道的时空演化,实现跨动态环境的泛化能力,优于现有单模基础模型和任务专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24402 2026-03-27 cs.AI 88%

AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model

AI-Supervisor: 通过持续的研究世界模型实现自主的AI研究监督

Yunbo Long

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 本文提出AI-Supervisor框架,通过持续演进的知识图谱实现自主探索和自我修正的研究监督,解决传统线性流程无法处理研究空白和验证问题的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00393 2026-03-27 cs.CV 88%

NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

NeoVerse:基于真实世界单目视频增强4D世界模型

Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, Zhaoxiang Zhang

机构 * NLPR & MAIS, CASIA(国家工程实验室与机器智能研究所,中国科学院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出NeoVerse,一种能实现4D重建、生成新颖轨迹视频及多种下游应用的 versatile 4D 世界模型。通过解决现有方法在可扩展性上的局限,NeoVerse 基于单目视频构建可扩展的全流程,实现高泛化能力与高性能。

Comments CVPR 2026; Project Page: https://neoverse-4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21557 2026-03-24 cs.CV 88%

From Part to Whole: 3D Generative World Model with an Adaptive Structural Hierarchy

从部分到整体:具有自适应结构层次的3D生成世界模型

Bi'an Du, Daizong Liu, Pufan Li, Wei Hu

机构 * Wangxuan Institute of \ Technology, Peking University Beijing, China Institute for Math \& AI, Wuhan University Wuhan, China

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出了一种自适应部分-整体层次的3D生成世界模型,通过直接从图像令牌推断出软且组合性的掩码,自主发现潜在结构槽,实现跨类别的形状共享和去噪。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21340 2026-03-24 cs.AI cs.DC 88%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 88%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03887 2026-03-19 cs.CV 88%

OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction

OccTENS: 通过时间下一尺度预测实现的3D占用世界模型

Bu Jin, Songen Gu, Xiaotao Hu, Yupeng Zheng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Horizon Robotics(地平线机器人) Nanjing University(南京大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出OccTENS,一种能高效生成高质量长期占用场景的生成模型,通过时间下一尺度预测任务解决效率、时间退化和可控性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14039 2026-03-17 cs.CV 88%

EyeWorld: A Generative World Model of Ocular State and Dynamics

EyeWorld: 一种眼态与动态的生成世界模型

Ziyu Gao, Xinyuan Wu, Xiaolan Chen, Zhuoran Liu, Ruoyu Chen, Bowen Liu, Bingjie Yan, Zhenhan Wang, Kai Jin, Jiancheng Yang, Yih Chung Tham, Mingguang He, Danli Shi

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10527 2026-03-12 cs.LG cs.SY eess.SY 88%

World Model for Battery Degradation Prediction Under Non-Stationary Aging

非平稳老化条件下电池退化预测的世界模型

Kai Chin Lim, Khay Wai See

机构 * Independent Researcher(独立研究者)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.LG

AI总结 本文提出一种世界模型用于非平稳老化条件下电池退化预测,通过编码原始信号并学习动态转换生成未来轨迹,结合电化学知识约束提升预测精度。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14918 2026-03-12 cs.CV 88%

X-WIN: Building Chest Radiograph World Model via Predictive Sensing

X-WIN:通过预测感知构建胸片世界模型

Zefan Yang, Ge Wang, James Hendler, Mannudeep K. Kalra, Pingkun Yan

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 X-WIN通过预测感知构建胸片世界模型,利用体积数据提炼3D解剖知识,提升CXR的表示学习和诊断能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00466 2026-03-03 cs.CV 88%

DreamWorld: Unified World Modeling in Video Generation

DreamWorld: 视频生成中的统一世界建模

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, Yanyong Zhang

机构 * University of Science(科学技术大学) Shanghai Jiao Tong University, Shanghai, China.(上海交通大学) Nanjing University, Suzhou, China.(南京大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 DreamWorld通过联合世界建模范式和约束退火技术,提升视频生成的世界一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19128 2026-02-27 cs.AI 88%

K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model

K-Search: 通过共进化内在世界模型生成LLM内核

Shiyi Cao, Ziming Mao, Joseph E. Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 K-Search通过共进化内在世界模型生成LLM内核,显著优于现有进化搜索方法,实现高效内核优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20685 2026-02-26 cs.CV 88%

RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space

RAYNOVA:在射线空间中实现尺度-时间自回归世界建模

Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition UC Berkeley(加州大学伯克利分校)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 RAYNOVA通过双因果自回归框架实现尺度-时间自回归世界建模,在驾驶场景中实现多视角视频生成,具有更高的吞吐量和可控性。

Comments Accepted by CVPR 2026; Project website: https://raynova-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17259 2026-02-20 cs.RO 88%

FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment

FRAPPE:通过多未来表示对齐将世界建模注入通用策略

Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang Li, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) South China University of Technology(华南理工大学) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。

Comments Project Website: https://h-zhao1997.github.io/frappe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16182 2026-02-19 cs.RO 88%

World Model Failure Classification and Anomaly Detection for Autonomous Inspection

自主检测机器人的世界模型故障分类与异常检测

Michelle Ho, Muhammad Fadhil Ginting, Isaac R. Ward, Andrzej Reinke, Mykel J. Kochenderfer, Ali-akbar Agha-Mohammadi, Shayegan Omidshafiei

机构 * Stanford University(斯坦福大学) Field AI

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 本文提出了一种结合监督分类与异常检测的混合框架,用于自主检测任务中的故障分类和异常检测,实现了超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15384 2026-02-18 cs.AI cs.CL 88%

World-Model-Augmented Web Agents with Action Correction

具有动作修正的世界模型增强型网络代理

Zhouzhou Shen, Xueyu Hu, Xiyun Li, Tianqing Fang, Juncheng Li, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室)

专题命中 通用世界模型 :world-model(title);world-model(title);world model(abstract);world model(abstract)

AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14721 2026-02-17 cs.AI 88%

WebWorld: A Large-Scale World Model for Web Agent Training

WebWorld: 一个大规模的世界模型用于网络代理训练

Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen Yu, Fei Huang, Junyang Lin, Zuozhu Liu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 WebWorld是一个大规模开放网络模拟器,通过大规模训练实现网络代理的有效训练,展示了在多个领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13554 2026-02-17 cs.ET cs.IT cs.RO math.IT 88%

From Snapshot Sensing to Persistent EM World Modeling: A Generative-Space Perspective for ISAC

从快照感知到持久电磁世界建模:一种面向ISAC的生成空间视角

Pin-Han Ho, Haoran Mei, Limei Peng, Yiming Miao, Kairan Liang, Yan Jiao

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 本文提出一种基于生成空间的毫米波感知框架,通过低维激励空间实现灵活、可扩展的持续电磁世界建模,避免了快照感知的局限性。

Comments 7 pages, 6 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18845 2026-02-10 cs.AI 88%

UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model

UNeMo:通过多模态世界模型实现协作的视觉-语言推理与导航

Changxin Huang, Lv Tang, Zhaohuan Zhan, Lisha Yu, Runhao Zeng, Zun Liu, Zhengjie Wang, Jianqiang Li

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 UNeMo通过多模态世界模型实现视觉-语言推理与导航的协作优化,提升导航准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00558 2026-02-03 cs.NI 88%

NetWorld: Communication-Based Diffusion World Model for Multi-Agent Reinforcement Learning in Wireless Networks

NetWorld: 基于通信的扩散世界模型用于无线网络中的多智能体强化学习

Kechen Meng, Rongpeng Li, Yansha Deng, Zhifeng Zhao, Honggang Zhang

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);dynamics model(abstract)

AI总结 NetWorld通过通信增强的扩散世界模型,实现无线网络中多智能体强化学习的少样本泛化和高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22128 2026-01-30 cs.AI cs.CE q-bio.QM 88%

The Patient is not a Moving Document: A World Model Training Paradigm for Longitudinal EHR

患者并非静态文档:一种用于纵向电子健康记录的world model训练范式

Irsyad Adam, Zekai Chen, David Laprade, Shaun Porwal, David Laub, Erik Reinertsen, Arda Pekis, Kevin Brown

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 本文提出SMB-Structure模型,通过结合联合嵌入预测架构和next-token预测,学习捕捉疾病动态的嵌入,实现对高异质性复杂任务的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07964 2026-01-14 cs.AI 88%

Executable Ontologies in Game Development: From Algorithmic Control to Semantic World Modeling

可执行本体在游戏开发中的应用:从算法控制到语义世界建模

Alexander Boldachev

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 本文提出利用可执行本体实现游戏开发中的语义世界建模,通过数据流条件实现任务中断,解决传统AI架构中的语义-过程鸿沟。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20615 2025-12-24 cs.CV 88%

Active Intelligence in Video Avatars via Closed-loop World Modeling

通过闭环世界建模实现视频虚拟角色的主动智能

Xuanhua He, Tianyu Yang, Ke Cao, Ruiqi Wu, Cheng Meng, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出ORCA框架,通过闭环世界建模和双系统架构,实现视频虚拟角色的主动智能与目标导向行为。

Comments Project Page: https://xuanhuahe.github.io/ORCA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11226 2025-12-15 cs.CV 88%

FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model

FutureX: 通过潜在链式思维世界模型增强端到端自动驾驶

Hongbin Lin, Yiming Yang, Yifan Zhang, Chaoda Zheng, Jie Feng, Sheng Wang, Zhennan Wang, Shijia Chen, Boyang Wang, Yu Zhang, Xianming Liu, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen(FNii深圳分部) SSE, CUHK-Shenzhen(SSE,CUHK深圳分校) Xpeng Motors(小鹏汽车) MiroMind AI(MiroMind人工智能) Xidian University(西安电子科技大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 FutureX通过链式思维世界模型增强端到端自动驾驶,提升复杂场景下的运动规划质量与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 88%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03000 2025-12-04 cs.CV 88%

DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling

DynamicVerse: 一种具有物理意识的多模态框架用于4D世界建模

Kairun Wen, Yuzhi Huang, Runyu Chen, Hui Zheng, Yunlong Lin, Panwang Pan, Chenxin Li, Wenyan Cong, Jian Zhang, Junbin Lu, Chenguo Lin, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Yue Huang, Xinghao Ding, Rakesh Ranjan, Zhiwen Fan

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 DynamicVerse提出了一种多模态框架,通过整合大规模视觉、几何和多模态模型,实现动态现实世界视频的4D世界建模,提升了对物理尺度测量的全局准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00005 2025-12-02 cs.RO 88%

DREAMer-VXS: A Latent World Model for Sample-Efficient AGV Exploration in Stochastic, Unobserved Environments

DREAMer-VXS:一种用于在随机、未观测环境中高效样本AGV探索的潜在世界模型

Agniprabha Chakraborty

机构 * Department of Power Engineering, Jadavpur University(功率工程系,贾瓦德普尔大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 DREAMer-VXS通过高效样本利用和潜在世界模型,实现AGV在随机未观测环境中的高效探索与鲁棒导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13021 2025-11-18 cs.AI cs.CL 88%

PragWorld: A Benchmark Evaluating LLMs' Local World Model under Minimal Linguistic Alterations and Conversational Dynamics

Sachin Vashistha, Aryan Bibhuti, Atharva Naik, Martin Tutek, Somak Aditya

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

Comments 23 pages, 15 tables, 10 figures; AAAI 2026 Conference Main Track (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19364 2025-10-23 cs.RO 88%

ProTerrain: Probabilistic Physics-Informed Rough Terrain World Modeling

Golnaz Raja, Ruslan Agishev, Miloš Prágr, Joni Pajarinen, Karel Zimmermann, Arun Kumar Singh, Reza Ghabcheloo

机构 * Tampere University(塔尔皮耶大学) Czech Technical University(捷克技术大学) University of Tartu(塔尔图大学) Aalto University(阿尔托大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

Comments This paper is submitted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏