arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-21 至 2026-07-21 共收录 22 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 15 篇

2607.16314 2026-07-21 cs.CV cs.LG cs.RO 新提交 94%

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

深度正则化JEPA世界模型从真实户外机器人数据中学习更多可转移表示

Usman M. Khan

机构 * Aigen(爱igen)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究针对从真实户外机器人数据学习世界模型的挑战,引入深度作为训练几何先验,结合SIGReg等方法,训练18M参数模型,实验表明该方法在降低视觉里程计误差、增加意外分数分离及提高多步展开保真度等方面有显著提升,增强了模型泛化能力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16204 2026-07-21 cs.AI cs.LG 新提交 94%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 94%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 94%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05558 2026-07-21 cs.LG 版本更新 93%

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

自回归扩散世界模型用于LLM智能体的离线评估

Kaixuan Liu, Guojun Xiong, Weinan Zhang, Shengpu Tang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出ADWM框架,通过自回归扩散世界模型从预收集轨迹中模拟环境响应,实现无需在线交互的LLM智能体策略离线评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07996 2026-07-21 cs.CV cs.RO 版本更新 90%

3D and 4D World Modeling: A Survey

3D和4D世界建模:一项综述

Lingdong Kong, Yu Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 该综述针对世界建模中对3D和4D表示利用不足及定义分类缺失的问题,通过建立精确概念、引入结构化分类法,系统总结相关数据集和评估指标,讨论应用、挑战与方向,为3D和4D世界建模领域提供基础参考。

Comments Survey; Project Page at https://worldbench.github.io/survey GitHub Repo at https://github.com/worldbench/awesome-3d-4d-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17973 2026-07-21 cs.AI 新提交 90%

SAGE: Subgoal-Conditioned Action Generation for Latent World Model Planning

SAGE:用于潜在世界模型规划的子目标条件动作生成

Letian Cheng, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究潜在世界模型规划中提议质量受限问题,提出先验条件规划器,利用目标条件生成器预测潜在子目标,结合不同时长子目标作先验,实验证明该方法显著提升长期规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17269 2026-07-21 cs.AI cs.DB 新提交 90%

An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation

基于数据优先本体的显式世界模型:DaoQL多模态存储验证与反事实推理评估

Zhanbo Li, Shifeng Wu, Xiangjin Meng, Wenjie Cai

机构 * School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) Guangzhou Polytechnic Normal University(广州技术师范大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究大型语言模型隐式编码世界模型的风险,提出数据优先本体并构建DaoQL多模态数据库。通过形式化显式世界模型,对比隐式模型优势。实验展示系统性能,如在反事实实验中DaoQL+GPT-4o可组合反事实可分解性大幅提升。

Comments 20 pages, 2 figures. Code: https://github.com/zhanbolee/DaoQL-Edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17250 2026-07-21 cs.CL 新提交 90%

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

EvolvingWorld:用于交互式文学世界中角色与世界模型协同进化的开放架构框架

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速) Huazhong University of Science and Technology(华中科技大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究交互式文学世界中角色与世界协同进化问题,提出EvolvingWorld框架,含角色智能体和世界模型两个耦合模块,制定7个可训练任务,构建数据集并引入评估协议,实验证明其能有效改进长期模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17747 2026-07-21 cs.NI cs.AI 新提交 88%

Mobile Network Control with a World Model

基于世界模型的移动网络控制

Maxime Bouton, Ioanna Mitsioni, Simon Lindståhl, Jaeseong Jeong

机构 * Ericsson Research(爱立信研究)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 针对移动网络控制问题,提出基于世界模型的方法,通过历史数据训练模型预测行动影响,利用不确定性估计找最优配置,优化目标可动态改变。该方法在模拟闭环控制中有效,相比传统方法和强化学习提升了节能与服务质量平衡性能。

Journal ref 2026 IEEE/IFIP Network Operations and Management Symposium (NOMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19571 2026-07-21 cs.CV 版本更新 88%

Video-HOCA: A Diagnostic Benchmark for Physical Anomaly Reasoning in Video-LLMs

HOCA-Bench: 通过黑格尔本体论-因果异常超越语义感知以实现预测世界建模

Chang Liu, Yunfan Ye, Qingyang Zhou, Xichen Tan, Mengxuan Luo, Zhenyu Qiu, Wei Peng, Zhiping Cai

机构 * Hunan University, Changsha, China(湖南大学) National University of Defense Technology, Changsha, China(国防科技大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 HOCA-Bench通过黑格尔本体论-因果异常框架,揭示视频大语言模型在预测世界建模任务中的认知局限,发现模型在因果机制理解上存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17560 2026-07-21 cs.AI 新提交 88%

Reinforcement Learning: From Algorithms To Foundation Models

强化学习:从算法到基础模型

Zihan Ding

专题命中 通用世界模型 :world model(abstract);world models(abstract);video world model(abstract);world model(abstract)

AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。

Comments Princeton University PhD Thesis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17523 2026-07-21 cs.CV cs.AI cs.CL 新提交 82%

Thinking in Video: Can Video Generators Really Reason About the Real World?

视频中的思考:视频生成器真的能对现实世界进行推理吗?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun

机构 * Central South University(中南大学) Tencent(腾讯) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16401 2026-07-21 cs.CV 新提交 81%

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17669 2026-07-21 cs.CV 新提交 69%

Attention from Above: A Multimodal Model for Drone-Based Object Localization

自上而下的注意力:一种基于无人机的目标定位多模态模型

Hyun-Ki Jung

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 针对无人机目标检测,本文基于YOLO-World框架,用A2C2f层替换C2f层,引入注意力机制和并行处理结构,提升小目标检测性能,在VisDrone数据集实验中各项指标显著优于原模型,提供了高精度检测方案。

Comments Preprint. Accepted for publication in the International Journal of Interactive Mobile Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2510.23509 2026-07-21 cs.RO 版本更新 88%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14183 2026-07-21 cs.RO cs.CV 版本更新 82%

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE:用于具身学习的开放自我中心操纵数据集和工具链

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究旨在为具身学习提供数据集和工具链,提出Open-AoE。它涵盖从手机捕捉到模型训练全流程,含约2000小时视频及多种注释等。通过整合多环节,降低数据贡献与重用障碍,为相关研究提供实用开放基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 2 篇

2607.16591 2026-07-21 cs.LG cs.AI 新提交 86%

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

专题命中 模型式强化学习 :model-based RL(title);world model(abstract);world-model(abstract);world model(abstract)

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16501 2026-07-21 cs.RO 新提交 74%

Certifiable Safe Model-Based Reinforcement Learning with Control-Affine Dynamics Approximation

基于控制仿射动力学近似的可验证安全模型强化学习

Hao Zhou, Yanze Zhang, Cameron Reid, Wenhao Luo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Texas A&M University(德克萨斯农工大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);分类 cs.RO

AI总结 研究基于模型的安全强化学习,提出用控制障碍函数结合控制仿射随机傅里叶特征及自适应共形预测的框架,通过学习控制仿射动力学实现可验证安全策略,仿真结果验证了该框架在推车摆杆和3D四旋翼平台上的有效性。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仿真与规划 3 篇

2607.16636 2026-07-21 cs.RO 新提交 81%

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution

PhyAgentOS:一种用于具身智能体的自进化操作系统,具有解耦的认知规划和物理执行

Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin

机构 * X-Era Lab(X-Era实验室) HCP Lab, Sun Yat-sen University(中山大学HCP实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 仿真与规划 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究为具身智能体提出PhyAgentOS操作系统,其以会话为最小调度单位,用文件系统解耦认知与物理执行,通过会话验证器区分执行与任务完成,经认知记忆整合结果,有分层安全约束,在多模型和实体上验证并优于其他系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17710 2026-07-21 cs.LG 新提交 69%

Planning with Transformers: Chain of Computation and Structured Context Windows

使用Transformer进行规划:计算链与结构化上下文窗口

Ehsan Futuhi, Nathan R. Sturtevant

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 研究大语言模型解决规划问题的不足,提出计算链架构,利用结构化上下文窗口,让语言模型学习规划策略、预测世界模型并执行算术运算,在多个任务上取得高成功率,能解决复杂汉诺塔问题且减少训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15830 2026-07-21 cs.AI 版本更新 69%

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

迷你游乐园(MAPs):一个用于模拟商业决策的测试平台

Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 介绍用于评估智能体决策能力的游乐园模拟器Mini Amusement Parks (MAPs),统一现实决策多方面挑战,提供人类基线和对先进语言模型智能体的评估,发现人类表现更优并揭示智能体在多方面的弱点,为基准测试适应性决策智能体提供新基础。

Comments 9 pages (main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏