arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-06-25 至 2026-06-25 共收录 12 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 9 篇

2512.17796 2026-06-25 cs.CV cs.AI 版本更新 95%

CustomX: Unified Character, Action, and Scene Customization in Video World Models

CustomX: 视频世界模型中的统一角色、动作与场景定制

Yitong Wang, Fangyun Wei, Hongyang Zhang, Bo Dai, Yan Lu

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) The University of Hong Kong(香港大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);video world model(title);world model(title,abstract)

AI总结 提出CustomX,结合静态世界生成与可控实体模型,支持用户指定角色在3D场景中执行开放动作,通过条件自回归视频生成保持视觉保真度。

Comments Accepted to ECCV 2026. Project page: https://snowflakewang.github.io/CustomX_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09457 2026-06-25 cs.RO 新提交 94%

$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models

$ω$-EVA:基于潜在交互世界模型的构想、验证与行动

Zhenguo Sun, Yu Sun, Hande Huang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出$ω$-EVA框架,通过潜在交互世界模型实现“构想-验证-行动”循环,利用动作条件潜在动力学和语言条件流策略生成动作,无需生成未来视频,在多种机器人操作任务中提升策略性能。

Comments Add some ablation experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25473 2026-06-25 cs.CV cs.LG 新提交 94%

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, Qianli Ma

机构 * Tsinghua University(清华大学) UT Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24946 2026-06-25 cs.LG cs.RO 新提交 94%

Conformal Orbit-Valid Trust Horizons for Equivariant World Models

等变世界模型的共形轨道有效信任视界

Hongbo Wang

机构 * Department of Mathematics, Stony Brook University(石溪大学数学系)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 针对具有已知群对称性的潜在世界模型,提出一种共形校准的信任视界认证方法,利用等变性实现轨道常数认证,实验验证了其保守性和非空性。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25368 2026-06-25 cs.CV 新提交 92%

Hypergraph Normal World Models for Logical Visual Anomaly Detection

超图常态世界模型用于逻辑视觉异常检测

Weizhi Nie, Zibo Xu, Weijie Wang, Yuting Su

机构 * Tianjin University(天津大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 提出超图常态世界模型,利用DINOv2补丁令牌构建超图统计,通过信息商分离局部、关系和超边证据,在MVTec LOCO上逻辑异常AUROC从0.8434提升至0.9279。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25421 2026-06-25 cs.CL 新提交 90%

Beyond Next-Observation Prediction: Agent-Authored World Modeling for Sequential Decision Making

超越下一观测预测:面向序贯决策的智能体自创世界建模

Guangfeng Cai, Kaibing Yang, Shuo He, Yu Li, Shengtian Yang, Jiaqi Lv, Lei Feng

机构 * Southeast University(东南大学) Meituan(美团)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world-model(abstract);world-model(abstract)

AI总结 提出智能体自创世界建模(AAWM),根据策略决策需求构建训练目标,而非预测下一观测,实验证明其比下一观测预测提供更有效的学习信号。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14622 2026-06-25 cs.LG cs.AI 版本更新 82%

ACT-JEPA: Novel Joint-Embedding Predictive Architecture for Efficient Policy Representation Learning

ACT-JEPA:用于高效策略表征学习的新型联合嵌入预测架构

Aleksandar Vujinovic, Aleksandar Kovacevic

机构 * Faculty of Technical Sciences, University of Novi Sad(技术科学学院,诺维萨德大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出ACT-JEPA架构,结合模仿学习与自监督学习,通过联合预测动作序列和潜在观测序列学习鲁棒世界模型,在多个环境中任务成功率提升达10%。

Comments Published version

Journal ref IEEE Access, vol. 14, pp. 78895-78906, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25527 2026-06-25 cs.LG 新提交 81%

Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

超越一刀切:基于诊断的在线强化学习与离线先验知识

Guozheng Ma, Lu Li, Zilin Wang, Pierre-Luc Bacon, Dacheng Tao

机构 * Nanyang Technical University(南洋理工大学) University of Oxford(牛津大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出诊断驱动的张力管理框架,通过三种功能角色表征离线先验知识如何重塑在线优化,并展示跨领域证据,解决先验知识有效性随部署变化的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 71%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2510.09036 2026-06-25 cs.RO 版本更新 91%

RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation

RoDyn: 驯服交互式机器人动态2.5D世界模型用于机器人操作

Chuanrui Zhang, Zhengxian Wu, Guanxing Lu, Yansong Tang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出RoDyn,一种几何感知的2.5D世界模型,通过机器人动态分词器和掩码引导自回归架构,在高效潜在空间中建模环境动态,提升生成保真度并显著改善下游强化学习和模仿学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 83%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 具身与机器人 :latent dynamics(title,abstract);world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 1 篇

2606.15053 2026-06-25 cs.LG cs.NA math.NA 新提交 50%

Physics-conforming Latent Twins

物理一致潜在对偶

Matthias Chung, Yutong Bu, Deepanshu Verma

机构 * Emory University(埃默里大学) Clemson University(克莱姆森大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 提出物理一致潜在对偶框架,通过联合学习编码器、解码器和潜在流映射,使潜在动力学满足守恒律、不变性和耗散结构,在保持代理模型预测精度的同时提高物理约束满足度和长期行为质量。

Comments 32 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏