arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-27 至 2026-07-27 共收录 10 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 7 篇

2606.10135 2026-07-27 cs.CV cs.AI 版本更新 96%

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

BiWM:利用双向自回归推进开源交互式视频世界模型

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Zhangrui Zhao, Weijie Ma

机构 * LynnReal AI Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22535 2026-07-27 cs.RO cs.CV 新提交 95%

Robot-Factored World Models via Robot Rendering

通过机器人渲染实现机器人因素分解的世界模型

Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究动作条件视频世界模型,提出机器人因素分解的世界模型,通过动作实现和机器人渲染将特定机器人因素移出模型,解决深度模糊问题,实验表明其优于基线且能推广,还能从人类演示生成机器人操作视频。

Comments Project Page: https://bjkim95.github.io/rofacto/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21686 2026-07-27 cs.AI 新提交 95%

Persistent Computational State: A Session-Centric Runtime for Generative World Models

持久计算状态:用于生成式世界模型的以会话为中心的运行时

Zhen Lin

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究发现当前视频世界模型用作模拟器失败的归因不完整,定义了持久计算状态(PCS),构建以会话为中心的运行时,通过测量发现PCS,实现低检查点和恢复成本以及新的内存管理方式。

Comments 29 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22000 2026-07-27 cs.SD 新提交 90%

Music-JEPA: Learning a World Model of Sound from Action

Music-JEPA:从动作中学习声音的世界模型

Ziyu Wang, Kun Fang, Yann LeCun

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究提出Music-JEPA,将音乐构建为动作条件系统,用JEPA学习钢琴声音世界模型,在离线状态下用配对数据训练。实验表明模型能捕捉音乐动作与声音关系,其表示支持下游任务并能通过规划实现钢琴转录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19190 2026-07-27 cs.RO cs.AI 版本更新 88%

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09572 2026-07-27 cs.DB cs.AI cs.LG 版本更新 62%

Predictive Query Language: A Domain-Specific Language for Predictive Modeling on Relational Databases

预测查询语言:一种用于关系数据库预测建模的领域特定语言

Vid Kocijan, Jinu Sunil, Jan Eric Lenssen, Viman Deb, Xinwei Xe, Federico Reyes Gomez, Matthias Fey, Jure Leskovec

机构 * Kumo.ai, Stanford University(Kumo.ai,斯坦福大学)

专题命中 通用世界模型 :predictive model(title,abstract);分类 cs.AI、cs.LG;predictive models(abstract)

AI总结 PQL是一种用于关系数据库预测建模的声明式语言,通过单个查询自动计算训练标签,支持多种机器学习任务,已在金融欺诈、推荐系统等领域应用。

Comments Presented at TaDA@VLDB2026

Journal ref TaDA@VLDB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21953 2026-07-27 cs.CV eess.SP 新提交 50%

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

通过全景感知和视觉语言模型进行低空信道多径预测

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

专题命中 通用世界模型 :environment model(abstract);分类 cs.CV

AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 1 篇

2607.22530 2026-07-27 cs.RO 新提交 92%

ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation

ViTacWorld:用于丰富接触式机器人操作的视觉-触觉世界模型扩展

Yunao Huang, Shiyu Sang, Haotao Lu, Suting Ni, Shijie Wu, Ziyang Guo, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 具身与机器人 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 研究针对丰富接触式机器人操作中视觉-触觉学习扩展难的问题,提出ViTacWorld模型,利用真实和模拟数据预训练并微调,能根据机器人动作预测视觉与触觉反馈,实现动作条件策略评估,提升策略性能。

Comments 18 pages, 6 figures, 5 tables. Project page: https://vitacworld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 1 篇

2606.03159 2026-07-27 cs.CV cs.AI cs.RO 版本更新 89%

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

专题命中 自动驾驶 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV、cs.RO

AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 1 篇

2607.21645 2026-07-27 cs.LG cs.AI 新提交 87%

Multi-Horizon Consistency as Geometry: When Latent Dynamics Contract, and When They Do Not

多时间尺度一致性即几何:潜在动力学何时收缩,何时不收缩

Kavya Bhand, Aadi Joshi

机构 * Vishwakarma Institute of Technology(维斯瓦卡玛理工学院)

专题命中 模型式强化学习 :latent dynamics(title);world model(abstract);world models(abstract);world model(abstract)

AI总结 研究视频预测器和世界模型中多时间尺度潜在一致性权重λ对过渡几何的作用,通过实验测量L20,q95和E20等指标,发现λ能改善移动MNIST数据集相关指标,且软一致性作用有域限制,还得出随机强迫定律统一控制域。

Comments 22 pages, 9 figures. Diagnostic study of multi-horizon latent consistency, expansion proxies (L20), and a stochastic-forcing law for world-model geometry. Code and experiment logs to be released publicly

详情

展开后加载摘要…

URL PDF HTML 收藏