arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-27 至 2026-07-27 共收录 7 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 7 篇

2606.10135 2026-07-27 cs.CV cs.AI 版本更新 96%

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

BiWM:利用双向自回归推进开源交互式视频世界模型

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Zhangrui Zhao, Weijie Ma

机构 * LynnReal AI Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22535 2026-07-27 cs.RO cs.CV 新提交 95%

Robot-Factored World Models via Robot Rendering

通过机器人渲染实现机器人因素分解的世界模型

Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究动作条件视频世界模型,提出机器人因素分解的世界模型,通过动作实现和机器人渲染将特定机器人因素移出模型,解决深度模糊问题,实验表明其优于基线且能推广,还能从人类演示生成机器人操作视频。

Comments Project Page: https://bjkim95.github.io/rofacto/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21686 2026-07-27 cs.AI 新提交 95%

Persistent Computational State: A Session-Centric Runtime for Generative World Models

持久计算状态:用于生成式世界模型的以会话为中心的运行时

Zhen Lin

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究发现当前视频世界模型用作模拟器失败的归因不完整,定义了持久计算状态(PCS),构建以会话为中心的运行时,通过测量发现PCS,实现低检查点和恢复成本以及新的内存管理方式。

Comments 29 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22000 2026-07-27 cs.SD 新提交 90%

Music-JEPA: Learning a World Model of Sound from Action

Music-JEPA:从动作中学习声音的世界模型

Ziyu Wang, Kun Fang, Yann LeCun

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究提出Music-JEPA,将音乐构建为动作条件系统,用JEPA学习钢琴声音世界模型,在离线状态下用配对数据训练。实验表明模型能捕捉音乐动作与声音关系,其表示支持下游任务并能通过规划实现钢琴转录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19190 2026-07-27 cs.RO cs.AI 版本更新 88%

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09572 2026-07-27 cs.DB cs.AI cs.LG 版本更新 62%

Predictive Query Language: A Domain-Specific Language for Predictive Modeling on Relational Databases

预测查询语言:一种用于关系数据库预测建模的领域特定语言

Vid Kocijan, Jinu Sunil, Jan Eric Lenssen, Viman Deb, Xinwei Xe, Federico Reyes Gomez, Matthias Fey, Jure Leskovec

机构 * Kumo.ai, Stanford University(Kumo.ai,斯坦福大学)

专题命中 通用世界模型 :predictive model(title,abstract);分类 cs.AI、cs.LG;predictive models(abstract)

AI总结 PQL是一种用于关系数据库预测建模的声明式语言,通过单个查询自动计算训练标签,支持多种机器学习任务,已在金融欺诈、推荐系统等领域应用。

Comments Presented at TaDA@VLDB2026

Journal ref TaDA@VLDB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21953 2026-07-27 cs.CV eess.SP 新提交 50%

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

通过全景感知和视觉语言模型进行低空信道多径预测

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

专题命中 通用世界模型 :environment model(abstract);分类 cs.CV

AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏