arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-22 至 2026-07-22 共收录 12 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 12 篇

2604.26182 2026-07-22 cs.CV cs.AI cs.LG 版本更新 95%

Lifting Embodied World Models for Planning and Control

提升具身世界模型用于规划与控制

Alex N. Wang, Trevor Darrell, Pavel Izmailov, Yutong Bai, Amir Bar

机构 * Computer Science, New York University(纽约大学计算机科学系) BAIR, UC Berkeley(伯克利大学BAIR)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);embodied world model(title);world model(title,abstract)

AI总结 本文提出一种轻量级策略,将高层动作映射到低层关节动作序列,结合冻结的世界模型,实现预测未来观察的提升世界模型,有效降低规划复杂度。

Comments Accepted to ECCV2026. Edited policy masking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18715 2026-07-22 cs.AI 新提交 93%

DWM: Separating World Effects from Actions in Latent World Models

DWM:在潜在世界模型中分离世界效应与动作

Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究在潜在世界模型中分离世界效应与动作的问题,提出DWM框架,通过辅助世界头和正交性约束实现预测转换的显式加法分解,在构建的W变体基准测试中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01177 2026-07-22 cs.RO 版本更新 93%

Scaling Cross-Embodiment World Models for Dexterous Manipulation

为灵巧操作扩展跨实体世界模型

Zihao He, Bo Ai, Tongzhou Mu, Yulin Liu, Weikang Wan, Jiawei Fu, Yilun Du, Henrik I. Christensen, Hao Su

机构 * UC San Diego(UC圣迭戈大学) Harvard University(哈佛大学) Shanghai Jiao Tong University(上海交通大学) Hillbot

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究跨实体学习中不同形态机器人数据共享和控制转移问题,提出将人类和机器人手表示为3D粒子集,在随机交互数据上训练基于图的世界模型并与模型预测控制集成,实验表明该方法能提高泛化能力、有效结合数据并实现不同机器人手的控制。

Comments Accepted to IROS 2026, Project Page: https://alan-heoooh.github.io/dexwm.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18696 2026-07-22 cs.AI 新提交 92%

Do AI-Native Biotechs Need Departments? Benchmarking Company World Models for AI-Driven Drug Development

人工智能原生生物技术公司需要部门吗?人工智能驱动药物研发的公司世界模型基准测试

Yinan Wang

机构 * Noah AI Research(诺亚人工智能研究)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 研究人工智能原生生物技术公司组织模式,提出公司世界模型,用含45个案例的虚拟实验室基准测试,比较多种架构,发现价值转换架构表现优,核心操作原语应是资产到价值状态而非静态组织结构图,不过研究仅限虚拟实验室。

Comments Working paper. Includes public no-label benchmark cases and dry-lab evaluation artifacts. No wet-lab, patient-level, clinical, regulatory, or investment validation is claimed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18367 2026-07-22 cs.AI 新提交 92%

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

阿莱雅世界:交互式长视野世界建模——完整技术报告

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

机构 * Alaya Lab(阿莱亚实验室)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);video world model(abstract)

AI总结 研究旨在创建交互式视频世界模型,核心方法是基于15B视频扩散变压器构建阿莱雅世界,通过自回归生成短潜在块等实现多种能力,在iWorld - Bench上长视野生成性能最佳,为相关研究提供开源可扩展基础。

Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16602 2026-07-22 cs.CV 版本更新 90%

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

PAVXploreRL:具有动作探索的物理动作视觉世界模型强化学习

Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fengjiao Cheng, Xiaodan Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Sun Yat-sen University(中山大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究针对动作条件世界模型泛化性差的问题,提出PAVXploreRL强化学习框架,基于预训练潜在世界模型,通过奖励驱动训练优化PAV目标,联合利用ID轨迹与OOD动作探索提升泛化能力,实验证明该方法性能更优。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19343 2026-07-22 cs.CV cs.RO 新提交 89%

Masked Visual Actions for Unified World Modeling

用于统一世界建模的掩码视觉动作

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

机构 * Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学帕克分校) Harvard University(哈佛大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV、cs.RO;dynamics model(abstract)

AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。

Comments Project webpage: https://masked-visual-actions.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 88%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12721 2026-07-22 cs.AI 版本更新 81%

The Theory of Mind Utility: Formal Specification of a Mentalizing Mechanism

心智理论效用:心理化机制的形式化规范

Nikolos Gurney, Stacy Marsella

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出心智理论效用(ToM-U)框架,通过局部认知世界模型(LEWM)形式化推断他人信念的计算问题,定义结构、推理过程及失败痕迹,区别于贝叶斯心智理论等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18703 2026-07-22 cs.CV 新提交 69%

Generative World Renderer at the Speed of Play

以游戏速度运行的生成式世界渲染器

Guixu Lin, Zheng-Hui Huang, Siqi Yang, Ming-Hsuan Yang, Kaipeng Zhang, Zhixiang Wang

机构 * Alaya Lab(阿莱雅实验室) University of California, Merced(加州大学默塞德分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 研究如何提升生成式世界渲染器AlayaRenderer的速度,核心方法是将其重构为自回归流模型并引入轻量级编解码器,主要贡献是大幅降低推理成本,实现30 FPS可玩的生成式世界,保留核心渲染能力。

Comments Project page: https://alaya-renderer-flash.alayalab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18565 2026-07-22 eess.SY cs.RO cs.SY 新提交 69%

Integrity-Gated Eco-CACC: Epistemic Admissibility for Cooperative Driving at Signalized Intersections

完整性门控生态协同自适应巡航控制:信号交叉口协同驾驶的认知可容许性

Lyes Saad Saoud, Moussa Ayyash

机构 * Chicago State University(芝加哥州立大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 研究信号交叉口Eco-CACC系统,提出完整性门控框架,结合多种因素构建统一完整性度量调节控制权,仿真表明其在模型一致时保持效率,完整性下降时能早期保守响应,解决现有方法在传感等问题下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18482 2026-07-22 physics.app-ph 新提交 69%

Evaluation-Recording Contamination in Learned Nano-Quadrotor Dynamics: A Fresh-Seed Audit

学习的纳米四旋翼动力学中的评估记录污染:新种子审计

David Shulman

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);dynamics model(abstract)

AI总结 研究学习的纳米四旋翼动力学中评估记录污染问题,通过固定NanoBench Crazyflie 2.1数据集快照进行实验,比较不同模型,发现污染虽降误差但置信区间过零,可靠评估需记录级分割等多方面操作。

详情

展开后加载摘要…

URL PDF HTML 收藏