arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-31 至 2026-07-31 共收录 9 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 9 篇

2607.27599 2026-07-31 cs.AI cs.RO 新提交 93%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28226 2026-07-31 cs.CR cs.AI 新提交 92%

Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation

基于世界模型的具身智能安全性:威胁、防御与评估的生命周期

Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

专题命中 通用世界模型 :world-model(title,abstract);world-model(title,abstract);world model(abstract);world models(abstract)

AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28287 2026-07-31 cs.AI cs.CV cs.SC 新提交 91%

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

Tycho:面向ARC-AGI-3的基于可编程世界模型的主动抽象

Jens Lehmann, Andrei Aioanei, Sahar Vahdati

机构 * Dresden University of Technology(德累斯顿工业大学) Amazon(亚马逊) TIB – Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心) Leibniz University of Hannover(汉诺威莱布尼茨大学)

专题命中 通用世界模型 :world model(title);world models(title);world model(title);world models(title)

AI总结 针对ARC-AGI-3的交互式抽象问题,提出编码智能体系统Tycho,通过结构化观测构建游戏模型,选定策略下GPT-5.6 Sol与Opus 5可达成100%相对人类行动效率并完成全部关卡。

Comments 52 pages, 18 figures, 17 tables. Open-source implementation: https://github.com/NIMI-research/Tycho

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28415 2026-07-31 cs.LG cs.AI cs.CV cs.MM cs.RO 新提交 91%

QQWorld: Quantile-Quantile Matching for World Model Regularization

QQWorld:用于世界模型正则化的分位数-分位数匹配

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28624 2026-07-31 cs.CV 新提交 90%

PhiZero: A World Model Built Around Physical Language

PhiZero:基于物理语言构建的世界模型

Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所NLPR)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 该研究提出围绕物理语言构建的PhiZero世界模型,采用先推理再渲染的范式,经实验验证其可建模物理连贯的世界演化,还具备交互式世界建模等应用潜力。

Comments Project page: https://phi-zero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28487 2026-07-31 cs.CV 新提交 89%

AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans

AuricularWorld:用于CT扫描中耳部结构细粒度分割的分层动作引导世界建模

Jingwen Yang, Senmao Wang, Luoyao Kang, Runmeng Cui, Keying Zhang, Yunjia Bao, Haifan Gong, Lin Lin, Haiyue Jiang

机构 * Plastic Surgery Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院北京协和医学院整形外科医院) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 通用世界模型 :world model(title);world model(title);world-model(abstract);world-model(abstract)

AI总结 该研究针对CT耳部细粒度分割难题,提出分层动作引导的AuricularWorld世界建模框架,通过迭代解剖学推理提升分割精度,使HD95降低超43%,验证了潜在世界模型推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22078 2026-07-31 cs.RO 版本更新 81%

Do World Action Models Generalize Better than VLAs? A Robustness Study

世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究

Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati, Rui Heng Yang, Yintao Ma, Amir Rasouli, Sajjad Pakdamansavoji, Yangzheng Wu, Lingfeng Zhang, Tongtong Cao, Feng Wen, Xinyu Wang, Xingyue Quan, Yingxue Zhang

机构 * Huawei Technologies(华为技术有限公司) University of Toronto(多伦多大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23969 2026-07-31 cs.RO 版本更新 73%

LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型

Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO;predictive model(abstract)

AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27865 2026-07-31 cs.CV 新提交 69%

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing

通过鲁棒3D化身放置学习理解肢体语言

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

机构 * National University of Science and Technology “Politehnica” Bucharest(布加勒斯特理工国立大学) “Simion Stoilow” Institute of Mathematics of the Romanian Academy(罗马尼亚科学院“西米翁·斯托伊洛夫”数学研究所) NORCE Norwegian Research Centre AS(挪威NORCE研究中心)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 该研究推出Drones2BodyLanguage数据集,结合轻量几何世界模型训练12种架构,可提升空中机器人对人类交际意图的感知准确率,为社交智能无人机提供数据支撑与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏