arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-29 至 2026-07-29 共收录 10 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 7 篇

2605.30880 2026-07-29 cs.CL cs.AI 版本更新 94%

PatchWorld: Gradient-Free Optimization of Executable World Models for Agent Environments

PatchWorld:可执行世界模型的免梯度优化

Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Zihao Wang, Lihui Liu, Jeff Z. Pan, Yangqiu Song

机构 * Hong Kong Baptist University(香港 Baptist 大学) Independent Researcher(独立研究员) HKUST(香港科技大学) Beijing Institute of Technology(北京理工大学) Southern University of Science and Technology(南方科技大学) Wayne State University(韦恩州立大学) University of Edinburgh(爱丁堡大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出 PatchWorld 框架,通过反例引导的代码修复将离线轨迹转化为可执行的 Python 世界模型,实现无需梯度优化的符号信念状态程序,在 AgentGym 环境中达到 76.4% 的宏观成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26056 2026-07-29 cs.RO 新提交 93%

INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models

INTACT:用于无搜索世界模型的同构意图到动作学习

Junhan Sun, Hao Zhao, Guofeng Zhang

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) InSpatio

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究针对前向潜在世界模型恢复动作需昂贵搜索的问题,提出INTACT方法,通过特定架构和技术实现意图到动作学习,在多任务上取得高成功率,减少采样并提升性能,还具有快速推理能力。

Comments 28 pages, 11 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25236 2026-07-29 cs.CL cs.RO 新提交 93%

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

视觉补丁世界:作为规划潜在结构化表示的代码世界模型

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究旨在构建用于规划的代码世界模型。提出VisualPatchWorld方法,先选定性动力学形式,再拟合参数。实验表明其平均规划成功率69.0%,超基线23.5分,在多方面接近真实引擎成功率,为自动构建有用的代码世界模型提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26040 2026-07-29 cs.LG stat.ML 新提交 86%

Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance

强化信息梦行者:通过潜在引导有效训练的非对称世界模型

Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst

专题命中 通用世界模型 :world model(title);world model(title);model-based reinforcement learning(abstract);分类 cs.LG

AI总结 研究基于模型的强化学习中,非对称学习对观测及特权信息表示的影响。针对‘信息梦行者’局限性,提出用潜在引导的新目标,形成‘强化信息梦行者’算法,实验显示其比之前非对称方法有更持续改进。

Comments 8 pages, 18 pages total, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25728 2026-07-29 cs.RO cs.AI cs.LG 新提交 73%

Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller

基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航

Thomas Hickling, Dylan Wynne, Yu Su, Nabil Aouf

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。

Comments 11 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05628 2026-07-29 hep-th 版本更新 67%

Entanglement Entropy and Complexity of Multicomponent Universe from Holography

从全息学角度研究多组分宇宙的纠缠度量

Ritam Mahanta, Gopinath Guin, Souvik Paul, Sunandan Gangopadhyay

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文提出了一种研究多组分宇宙全息信息理论量的方法,展示了双组分物质源的宇宙模型及其在不同时间尺度下的行为特征。

Comments 38 Pages, 1 Figure, Accepted for publication in Progress of Theoretical and Experimental Physics

Journal ref Prog. Theor. Exp. Phys. 2026 073B11

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20993 2026-07-29 cs.LG cs.AI stat.ML 版本更新 50%

Annotation-Assisted Learning of Treatment Policies From Multimodal Electronic Health Records

借助注释的学习:从多模态电子健康记录中学习治疗策略

Henri Arno, Thomas Demeester

机构 * Department of Information Technology Ghent University - imec(信息科技系根特大学 - imec)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本文提出AACE方法,通过专家注释辅助学习多模态EHR中的因果策略,提升治疗决策效果。

Comments Accepted at Machine Learning for Healthcare (MLHC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2607.26037 2026-07-29 cs.CV cs.GR 新提交 94%

Wonder: Video World Model Done Better

Wonder:改进的视频世界模型

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei

机构 * Adobe Research(Adobe研究院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 视频世界模型 :world model(title,abstract);video world model(title,abstract);world model(title,abstract);video world model(title,abstract)

AI总结 Wonder是用于实时相机可控世界探索的通用视频世界模型,通过系统级协同设计,包括新型相机条件设定、高效内存机制等,能合成多样视频,支持视频条件生成,保持长时间的连贯视觉效果。

Comments Project Page: https://wonder-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 1 篇

2606.31226 2026-07-29 cs.CV 版本更新 69%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 自动驾驶 :world-model(abstract);world-model(abstract);分类 cs.CV

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 1 篇

2607.25459 2026-07-29 cs.LG cs.AI q-fin.ST 新提交 56%

Emergent Latent-State Computation under Stochastic Volatility

随机波动率下的涌现潜态计算

Xiaoyu Huang, Lulu Wang

机构 * Temple University(天普大学) Dickinson College(迪金森学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 研究序列模型在部分可观测下如何表示潜在随机动态,发现在随机波动率设置中有两阶段计算,Transformer中潜态可解码性在特定阶段出现,输出头替换揭示部分退化原因,为机械可解释性提供有用基准。

详情

展开后加载摘要…

URL PDF HTML 收藏