arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-29 至 2026-07-29 共收录 6 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4 篇

2607.26056 2026-07-29 cs.RO 新提交 93%

INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models

INTACT:用于无搜索世界模型的同构意图到动作学习

Junhan Sun, Hao Zhao, Guofeng Zhang

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) InSpatio

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究针对前向潜在世界模型恢复动作需昂贵搜索的问题,提出INTACT方法,通过特定架构和技术实现意图到动作学习,在多任务上取得高成功率,减少采样并提升性能,还具有快速推理能力。

Comments 28 pages, 11 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25236 2026-07-29 cs.CL cs.RO 新提交 93%

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

视觉补丁世界:作为规划潜在结构化表示的代码世界模型

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究旨在构建用于规划的代码世界模型。提出VisualPatchWorld方法,先选定性动力学形式,再拟合参数。实验表明其平均规划成功率69.0%,超基线23.5分,在多方面接近真实引擎成功率,为自动构建有用的代码世界模型提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26040 2026-07-29 cs.LG stat.ML 新提交 86%

Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance

强化信息梦行者:通过潜在引导有效训练的非对称世界模型

Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst

专题命中 通用世界模型 :world model(title);world model(title);model-based reinforcement learning(abstract);分类 cs.LG

AI总结 研究基于模型的强化学习中,非对称学习对观测及特权信息表示的影响。针对‘信息梦行者’局限性,提出用潜在引导的新目标,形成‘强化信息梦行者’算法,实验显示其比之前非对称方法有更持续改进。

Comments 8 pages, 18 pages total, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25728 2026-07-29 cs.RO cs.AI cs.LG 新提交 73%

Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller

基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航

Thomas Hickling, Dylan Wynne, Yu Su, Nabil Aouf

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。

Comments 11 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2607.26037 2026-07-29 cs.CV cs.GR 新提交 94%

Wonder: Video World Model Done Better

Wonder:改进的视频世界模型

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei

机构 * Adobe Research(Adobe研究院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 视频世界模型 :world model(title,abstract);video world model(title,abstract);world model(title,abstract);video world model(title,abstract)

AI总结 Wonder是用于实时相机可控世界探索的通用视频世界模型,通过系统级协同设计,包括新型相机条件设定、高效内存机制等,能合成多样视频,支持视频条件生成,保持长时间的连贯视觉效果。

Comments Project Page: https://wonder-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 1 篇

2607.25459 2026-07-29 cs.LG cs.AI q-fin.ST 新提交 56%

Emergent Latent-State Computation under Stochastic Volatility

随机波动率下的涌现潜态计算

Xiaoyu Huang, Lulu Wang

机构 * Temple University(天普大学) Dickinson College(迪金森学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 研究序列模型在部分可观测下如何表示潜在随机动态,发现在随机波动率设置中有两阶段计算,Transformer中潜态可解码性在特定阶段出现,输出头替换揭示部分退化原因,为机械可解释性提供有用基准。

详情

展开后加载摘要…

URL PDF HTML 收藏