arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-30 至 2026-07-30 共收录 4 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA
2601.15284 2026-07-30 cs.CV 版本更新 93%

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25337 2026-07-30 cs.CL cs.RO 版本更新 92%

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

时间距离联合嵌入预测架构:用于潜在世界模型预测控制的计划感知表示学习

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world-model(abstract)

AI总结 研究提出时间距离联合嵌入预测架构(TD-JEPA),保留LeWM编码器-预测器主干,从无奖励轨迹挖掘有向时间成本。该方法缩小JEPA世界模型规划器训练-规划差距,在多个环境中表现优于LeWM及其他基线,通过挖掘成本提升成功率和分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24149 2026-07-30 cs.CL 版本更新 90%

Large Emotional World Model

大规模情感世界模型

Changhao Song, Yazhou Zhang, Hui Gao, Chang Yang, Peng Zhang

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出大规模情感世界模型,通过构建情感-原因-方式数据集,整合情感因素以提升对情感驱动社会行为的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03701 2026-07-30 cs.CV 版本更新 69%

VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning

VidNum-1.4K:一个全面的视频基于数值推理基准

Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出VidNum-1.4K基准,通过1379个严格人工标注的视频问题对,评估视频基于的数值推理能力,揭示当前VLMs在多步骤逻辑推理上的不足。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏