arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-01 至 2026-07-01 共收录 10 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 5 篇

2606.31232 2026-07-01 cs.AI 新提交 94%

Delta-JEPA: Learning Action-Sensitive World Models via Latent Difference Decoding

Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型

Zhenghao Zhang, Yuanxiang Wang, Zhenyu Guan, Yujia Yang, Bingkang Shi, Tianyu Zong, Hongzhu Yi, Guoqing Chao, Xingchen Chen, Tiankun Yang, Chenxi Bao, Tao Yu, Jingjing Zhou, Jungang Xu

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Computer Science and Technology, Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Faculty of Computing, Harbin Institute of Technology, Harbin(哈尔滨工业大学计算学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出Delta-JEPA,一种无重建的世界模型,通过潜在差异动作解码器(LDAD)从连续观测的潜在位移中重建动作,防止表示坍塌,提升基于规划的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31689 2026-07-01 cs.SE 新提交 92%

ScratchWorld: Evaluating If World Models Compute Executable Consequences

ScratchWorld: 评估世界模型是否计算可执行后果

Yufeng Lin, Jialu Zhang

专题命中 通用世界模型 :world model(title);world models(title);world model(title);world models(title)

AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32026 2026-07-01 cs.LG cs.AI 新提交 90%

AdaJEPA: An Adaptive Latent World Model

AdaJEPA:一种自适应潜在世界模型

Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) AMI Labs(AMI实验室)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出AdaJEPA,一种在模型预测控制闭环中进行测试时自适应的潜在世界模型,通过自监督信号持续校准模型,显著提升规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 81%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31561 2026-07-01 hep-th gr-qc hep-ph 新提交 67%

Kaluza-Klein Gravitons in a Higher Curvature Warped Geometry : A New Perspective

高曲率翘曲几何中的卡鲁扎-克莱因引力子:一个新视角

Abhirup Karmakar, Isika Mandal, Soumitra SenGupta

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文在五维f(R)引力翘曲膜世界中,通过欧几里得路径积分求解引力子涨落的薛定谔方程,得到高曲率修正对KK引力子谱和耦合的影响,发现质量上移、截面压低而衰变宽度增强。

Comments 31 pages, 6 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2606.31734 2026-07-01 cs.CV 新提交 96%

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 1 篇

2606.31941 2026-07-01 cs.RO cs.AI 新提交 56%

LeCropFollow: Latent Space Planning for Navigation in Unstructured Crop Fields

LeCropFollow:非结构化农田中导航的潜在空间规划

Felipe Tommaselli, Francisco Affonso, Arthur Pompeu, Gianluca Capezzuto, Arun Narenthiran Sivakumar, Girish Chowdhary, Marcelo Becker

机构 * University of São Paulo(圣保罗大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 具身与机器人 :model-based reinforcement learning(abstract);分类 cs.AI、cs.RO

AI总结 提出LeCropFollow框架,利用自监督语义热图和基于模型的强化学习规划器在潜在流形中优化轨迹,无需几何建模,实现从简化模拟到真实世界的零样本迁移,在玉米田间隙中语义故障减少2.4倍。

Comments 8 pages, 7 figures, 3 tables. Github Repo: https://github.com/Felipe-Tommaselli/lecropfollow

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 自动驾驶 2 篇

2606.29879 2026-07-01 cs.CV cs.AI 版本更新 88%

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划

Chen Yang, Yuhao Wei, Ze Xu, Ziheng Zou, Shuang Liang, Delin Ouyang, Lingfeng Qi, Jie Li, Guofa Li

机构 * Chongqing University(重庆大学)

专题命中 自动驾驶 :world-model(title,abstract);world-model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 71%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模型式强化学习 1 篇

2507.18606 2026-07-01 quant-ph cs.LG 版本更新 50%

Quantum Bayesian Networks Can Speed up Reinforcement Learning in Partially Observable Environments

量子贝叶斯网络可以加速部分可观察环境中的强化学习

Gilberto Cunha, Alexandra Ramôa, André Sequeira, Michael de Oliveira, Luís Barbosa

机构 * High-Assurance Software Laboratory (HASLab), INESC TEC, Portugal(高可信软件实验室(HASLab),INESC TEC,葡萄牙) Department of Computer Science, University of Minho, Portugal(米尼奥大学计算机科学系,葡萄牙) International Iberian Nanotechnology Laboratory (INL), Portugal(国际伊比利亚纳米技术实验室(INL),葡萄牙)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.LG

AI总结 提出量子贝叶斯强化学习(QBRL),利用量子拒绝采样和幅度放大加速稀疏贝叶斯网络上的推理,实现部分可观察环境中基于模型的强化学习,在稀疏动力学环境下获得亚二次加速。

详情

展开后加载摘要…

URL PDF HTML 收藏