arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-12 至 2026-08-12 共收录 4 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 3 篇

2608.09449 2026-08-12 cs.CV 版本更新 93%

Sekai2: From World Exploration to Interactive World Modeling

Sekai2:从世界探索到交互式世界建模

Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world-model(abstract)

AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。

Comments Sekai2 dataset technical report. Developed at Alaya Lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19201 2026-08-12 cs.RO 版本更新 90%

OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation

OmniVTA: 用于接触密集机械操作的视觉-触觉世界建模

Yuhang Zheng, Songen Gu, Yupeng Zheng, Weize Li, Yujie Zang, Shuai Tian, Xiang Li, Ce Hao, Chen Gao, Si Liu, Haoran Li, Yilun Chen, Shuicheng Yan, Wenchao Ding

机构 * TARS Robotics(TARS机器人实验室) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) CASIA(中国科学院自动化研究所) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world-model(abstract);world-model(abstract)

AI总结 本文提出OmniVTA框架,结合预测接触建模与高频触觉反馈,通过大规模视觉-触觉-动作数据集提升接触密集操作的性能与泛化能力。

Comments Project Page: https://mrsecant.github.io/OmniVTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01073 2026-08-12 q-bio.NC 版本更新 67%

The Modeler-Schema Theory of Consciousness: Diffuse Awareness, Focal Experience, and a Saccadic Consistency Experiment

意识的模型者图式理论,附可证伪实验

Frank Heile

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 提出意识源于单一控制代理——模型者图式,它监控模型者构建内部世界模型的过程,通过将模型者输出转化为感受质产生体验,并用于模型优化;通过扫视变化检测实验区分两种自下而上注意请求,为意识难题提供可检验方案。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 仿真与规划 1 篇

2603.12231 2026-08-12 cs.LG 版本更新 81%

Temporal Straightening for Latent Planning

时间拉直用于隐式规划

Ying Wang, Oumayma Bounou, Gaoyue Zhou, Randall Balestriero, Tim G. J. Rudner, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) Brown University(布朗大学) University of Toronto(多伦多大学)

专题命中 仿真与规划 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 受人类视觉处理中感知拉直假说启发,提出时间拉直方法,通过曲率正则化联合学习JEPA世界模型的编码器和预测器,改善隐式规划中的表示学习,使梯度规划更稳定并提高目标到达任务成功率。

Comments ICML2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏