arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-14 至 2026-04-14 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1 篇

2604.11331 2026-04-14 cs.CV cs.CG 57%

Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale

任何3D场景都值得1000个标记:面向大规模场景生成的3D grounded表示

Dongxu Wei, Qi Xu, Zhiqi Li, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Zhaopeng Cui, Peidong Liu

机构 * Westlake University(西湖大学) Afari Intelligent Drive(阿法里智能驾驶) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出在隐式3D潜在空间中直接生成3D场景,解决传统2D方法在3D空间扩展中的不足,通过3DRAE和3DDiT实现高效且一致的3D生成。

Comments Under Review. Project Page: https://wswdx.github.io/3DRAE

详情

展开后加载摘要…

URL PDF HTML 收藏