arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-12 至 2026-08-12 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1 篇

2608.10744 2026-08-12 cs.CV 新提交 57%

Beyond Pixels: From Video Priors to 4D Worlds

超越像素:从视频先验到4D世界

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。

Comments Project page: https://hayd-zju.github.io/Beyond-Pixels

详情

展开后加载摘要…

URL PDF HTML 收藏