arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-13 至 2026-03-13 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2603.12250 2026-03-13 cs.CV 57%

DVD: Deterministic Video Depth Estimation with Generative Priors

DVD:利用生成先验的确定性视频深度估计

Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Jing He, Zixin Zhang, Haodong Li, Yihao Liang, Kanghao Chen, Bin Ren, Xu Zheng, Shuai Yang, Kun Zhou, Yinchuan Li, Nicu Sebe, Ying-Cong Chen

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DVD通过确定性方法将预训练视频扩散模型转化为单次通过深度回归器,解决视频深度估计中的生成与判别模型权衡问题,实现零样本性能提升并释放开源训练套件。

Comments Project: https://dvd-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24161 2026-03-13 cs.CV 57%

GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction

GeoDiff4D: 基于几何的扩散模型用于4D头像重建

Chao Xu, Xiaochen Zhao, Xiang Deng, Jingxiang Sun, Donglin Di, Zhuo Su, Yebin Liu

机构 * Tsinghua University(清华大学) Li Auto(利亚自动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏