ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning
ICDepth: 通过上下文条件化驯服视频扩散模型用于视频深度估计
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出ICDepth框架,利用上下文条件化(ICC)将预训练文本到视频扩散Transformer适配到视频深度估计,通过SAND-Attention确保时空对齐和SRFM注入语义分辨率先验,仅用0.8M帧训练数据即达到SOTA并展现强零样本泛化。
Comments Accepted to ECCV 2026. Project page: https://xuanhuahe.github.io/ICDepth/