Scaling Dense Event-Stream Pretraining from Visual Foundation Models
从视觉基础模型扩展密集事件流预训练
机构 * City University of Hong Kong(香港城市大学) ; Xidian University(西安电子科技大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种基于视觉基础模型的自监督预训练方法,通过结构感知的蒸馏损失优化密集事件表示,显著提升下游任务性能。