EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding
EVIDENT: 通过实体锚定的视觉证据路由MLLM适配用于跨域视频时间定位
机构 * Kyung Hee University(庆尚大学) ; University of Southern California(南加州大学) ; Seoul National University(首尔国立大学)
AI总结 针对视频时间定位中域迁移导致性能下降的问题,提出EVIDENT框架,通过实体瓶颈适配器、实体绑定蒸馏损失和实体到证据门控机制,利用预训练MLLM的实体注意力实现参数高效的跨域鲁棒时间定位。