Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。
Comments Published in ACM MM 2025. Address some typos