Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing
通过多尺度卷积和动态路由实现下一代网络的语义视频通信
机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院) ; Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心) ; Amazon(亚马逊)
专题命中 视频理解 :video-language(abstract);分类 cs.CV
AI总结 针对视频流量增长需求,提出语义视频通信框架,用多尺度时间卷积编码器捕捉运动模式,基于胶囊的动态路由机制优化关联,多任务学习统一组件,在实验中取得显著改进。
Comments Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)