Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 5 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 5 figures
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 19 pages, 14 figures. Code and data are available at https://github.com/qiujihao19/Artemis
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2024. This is not the camera-ready version. The Project page: http://www.lotvsmmau.net
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted by TCSVT (IEEE Transactions on Circuits and Systems for Video Technology)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.MM
Comments EMNLP 2023
Journal ref The 2023 Conference on Empirical Methods in Natural Language Processing
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Published at NeurIPS 2023
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 9 pages, 10 figures
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments This paper has been accepted by SCIENCE CHINA Information Sciences
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
Comments 24th Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments ACM CSUR (December 2022). Project Link: https://bit.ly/3Oimc7Q
Journal ref ACM Comput. Surv. (December 2022)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted by IEEE T-PAMI'23
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Working in progress
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 10 pages, 7 figures
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments 15 pages, 10 figures, 7 tables, Findings at ACL 2021
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments ACM Multimedia 2022 (MM'22)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments 9 pages, ACL Findings 2021
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments 14 pages, 7 figures, In proceeding of the ICCV21 workshop: AI for Creative Video Editing and Understanding 2021
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted by CVPR 2021
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments ECCV 2020 (extended version, with TVC dataset+models; 35 pages)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
Comments ACL 2020 (11 pages)
飞行训练期间多模态飞行员压力与疲劳的映射
专题命中 视频多模态 :multimodal(title)
AI总结 本研究结合生理信号与主观报告,分析学员飞行员飞行训练中的压力与疲劳模式,证实数据驱动方法可用于监测飞行员健康状态。
Comments Under Review
基于潜在流匹配的多模态时空大气数据同化
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Purdue University(普渡大学)
专题命中 视频多模态 :multimodal(title)
AI总结 该研究提出基于潜在流匹配的多模态时空大气数据同化方法,利用ERA5再分析数据训练先验,结合后验采样同化真实观测,可完成多种DA任务,从稀疏观测生成的集合预报性能达先进水平。
在 Belle II 中使用基于图的多模态轨道重建减轻探测器老化效应
专题命中 视频多模态 :multi-modal(title)
AI总结 研究 Belle II 探测器老化对轨道寻找的影响,采用基于图神经网络的算法,将轨道寻找设为全局关系聚类问题,经全探测器模拟评估性能,结果显示该算法在探测器老化时能提高鲁棒性,稳定跟踪性能。
Comments proceedings for Connecting The Dots 2025
用于联合纵向和事件发生时间建模的多模态经验贝叶斯变分自编码器
机构 * Fraunhofer-Chalmers Centre(弗劳恩霍夫-查尔默斯中心) ; Department of Electrical Engineering(电气工程系) ; Chalmers University of Technology(查尔姆斯理工大学)
专题命中 视频多模态 :multimodal(title)
AI总结 研究针对纵向肿瘤测量等多源数据整合难的问题,扩展EB-VAE框架用于联合纵向和事件发生时间建模,比较不同解码器公式,纳入基因组协变量,实现肿瘤生长等联合预测,确定相关基因指标,提供了灵活概率框架。