Tem-adapter: Adapting Image-Text Pretraining for Video Question Answer
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments ICCV 2023
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments ICCV 2023
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments Published in Transactions on Machine Learning Research ( https://jmlr.org/tmlr/ ). 18 pages, 4 figures
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments 24th Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL)
专题命中 视频问答 :long video(abstract);分类 cs.CV
Comments Accepted to ICCV2023
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments Accepted in ITSC2023
专题命中 视频问答 :text-to-video(abstract);分类 cs.CV
Comments Accepted paper at CVPR 2023
专题命中 视频问答 :long video(abstract);分类 cs.MM
Comments Accepted for publication at the 2023 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2023)
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments Accepted at ICDM 2022 FOMO-VL workshop
Journal ref 2022 IEEE International Conference on Data Mining Workshops (ICDMW), Orlando, FL, USA, 2022, pp. 958-966
专题命中 视频问答 :long video(abstract);分类 cs.CV
Comments Accepted to WACV'23
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments BMVC 2022. Code is available at https://github.com/shinying/dest
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments Preprint of LAVIS technical report
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments *: Equal contribution; COLING 2022 oral; project webpage: https://lit.eecs.umich.edu/wildqa/
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments Accepted at NAACL 2022 (Oral)
专题命中 视频问答 :text-to-video(abstract);分类 cs.CV
Comments 19 pages, 8 figures
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments 11 pages, 5 figures, Code: https://github.com/jingjing12110/LiVLR-VideoQA
专题命中 视频问答 :video reasoning(abstract);分类 cs.CV
Comments Accepted by IJCNN 2021
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments 9 pages, This paper is accepted by ICMR 2021
专题命中 视频问答 :long video(abstract);分类 cs.CV
Comments 15 pages, 18 figures, and 10 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). arXiv admin note: substantial text overlap with arXiv:2004.13931
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021
专题命中 视频问答 :text-to-video(abstract);分类 cs.CV
Comments 12 pages, 5 figures, 11 tables. - Happy Chinese New Year!
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments 15 pages, 11 figures, accepted to AAAI 2021
专题命中 视频问答 :text-to-video(abstract);分类 cs.CV
Comments Accepted to AAAI 2021
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments ECCV2020 (spotlight)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:1910.10706
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
专题命中 视频问答 :long video(abstract);分类 cs.CV
Comments Accepted at AAAI 2019
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments To appear in ECCV 2018. 17 pages
OmniRAG-Agent:面向低资源长音频视频的代理多模态推理
专题命中 视频问答 :video reasoning(abstract)
AI总结 本文提出OmniRAG-Agent,通过构建图像音频检索增强生成模块和代理循环,解决低资源长音频视频问答中的高成本编码、弱细粒度检索等问题,实验表明其在低资源环境下表现优异。
专题命中 视频问答 :long video(abstract)
Comments 6 pages, 3 figures
专题命中 视频问答 :video language model(abstract)
专题命中 视频问答 :video understanding(abstract)