Video Question Answering Using CLIP-Guided Visual-Text Attention
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Submitted to the 2023 IEEE International Conference on Image Processing (ICIP 2023)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Submitted to the 2023 IEEE International Conference on Image Processing (ICIP 2023)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.MM、eess.AS
Comments 11 pages, 8 figures, 5 Tables
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by ICLR 2023. Code is available at https://github.com/dhg-wei/DeCap
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Dataset available at https://open-vision-language.github.io/oven
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 5 pages, 1 figure
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 17 pages, 8 figures
Journal ref Foundation Models for Decision Making Workshop at Neural Information Processing Systems, 2022
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Source code is available at \url{https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/scdnet}
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by EMNLP 2022
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NeurIPS 2022 Oral (21 pages; the first three authors contributed equally)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Accepted by ACM MM2022. Code is available in GitHub
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by ECCV 2022. arXiv admin note: substantial text overlap with arXiv:2111.03930
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments To be published at ACM FAccT 2022
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Neurips 2021. Website at https://medhini.github.io/clip_it/
Journal ref Thirty-Fifth Conference on Neural Information Processing Systems. 2021
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Paper accepted at the CoNLL 2021 conference. This version: section added on the performance of the visual and visio-linguistic models on linquistic tasks
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Accepted at ACM Multimedia (ACMMM) 2021
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract)
Comments S.F. and J.R. contributed equally
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments AAAI 2021 (18 pages, 16 figures; webpage: https://fixmypose-unc.github.io/)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2020 (15 pages)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICLR 2019 (Oral). Project page: http://nscl.csail.mit.edu/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by NIPS 2018; Figure 1 was updated
CLIP-CC-Bench:评估视频语言模型中的段落级视频描述
机构 * South Dakota State University(南达科他州立大学)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV、cs.MM
AI总结 CLIP-CC-Bench是针对视频语言模型的长篇段落级视频描述评估套件,采用多LLM嵌入模型集成与粗细粒度语义匹配方法,评估17种模型填补了现有短片段基准的空白。
Comments Accepted and presented at EvalMG 2026, the Second Workshop on Evaluation for Multimodal Generation, co-located with ACM SIGIR 2026