ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV
Comments 21 pages, 16 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV
Comments 21 pages, 16 figures
机构 * ByteDance Douyin SAIL Team, CUHK MMLab(字节跳动抖音SAIL团队,CUHK MMLab)
专题命中 跨模态检索 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Technical Report
机构 * Show Lab, National University of Singapore(新加坡国立大学展示实验室) ; Central South University(中南大学) ; Microsoft(微软公司)
专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract);image-text(abstract)
Comments Project page: this https://linyq17.github.io/VC2L/
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments 9 pages, 6 figures, under peer review
机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; NingboTech University(宁波科技大学) ; Zhejiang University(浙江大学)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 跨模态检索 :image-text(title,abstract);multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments 16 pages, 10 figures
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2025
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL
专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.MM
专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.AI
专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);MLLM(abstract);cross-modal(abstract)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2024
专题命中 跨模态检索 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments NeurIPS 2023
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments This paper has been accepted by the ACM International Conference on Multimedia (ACM MM '23, October 29-November 3, 2023, Ottawa, ON, Canada)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CL
Comments accepted to ACL 2023 Findings
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI
Comments ICLR 2023, update
专题命中 跨模态检索 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by SIGIR'2023
Journal ref Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2023)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by CVPR 2023. Codes are available at this https://github.com/anosorae/IRRA
专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CBMI 2022
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CL
Comments The paper has been accepted by the main conference of ACL2021 as a long paper
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted at CBMI 2021
专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
Comments 2nd CLVISION workshop in CVPR 2021
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments 22 pages, accepted in AAAI 2021
专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments ACM Multimedia 2019 Oral
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments 10 pages, 6 figures, Accepted as spotlight at CVPR 2018
先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; AT&T Chief Data Office(AT&T首席数据办公室)
专题命中 跨模态检索 :MLLM(summary_cn,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。
Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/