F4-ITS: Fine-grained Feature Fusion for Food Image-Text Search
机构 * HyperVerge
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * HyperVerge
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV
机构 * KIIT Deemed University(KIIT大学) ; Indian Institute of Technology (IIT) Bhubaneswar(印度理工学院(Bhubaneswar分校))
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
Comments Accepted at ASI @ ICCV 2025
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
机构 * The University of Sydney(悉尼大学) ; DeepGlint ; Imperial College London(伦敦帝国学院)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments 15 pages, 12 figures, Accepted by ACM MM2025, Webpage: https://garygutc.github.io/RealSyn
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; WeChat Vision, Tencent Inc.(腾讯公司)
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
机构 * Singapore Institute of Management(新加坡管理学院)
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL
机构 * University of Notre Dame(诺丁汉大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Dartmouth College(达特茅斯学院)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
Comments ACL 2025 Main Conference
机构 * Technical University of Munich(慕尼黑技术大学) ; Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments code & weights: https://github.com/xiong-zhitong/DOFA-CLIP
机构 * School of Information and Technology, Northwest University(信息与技术学院,西北大学)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments 21 pages, 8 figures
机构 * Huazhong University of Science and Technology(华中科技大学) ; La Trobe University(拉特罗布大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
机构 * Boston University(波士顿大学) ; MIT Lincoln Laboratory(麻省理工学院林肯实验室)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; Tsinghua University(清华大学) ; Institute of automation, Chinese academy of science(中国科学院自动化研究所) ; School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.AI
机构 * Agency for Defense Development(国防发展机构) ; Sookmyung Women’s University(苏镜女子大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted at IEEE/CVF WACV 2025, pp.6115-6124, 2025
Journal ref Proceedings of the Winter Conference on Applications of Computer Vision (WACV), 2025, pp.6115-6124
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.MM
机构 * Technische Universität Berlin(柏林技术大学) ; IIIT Hyderabad(海得拉巴国家理工学院) ; Univ of Maryland(马里兰大学) ; Rice Univ(Rice 大学) ; Univ of Wisconsin - Madison(威斯康星大学麦迪逊分校) ; Spector Inc(Spector 公司) ; Microsoft(微软公司)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
Comments 30 pages, 22 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=xkgfLXZ4e0
Journal ref ICLR-2025, Singapore
专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments Accepted to ICML2025
机构 * Cohere for AI Community(Cohere for AI社区) ; Cisco Meraki ; Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV
Comments Accepted at ReGenAI CVPR2025 Workshop as Oral
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV
机构 * Université Paris-Cité(巴黎-cite大学) ; Pôle d’Expertise de la Régulation Numérique (PEReN)(数字监管专家中心)
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV
机构 * CASIA ; UCAS ; CMCC ; CAIR, HKISI, CAS
专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments Technical report. Project page: https://foundationvision.github.io/Liquid/
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments 228 references
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments CVPR 2025. Project Page: https://4d-langsplat.github.io
专题命中 图文多模态 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV
Comments Tech Report
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV