Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image Analysis
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 4 Pages, 4 Figures, 1 Table
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 4 Pages, 4 Figures, 1 Table
机构 * Inria(法国国家信息与自动化技术研究院) ; Département d’informatique de l’ENS, CNRS, PSL Research University(巴黎高等师范学院计算机科学系、国家科学研究中心、巴黎综合理工研究学院) ; Institut du développement et des ressources en informatique scientifique, CNRS(科学信息发展与资源研究所、国家科学研究中心) ; Sorbonne Université(索邦大学) ; Common Crawl Foundation(Common Crawl基金会) ; Université Paris-Saclay(巴黎萨克雷大学)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments ACL 2025 (Findings)
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2024. Project is available at https://github.com/baaivision/DenseFusion
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);image-text(abstract)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at EMNLP 2024 Main Conference, 16pages
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 36 pages, 10 figures. Github https://github.com/NJU-LHRS/LHRS-Bot
专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.MM
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 6 figures, 4 tables
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.AI
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 12 pages, 9 figures, Accepted by TIP2024
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Long paper at EMNLP'23-Main
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 20 pages
专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM
Comments Accepted to WWW2023
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Some data problems cannot be obtained
机构 * Technical University of Berlin(柏林技术大学) ; Technical University of Munich(慕尼黑技术大学) ; CARIAD SE ; Volkswagen AG(大众集团)
专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025 - main track. Project page: https://focus-mllm-vqa.github.io/
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments This paper is the outcome of the Chinese multi-modal pre-training project called 'WenLan'
专题命中 图文多模态 :multimodal(title);multimodal foundation model(title);multi-modal(abstract)
专题命中 图文多模态 :multimodal(title);image-text(title);分类 cs.CV、cs.CL、cs.AI
Comments 8 pages, 2 figures, conference
派利淘-多模态搜索:构建原生电子商务多模态搜索基础
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。
Comments Technical Report: Pailitao-MMSearch
MedPMC:一种用于为基础模型扩展高保真医学多模态数据的系统框架
机构 * Yale University(耶鲁大学) ; Korea University(韩国大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; The University of Queensland(昆士兰大学) ; The University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) ; University of Washington(华盛顿大学) ; Microsoft Research(微软研究院)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 研究针对医学多模态基础模型受高质量临床数据限制问题,提出MedPMC框架,将文献转化为高保真基础设施。经实验,该框架整理大量图像-文本对,在多方面评估表现出色,训练模型在多基准测试和临床场景中效果显著,还公开相关资源。
Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性
机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) ; Khalifa University(卡利法大学) ; Michigan State University(密歇根州立大学) ; Australian National University(澳大利亚国立大学)
专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。
Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025
探索大语言模型编码器在胸部X光片图像-文本检索中的能力
机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(生物工程跨学科项目,首尔国立大学研究生院) ; Integrated Major in Innovative Medical Science, Seoul National University Graduate School(创新医学科学整合专业,首尔国立大学研究生院) ; Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第一附属医院放射科) ; Seoul National University College of Medicine(首尔国立大学医学院) ; Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) ; Institute of Medical and Biological Engineering, Seoul National University Medical Research Center(医学与生物工程研究所,首尔国立大学医学研究所以及) ; Institute of Radiation Medicine, Seoul National University Medical Research Center(放射医学研究所,首尔国立大学医学研究所以及)
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出一种领域自适应的双向大语言模型文本编码器,通过掩码标记预测和监督对比学习训练,结合参数高效的双塔对比视觉语言框架,提升胸部X光片图像与文本的对齐和检索性能。
Comments 12 pages, 2 figures, under review
GOMA:从图信号平滑视角迈向结构驱动的多模态对齐
机构 * School of Airspace Science and Engineering, Shandong University(山东大学 airspace 科学与工程学院) ; Department of Computer Science, Beijing Institute of Technology(北京理工大学计算机学院) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 GOMA通过统一设计解决多模态对齐中的拓扑障碍、平滑控制与信息保留问题,在七个多模态图基准上取得最佳检索性能并保持稳定性。
Mario:基于大语言模型的多模态图推理
机构 * New York University Shanghai(上海纽约大学) ; New York University(纽约大学) ; Tsinghua University(清华大学) ; EPFL(瑞士联邦理工学院洛桑)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。
Comments CVPR 2026
MLLMEraser: 通过激活引导在多模态大语言模型中实现测试时遗忘
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Huawei(华为)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.AI
AI总结 MLLMEraser通过激活引导实现多模态大语言模型的测试时遗忘,无需训练且有效降低计算成本,同时保持保留知识的效用。