Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models
专题命中 图文多模态 :multimodal(title);multimodal foundation model(title);分类 cs.CV、cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title);multimodal foundation model(title);分类 cs.CV、cs.CL
基于原型的PPG与加速度计信号自监督多模态学习
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Memphis(密苏里大学孟菲斯分校)
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。
探究跨模态技能注入:场景、方法与超参数
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; WeChat AI, Tencent Inc., China(腾讯公司,中国) ; The University of Hong Kong(香港大学)
专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。
看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调
机构 * School of Computing ; Augmented Intelligence, Arizona State University, Tempe, AZ, USA ; Department of Computer Science ; Engineering, Texas A\&M University, College Station, TX, USA
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。
重新思考患者教育作为多轮多模态交互
机构 * VA Bedford Health Care(VA贝德福德医疗中心) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; UMass Lowell(马萨诸塞大学洛厄尔分校) ; Yale University(耶鲁大学) ; National University of Singapore(新加坡国立大学) ; Yale School of Medicine(耶鲁医学院)
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MedImageEdu基准,通过多轮多模态交互提升患者教育效果,评估咨询过程和最终响应质量,发现多模态模型在视觉 grounding、安全性和情绪互动方面存在不足。
Comments Equal contribution for the first two authors
先caption,后VQA:知识密度而非任务格式驱动多模态扩展
机构 * vivo AI Lab(vivo人工智能实验室) ; Wuhan University(武汉大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。
Comments 23 pages, 4 figures, 10 tables. Preprint
视觉而无思维:多模态混合专家中的路由干扰
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究揭示多模态混合专家模型在视觉输入时路由机制无法有效激活任务相关专家,导致推理失败,提出路由干扰假说并验证其有效性。
具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。
Comments 28 pages, 3 figures
利用PDF数据提升日语大规模多模态模型
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(信息处理研究所)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文通过利用日本PDF数据提升日语大规模多模态模型的性能,采用自动化流程提取图像-文本对并构建指令数据,实验结果显示在Heron-Bench上性能提升达2.1%-13.8%。
Comments Accepted to ACL2025 Findings. Code: https://github.com/ku21fan/PDF-JLMM
Journal ref Findings of the Association for Computational Linguistics: ACL 2025
视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享
机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。
Comments 21 pages, 7 figures; Accepted by IEEE TIP
从复合图形到综合理解:开发一种从生物医学文献中基于医疗多图像基准测试和验证的多模态大语言模型
机构 * Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, CT 06510, USA(耶鲁医学院生物医学信息学与数据科学系,耶鲁大学,新 Haven,CT 06510,USA) ; School of Medicine, University of Puerto Rico, San Juan, PR 00921, USA(波多黎各大学医学院,波多黎各,San Juan,PR 00921,USA)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出M3LLM,一种基于生物医学文献中复合图像的多模态大语言模型,通过分而治之策略提升多图像理解能力,实验证明其在多图像、单图像等场景中表现优异。
通过语义补全与分解解决多模态情感检测中的情感差异
机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Nankai University(南开大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本文提出CoDe网络,通过语义补全与分解解决多模态情感检测中的情感差异问题,提升分类性能。
Comments Accepted by Pattern Recognition
机构 * Anhui Polytechnic University(安徽理工大学) ; Shanghai University(上海大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACM TOMM; Code and data are available at https://github.com/CoderChen01/InterCLIP-MEP
机构 * NTUST(国立台湾科技大学) ; Polytechnique Montréal(蒙特利尔理工学院)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 6 pages, BabyLM Workshop, EMNLP 2025
机构 * Soochow University(苏州大学) ; Baidu Inc.(百度公司) ; Shandong University(山东大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper is accepted by EMNLP2025
机构 * Salesforce AI Research(Salesforce AI研究院) ; Intel Labs(英特尔实验室) ; University of Washington(华盛顿大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * Apple(苹果公司)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments TMLR August 2025
机构 * College of Information Sciences and Technology(信息科学与技术学院) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Department of Computer Science and Engineering(计算机科学与工程系) ; National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in the COLM First Workshop on Pragmatic Reasoning in Language Models (PragLM), Montreal, Canada, October 2025, https://sites.google.com/berkeley.edu/praglm
机构 * Mila - Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; Meta FAIR ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Published at ICCV 2025
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in ICCV 2025 workshops
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Beihang University(北京航空航天大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACL2025 Main
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ECCV 2024
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 10 pages
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL 2025
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to COLING 2025
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL 2024
专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by IEEE Transactions on Multimedia
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project page: https://bzhao.me/MUG/