Multimodal Masked Autoencoders Learn Transferable Representations
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments Accepted at ECCV 2022
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments 9 pages, 7 figures
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 14 pages, 4 figures
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
Comments 9 pages, 8 figures including appendix figure, 2 tables. Published in Findings of ACL workshop, CONSTRAINT 2022 (Long paper). The manuscript is slightly revised after the camera ready version
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments Accepted to CVPR 2022
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments Accepted at the IEEE International Symposium on Biomedical Imaging (ISBI) 2022 as an oral presentation
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by 2021 ACMMM Open Source Software Competition. Source code: https://github.com/YehLi/xmodaler
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
Comments 10 pages, 4 figures
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 12 pages, 1 figure, 7 tables
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by IJCAI 2021
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper is accepted by ACM International Conference on Multimedia Retrieval (ICMR), 2021
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments accepted by AAAI-2020. arXiv admin note: text overlap with arXiv:1909.11740 by other authors
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.MM
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CL
Comments 7 pages
Journal ref 2019 Annual Conference of the North American Chapter of the Association for Computational Linguistics
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments Published in BMVC 2018
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.MM
机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul 06974, Republic of Korea(人工智能系,成均馆大学,韩国首尔)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract)
Comments Multi-modal, Multi-modal Representation Learning, Missing Modality, Missing Modality Reconstruction, Speech and Multi-modality, Vision and Language
SARVLM:一种用于SAR图像语义理解的视觉语言基础模型
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Yuelushan Center for Industrial Innovation(岳麓山创新中心) ; School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);image-text(abstract)
AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。
Comments 13 pages, 13 figures
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);multimodal foundation model(abstract)
Comments 18 pages
学习多模态伪标签以实现鲁棒的开放词汇实例和全景分割
机构 * Seoul National University of Science and Technology(首尔科技大学) ; Chung-Ang University(中央大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 该研究针对开放词汇实例分割与开放集全景分割的痛点,提出多模态框架,结合预训练视觉语言模型生成伪标签并优化训练目标,在COCO数据集上取得优于现有SOTA的性能。
Comments 14 pages
Journal ref Neurocomputing, 2026
通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉
机构 * Meta AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。
乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模
机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic ; University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic ; Centrum Wiskunde \& Informatic Leiden University University College London ; Vrije University of Amsterdam ; Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University ; Vrije University of Amsterdam Centrum Wiskunde \& Informatic
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。
Comments This version has been accepted by ICMI 2026 Conference
统一多模态模型用于脑MRI补全与理解
机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) ; Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出UniBrain模型,通过统一训练策略联合处理脑MRI模态补全与图像理解,采用自对齐和动态隐藏状态机制,在多疾病数据集上实现高性能。
Comments Early accepted to MICCAI 2026
SynIB: 多模态学习中最大化协同的信息瓶颈
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 提出SynIB方法,通过信息瓶颈理论直接优化多模态协同,在训练中屏蔽单模态时惩罚高置信度,提升跨模态推理能力,在合成和真实任务上准确率提升达7.8%。