Extracting Molecular Properties from Natural Language with Multimodal Contrastive Learning
专题命中 跨模态检索 :multimodal(title);分类 cs.CL、cs.AI
Comments 2023 ICML Workshop on Computational Biology
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :multimodal(title);分类 cs.CL、cs.AI
Comments 2023 ICML Workshop on Computational Biology
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV、cs.MM
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.CL
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV、cs.CL
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.MM
Comments Demo video at: https://www.youtube.com/watch?v=3XJvLjSWieY
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV、cs.CL
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV、cs.AI
Comments 7 pages, 4 figures, ICML 2017 Workshop on Implicit Models
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI
Comments IEEE International Conference on Robotics and Automation (ICRA), 2017
专题命中 跨模态检索 :image-text(title);分类 cs.CV、cs.CL
LLaVE: 大规模语言和视觉嵌入模型与基于难度加权的对比学习
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)
专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 LLaVE通过基于难度加权的对比学习提升多模态嵌入模型性能,实现SOTA表现和强泛化能力。
Comments Accepted by Findings of EMNLP 2025
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)
Comments Accepted at Neural Information Processing Systems (2025)
机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Preprint, 27 pages, 3 figures
专题命中 跨模态检索 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by AAAI 2025
专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Technical Report
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments 7 pages, 8 figures, 2 tables, accepted by The Web Conference 2020
重排序器所见:面向长文档多模态问答的多方面页面标注
机构 * Emory University(埃默里大学) ; Hippocratic AI(希波克拉底人工智能公司)
专题命中 跨模态检索 :multimodal(title);分类 cs.AI
AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。
基础模型在多视图多模态心脏MRI分割与直接射血分数估算中的适配
机构 * Maastricht University(马斯特里赫特大学) ; University Hospital Münster(明斯特大学医院) ; Eindhoven University of Technology(埃因霍温理工大学)
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV
AI总结 本研究针对CMR-Multi挑战,微调CineMA并组合冻结CMR基础模型,实现多视图CMR分割与直接LVEF估算,验证了基础模型适配多视图CMR分析的有效性。
零成本虚拟RNA:通过跨模态WSI检索近似免疫治疗特征
机构 * Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) ; IRB Lleida(莱里达生物医学研究所)
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV
AI总结 针对胃腺癌免疫治疗RNA特征检测成本高的问题,提出VITA模型,通过H&E与RNA跨模态对齐实现仅用H&E切片近似RNA特征,取得0.72准确率等结果,提供低成本预筛选工具。
Comments Accepted to MIDL 2026 Short Paper track
图像跨域检索:一种多模态方法
机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电气与电子工程系)
专题命中 跨模态检索 :multimodal(title);分类 cs.CV
AI总结 本文提出Caption-Matching方法,利用预训练视觉语言模型生成的图像描述作为中间表示,实现跨域图像检索,无需标注数据或进一步训练,在Office-Home和DomainNet上取得显著提升。
关于多模态表示学习中的模态差距和对比损失
机构 * Technical University of Denmark(丹麦技术大学)
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV
AI总结 研究CLIP风格双编码器对比学习中的模态差距,发现是InfoNCE公式在低温下的模式失败所致。提出xNCE方法,使用跨模态和模态内负对比对,能缩小模态差距,提升零样本分类性能且不牺牲判别几何。
一框架适用于所有:生成模型的跨模态成员推理
专题命中 跨模态检索 :cross-modal(title);分类 cs.AI
AI总结 研究生成模型的跨模态成员推理问题,基于生成模型输出分布可近似训练数据分布的特性,在共享嵌入空间建模,通过似然比测试推理,贡献统一框架,性能优于现有方法。
用于严重狭窄分类的心电图与血管造影表示的跨模态对比学习
机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich and TUM University Hospital(人工智能在医疗与医学中的研究所,慕尼黑技术大学及慕尼黑大学医院) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) ; Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML)) ; Department of Internal Medicine, TUM University Hospital(慕尼黑大学医院内科学系)
专题命中 跨模态检索 :cross-modal(title);分类 cs.AI
AI总结 提出StenCE预训练框架,通过跨模态对比学习从心电图特征中实现冠状动脉狭窄风险分层,在严重狭窄分类中首次达到高性能。
CCTVBench:用于多模态大语言模型的对比一致性交通视频问答基准
机构 * Technical University of Munich(慕尼黑技术大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(title);分类 cs.CV
AI总结 CCTVBench通过真实事故视频与世界模型生成的反事实场景配对,提出对比一致性评估方法,揭示视频问答中对比一致性与标准指标间的显著差距,并引入C-TCD方法提升问答与一致性性能。
基于大语言模型的多模态推荐
专题命中 跨模态检索 :multimodal(title);分类 cs.AI
AI总结 本文提出LMMRec框架,通过建模用户动机提升推荐系统的可解释性和说服力,实验表明其在三个真实数据集上效果显著。
Comments There are some writing errors in our methods section that need to be corrected. We will then add extensive experiments and rewrite the Introduction and related work sections
突破几何瓶颈:不对称跨模态蒸馏中的对比扩展
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV
AI总结 本研究通过对比扩展方法解决不对称跨模态蒸馏中的维度坍缩问题,揭示了容量与密度之间的权衡关系。
Comments Introduced auxiliary InfoNCE objective to reverse dimensional collapse. Expanded experiments to DINOv2 teacher and CIFAR-100 dataset. 3 pages, 3 figures, 2 tables
双相跨模态对比学习用于CMR引导的ECG表示以评估心血管疾病
机构 * Amsterdam University Medical Center(阿姆斯特丹大学医学中心) ; University of Amsterdam(阿姆斯特丹大学) ; ETH Zurich(苏黎世联邦理工学院) ; Department of Radiology and Nuclear Medicine, Amsterdam University Medical Center(放射医学与核医学系,阿姆斯特丹大学医学中心) ; Department of Radiology, Mayo Clinic, Rochester(放射医学系,梅奥诊所,罗切斯特)
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV
AI总结 本文提出双相跨模态对比学习方法,通过结合ECG和CMR数据提升心血管疾病评估的ECG表示能力。
Comments Paper accepted at SPIE Medical Imaging 2026 Conference
专题命中 跨模态检索 :multimodal(title);分类 cs.CV
Comments 38 pages, 8 figures, survey paper
专题命中 跨模态检索 :multi-modal(title);分类 cs.AI
Comments Accepted in NeurIPS 2025