arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-02 至 2026-07-02 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 9 篇

2602.05275 2026-07-02 cs.CV 版本更新 85%

Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs

Magic-MM-Embedding: 面向视觉令牌高效的多模态大语言模型通用嵌入

Qi Li, Yanzhe Zhao, Yongxin Zhou, Yameng Wang, Yandong Yang, Yuanjia Zhou, Jinxiang Liu

机构 * Honor Device Co., Ltd., China(荣耀终端有限公司,中国)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Magic-MM-Embedding,通过视觉令牌压缩架构和多阶段渐进训练策略,在通用多模态嵌入中实现高效率和最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07221 2026-07-02 cs.CV 版本更新 85%

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

病理学组合检索的组织病理学多模态嵌入

Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 跨模态检索 :multi-modal(title);MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00379 2026-07-02 cs.IR cs.CV 新提交 83%

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

属性提示核哈希用于无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) VinUniversity

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00060 2026-07-02 cs.CV 新提交 77%

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Anhui University(安徽大学)

专题命中 跨模态检索 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV

AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。

Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00798 2026-07-02 cs.CV 新提交 70%

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction

ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测

Yaofei Duan, Yuhao Huang, Tianyu Zhang, Yuan Gao, Luyi Han, Xin Wang, Xinyu Xie, Xinglong Liang, Chunyao Lu, Muzhen He, Patrick Pang, Yue Sun, Ning Mao, Tao Tan, Ritse Mann

机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00374 2026-07-02 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交 70%

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

学习组合:重新审视零样本组合图像检索的代理任务设计

Jingjing Zhang, Lei Zhang, Zheren Fu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23605 2026-07-02 cs.AI 版本更新 70%

SleepLM: Natural-Language Intelligence for Human Sleep

SleepLM:人类睡眠的自然语言智能

Zongzhe Xu, Zitao Shuai, Eideen Mozaffari, Ravi S. Aysola, Rajesh Kumar, Yuzhe Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。

Comments spotlight presentation

Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20817 2026-07-02 cs.IR cs.MM 57%

RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation

RAG-VisualRec: 一种面向电影领域的视觉与文本增强的检索增强生成推荐开放资源

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 本文提出RAG-VisualRec,通过结合LLM生成的项目描述和剪辑生成的视觉嵌入,提升多模态推荐系统的检索与生成能力,通过可配置融合策略和质量控制模块提高推荐效果和可复现性。

Comments 30 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00685 2026-07-02 cs.MA 新提交 50%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏