arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-11 至 2026-05-11 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2605.07655 2026-05-11 cs.CV cs.AI 81%

Towards Billion-scale Multi-modal Biometric Search

迈向十亿级多模态生物特征搜索

Arka Koner, Chetan S. Naik, Lokesh Kurre, Vivek Raghavan, Barada P. Sabut, Tanusree Deb Barma, Anoop M. Namboodiri, Anil K. Jain

机构 * Unique Identification Authority of India(印度唯一身份权威机构) IIIT Hyderabad(海得拉巴IIIT) Michigan State University(密歇根州立大学)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Bharat ABIS系统,通过多模态预处理和特征提取实现十亿级生物特征库的1:N搜索,验证了其在印度Aadhaar数据库上的高效性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07683 2026-05-11 cs.LG cs.AI 79%

Multimodal Cancer Modeling in the Age of Foundation Model Embeddings

多模态癌症建模:在基础模型嵌入时代

Steven Song, Morgan Borjigin-Wang, Irene Madejski, Robert L. Grossman

机构 * Center for Translational Data Science(转化数据科学中心) Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Medical Scientist Training Program(医学科学家培训计划) Brown University(布朗大学) Section of Biomedical Data Science(生物医学数据科学部门) Department of Medicine(医学系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文探讨了利用基础模型嵌入进行多模态癌症建模的可能性,展示了多模态融合的优势,并评估了病理报告文本和文本摘要对模型性能的影响。

Comments camera ready version for ML4H 2025, typo corrected

Journal ref Proceedings of the Fifth Machine Learning for Health Symposium, PMLR 297:202-227, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03728 2026-05-11 cs.CV cs.AI 73%

CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval

CSMCIR: 基于记忆库的增强对称对齐用于复合图像检索

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li, Xiaoshuai Sun

机构 * Kuaishou Technology(快播科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CSMCIR,通过多级链式思维提示策略、对称双塔架构和熵基记忆库策略,实现高效查询-目标对齐,提升复合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04565 2026-05-11 cs.MA cs.CL 70%

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

从独立大语言模型到整合智能:复合AI系统综述

Jiayi Chen, Junyi Ye, Guiling Wang

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18715 2026-05-11 cs.CV 70%

ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval

ChatSearch: 一个用于通用对话图像检索的数据集和生成检索模型

Zijia Zhao, Longteng Guo, Tongtian Yue, Erdong Hu, Shuai Shao, Zehuan Yuan, Hua Huang, Jing Liu

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Bytedance Inc.(字节跳动公司) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出ChatSearch数据集和生成检索模型,用于开放领域图像的对话式检索,通过多轮多模态对话上下文查询提升检索准确性。

Journal ref Pattern Recognition, 167 (2025) 111696

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23370 2026-05-11 cs.CV 57%

GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval

GRAPE:通过检索排名监督查询重写

Zhaohua Zhang, Jianhuan Zhuo, Muxi Chen, Chenchen Zhao, Wenyu Jiang, Tianwen Jiang, Mingyang Chen, Yutang, Qiuyong Xiao, Jihong Zhang, Zhixun Su

机构 * Dalian University of Technology, Dalian, China(大连理工大学) Tencent HunYuan Data, Shenzhen, China(腾讯混元数据)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 GRAPE通过组相对策略优化提升检索排名,改进多语言、长文本和多模态查询的检索性能,平均提升Recall@10 4.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09850 2026-05-11 cs.CV 57%

Towards Explainable Industrial Anomaly Detection via Knowledge-Guided Latent Reasoning

面向可解释性工业异常检测的基于知识引导的潜在推理

Peng Chen, Chao Huang, Yunkang Cao, Chengliang Liu, Wei Wang, Wenqiang Wang, Mingbo Yang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Reason-IAD框架,通过引入领域特定文本描述和熵驱动的潜在推理机制,提升工业异常检测的准确性和可解释性,实验表明其在多个任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏