arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-05 至 2026-08-05 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 11 篇

2608.02791 2026-08-05 cs.CV 新提交 91%

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 跨模态检索 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03358 2026-08-05 cs.CL cs.CV 新提交 81%

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

ArtECulture:评测多模态大语言模型中的文化条件视觉情感理解

Xiaolin Chen, Xuemeng Song, Wenhao Shi, Xianjing Han, Mong-Li Lee, Wynne Hsu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对现有视觉情感理解方法忽略文化差异的问题,提出ArtECulture基准与检索增强型文化条件情感理解框架,评估多模态大语言模型在该任务上的表现并验证框架的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29440 2026-08-05 cs.AI 版本更新 79%

Beyond Retrieval: Analytic Memory for Multimodal Agents

超越检索:多模态智能体的分析记忆

Zhoujin Tian, Hao Zhang, Yao Tian, Cheng Chen, Yakun Li, Lei Zhang, Xiaofang Zhou

机构 * HKUST(香港科技大学) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00955 2026-08-05 cs.LG cs.AI cs.IR 版本更新 79%

From Generator to Embedder: Harnessing Innate Abilities of Multimodal LLMs via Building Zero-Shot Discriminative Embedding Model

从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence(人工智能系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。

Comments Accepted to IEEE Transactions on Multimedia (T-MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02907 2026-08-05 cs.LG 新提交 78%

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 70%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02688 2026-08-05 cs.LG cs.AI 新提交 70%

Learning Molecular Representations from Cellular Phenotypes with Structure Preservation

基于结构保留的细胞表型分子表示学习

Xuan Lin, Jingyu Sheng, Tengfei Ma, Li Sun, Dapeng Xiong

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Beijing University of Posts and Telecommunications(北京邮电大学) Southeast University(东南大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出结构保留的PhenMol框架,通过解耦分子与细胞表示实现表型引导对齐,在多类任务上提升性能,为药物发现整合细胞表型与化学知识提供了有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03524 2026-08-05 cs.AI 新提交 57%

Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS

Dr. AGENTONOMICS:AGENTONOMICS的教学实验

Fengjunjie Pan, Alois Knoll

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究介绍了AGENTONOMICS框架的首个应用Dr. AGENTONOMICS,将其作为教学智能体,提出其可拓展为多角色系统并探讨其对多中心AI经济的意义。

Comments Technical report, Technical University of Munich

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03150 2026-08-05 cs.AI 新提交 57%

UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval

UniGD:面向工业检索的统一生成-判别框架

Shujie Ji, Yawei Kong, Yilin Zhao, Li Wang, Xialong Liu, Peng Jiang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 UniGD是整合检索与相关性评分的统一框架,通过CAGE、CAM、HAM解决工业检索问题,在快手平台及NQ320K、MS300K数据集上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03120 2026-08-05 cs.CV 新提交 57%

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22850 2026-08-05 cs.CV 版本更新 57%

What is the Right Embedding Space for Contrastive Learning in REC?

REC中对比学习的合适嵌入空间是什么?

Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(斯通布鲁克大学) EPFL(苏黎世联邦理工学院)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 该研究针对REC任务现有对比学习策略的局限,提出视觉嵌入空间的C-REX框架,作为即插即用模块提升REC及类别无关计数任务性能,在REC上MAE最高提升28%、RMSE提升24.5%。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏