arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-04 至 2026-08-04 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 21 篇

2608.02148 2026-08-04 cs.IR cs.CL cs.CV 新提交 86%

Douyin Multimodal Embedding Model Technical Report

抖音多模态嵌入模型技术报告

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02583 2026-08-04 cs.CV cs.AI cs.CL cs.IR 新提交 85%

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01430 2026-08-04 cs.AI 新提交 83%

MRAFnd: Multimodal Retrieval-Augmented Framework for Zero-Shot Fake News Detection

MRAFnd:面向零样本假新闻检测的多模态检索增强框架

Lehan Zhang, Yinlei Cheng, Shiqi Hu Yiheng Zhou, Shangxi Li, Naidong Zhao

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对零样本假新闻检测的现有方法无法识别重复虚假手段与跨模态差异的问题,本文提出多模态检索增强框架MRAFnd,经多智能体协作推理,在Weibo-21等数据集上准确率最高提升2.35%,优于现有方法。

Comments 14 pages, 6 figures, 2 tables, Presented at the MMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01543 2026-08-04 cs.AI cs.CL cs.CV cs.IR 新提交 82%

V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory

V-Mem:面向多模态智能体长期记忆的模态路由检索

Dingyi Kang, Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对多模态智能体记忆的模态与相似性-相关性差距,提出V-Mem系统,通过模态路由检索优化,在Mem-Gallery、LoCoMo数据集上显著提升多模态问答性能。

Comments 19 pages, 2 figures, 16 tables. Code: https://github.com/Dingyi-Kang/V-Mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00877 2026-08-04 cs.LG 新提交 82%

GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs

GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法

Xuechen Li

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00623 2026-08-04 cs.LG 新提交 82%

Towards Effective Federated Multimodal Graph Learning via Navigating Multifaceted Heterogeneity

面向有效联邦多模态图学习的多层面异质性导航方法

Yinlin Zhu, Di Wu, Yi Zhang, Xunkai Li, Wang Luo, Wei-Jin Huang, Miao Hu, Guocong Quan

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对联邦多模态图学习的多层面异质性问题,本文提出FedTCR算法,通过两阶段范式与拓扑感知跨模态路由机制,在7个领域的图中心与模态中心任务上优于现有最优基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15782 2026-08-04 cs.AI cs.CV 版本更新 81%

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新 79%

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20318 2026-08-04 cs.CV cs.MM 版本更新 79%

UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval

UniCVR:从对齐到重排序的统一零样本复合视觉检索

Haokun Wen, Xuemeng Song, Haoyu Zhang, Weili Guan, Xiangyu Zhao, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 UniCVR提出首个统一零样本复合视觉检索框架,结合多模态大语言模型与视觉语言预训练模型,通过两阶段方法实现多任务联合优化,实验表明其在五个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01852 2026-08-04 cs.DB cs.IR 新提交 78%

Multimodal Embeddings for 3D Similarity Search in Semantic Web-of-Things Digital-Twin Platforms

面向语义物联网数字孪生平台中三维相似度搜索的多模态嵌入

Oussama Zaid, Romaric Gaudel, Hassan Thomas, Maria Massri, Philippe Raipin-Parv{é}dy

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文针对语义物联网数字孪生平台缺乏三维相似度搜索能力的问题,提出多模态嵌入框架,在Thing'in平台实现后经S3DIS验证,可支持混合本体-向量查询,满足相关领域的三维相似度搜索需求。

Journal ref 4th International Workshop on the Semantic WEb of EveryThing (SWEET 2026), co-located with ICWE 2026, Jun 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00544 2026-08-04 cs.CV 新提交 74%

Zero-Cost Virtual RNA: Approximating Immunotherapy Signatures via Cross-Modal WSI Retrieval

零成本虚拟RNA:通过跨模态WSI检索近似免疫治疗特征

Sigrid Vila-Bagaria, Mar Teixidó, Miquel Piñol, Felip Vilardell, Robert Montal, Veronica Vilaplana

机构 * Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) IRB Lleida(莱里达生物医学研究所)

专题命中 跨模态检索 :cross-modal(title);分类 cs.CV

AI总结 针对胃腺癌免疫治疗RNA特征检测成本高的问题,提出VITA模型,通过H&E与RNA跨模态对齐实现仅用H&E切片近似RNA特征,取得0.72准确率等结果,提供低成本预筛选工具。

Comments Accepted to MIDL 2026 Short Paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00551 2026-08-04 cs.IR 新提交 67%

PHA-Net: Prototype-based Hierarchical Alignment Network for Text-Video Retrieval

PHA-Net:用于文本-视频检索的基于原型的分层对齐网络

Xiaolun Jing, Kezhao Yin, Xinxing Yang, Genke Yang, Jian Chu

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract)

AI总结 针对文本-视频检索中跨模态语义不匹配及计算成本高的问题,提出PHA-Net,以模态共享原型为桥梁,结合原型支持的令牌合并模块与原型对比损失,在四个基准数据集上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00361 2026-08-04 cs.CV cs.AI 新提交 62%

Artificial Intelligence for the Characterization of Particles and Fibers by Optical Microscopy

用于光学显微镜下颗粒与纤维表征的人工智能方法

Simiao Sun, Kenneth Ng, Lynn Lee, Astrid Harth, Asami Odate, Aggelos Katsaggelos, Manuel Ballester Matito, Nicholas Eastaugh, Marc Walton

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种带语义锚点的AI蒸馏框架,训练仅视觉输入的学生ViT模型,在颗粒与纤维显微镜表征任务中获80%伪类验证准确率等结果,实现更丰富可解释的表征,适用于相关分析场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00096 2026-08-04 cs.CV cs.AI 新提交 62%

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

基于语义对比学习的表意文字视觉预训练

Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

机构 * Queen Mary University of London(伦敦玛丽女王大学) Jilin University(吉林大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。

Comments ACM MM 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02457 2026-08-04 cs.IR cs.AI 新提交 57%

Syntax Meets Semantics: Understanding Scientific Formulae

语法与语义融合:理解科学公式

Yuni Susanti, Moritz Schubotz

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 本研究针对科学公式语法与语义表征不匹配问题,采用图编码器、文本编码器结合对比学习实现跨模态对齐,显著提升了学术信息检索中的跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01954 2026-08-04 cs.CV 新提交 57%

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

StyleForge:基于超图场中反事实推理的室内家具风格生成

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01665 2026-08-04 cs.AI cs.SD 新提交 57%

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

排序前分配:面向通用大模型(OmniLLMs)的解耦令牌压缩

Zhenghui Guo, Yilin Yang, Yuanbin Man, Miao Yin, Weidong Shi, Rabimba Karanjai, Omprakash Gnawali, Chengming Zhang

机构 * University of Houston(休斯顿大学) The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对通用大模型令牌压缩的偏向音频分配问题,提出无需训练的Macer压缩器,先分配音视频预算再按模态排序,降本同时在多基准上保持性能,在OmniVinci-9B上提升达12.9个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01560 2026-08-04 cs.CL cs.SD 新提交 57%

Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding

判别轴,而非数据量:对比语料库能为音频嵌入模型带来什么启示

Abdul Basit Tonmoy

机构 * Eximius Labs(埃克西米厄斯实验室) Wabash College(沃巴什学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 该研究发现对比音频嵌入模型编码的属性由语料库结构而非规模决定,通过调整语料标注多样性可提升情感识别性能,同时平衡关键词检测能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01526 2026-08-04 cs.NI 新提交 50%

An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界

Siddhant Ray, Nick Feamster, Junchen Jiang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 50%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00669 2026-08-04 cs.IR 新提交 50%

GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation

GARDRec:面向大语言模型推荐的决策级图接地方法

Yong Wang, Hongliang Sun, Jinlan Liu, Hua Zhang, Dianbo Sui, Dianhui Chu, Zhiying Tu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏