arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-16 至 2026-06-16 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 19 篇

2606.15694 2026-06-16 cs.MM cs.AI cs.CV cs.LG 新提交 89%

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

MAF: 面向情感分析的多模态自适应少样本提示方法

Hangling Xie

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出MAF框架,通过动态检索与查询相关的多模态示例,利用轻量级系数生成网络实时融合多模态相似度,结合多数投票提升MLLM在情感分析中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16161 2026-06-16 cs.CV 新提交 89%

Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification

多模态大语言模型赋能的通用行人重识别重排序

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 提出利用多模态大语言模型(MLLM)的泛化能力,通过微调MLLM并计算μ-距离来改进推理阶段的重排序,从而提升领域泛化行人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15134 2026-06-16 cs.CV cs.AI cs.LG 新提交 88%

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

超越标量距离:来自冻结MLLM的语义属性梯度用于视觉嵌入

Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 跨模态检索 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出SAGA框架,利用冻结的多模态大语言模型(MLLM)通过GRPO奖励机制为视觉编码器提供属性级监督,替代传统标量距离,提升零样本图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15906 2026-06-16 cs.IR cs.AI cs.CL cs.DB cs.MM 新提交 87%

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

MAGE-RAG:面向长文档问答的多粒度自适应图证据多模态RAG

Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.MM

AI总结 提出MAGE-RAG框架,通过离线构建包含页面和元素节点的证据图,在线自适应构建证据子图,平衡证据覆盖与噪声控制,在长文档多模态问答中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17053 2026-06-16 cs.CL cs.CV 新提交 81%

Context-Aware RL for Agentic and Multimodal LLMs

上下文感知强化学习用于智能体与多模态大语言模型

Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

机构 * Princeton University(普林斯顿大学) UC Davis(加州大学戴维斯分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14747 2026-06-16 cs.CV cs.AI 新提交 81%

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

MMLongEmbed: 长上下文场景下的多模态嵌入模型基准测试

Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang

机构 * Soochow University(苏州大学) Ant Group(蚂蚁集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态嵌入模型在长上下文场景中缺乏系统评估的问题,提出首个综合基准MMLongEmbed,涵盖文本、文档和视频模态的检索任务,揭示模型依赖浅层特征匹配、难以捕捉深层语义依赖等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15287 2026-06-16 cs.CV 新提交 79%

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

G2IA: 几何引导的实例感知跨模态地点识别检索与精炼

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Defense Technology(国防科技大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01613 2026-06-16 cs.IR cs.AI cs.MA 版本更新 79%

TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning

TechGraphRAG:面向技术文献推理的智能图增强RAG框架

Kanwar Bharat Singh

机构 * Global Tire Intelligence and Solutions (GTIS)(全球轮胎智能与解决方案(GTIS)) The Goodyear Tire & Rubber Company(固特异轮胎与橡胶公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种13步自主流水线的智能检索增强生成框架,通过证据充分性评分、知识图谱遍历和自校正生成,支持领域特定技术文献推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15838 2026-06-16 cs.IR 新提交 78%

Intelligent Multimodal Retrieval and Reasoning for Geospatial Knowledge Discovery on the I-GUIDE Platform

面向I-GUIDE平台地理空间知识发现的智能多模态检索与推理

Yunfan Kang, Erick Li, Furqan Baig, Wei Hu, Alexander Michels, Anand Padmanabhan, Shaowen Wang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出I-GUIDE Smart Search系统,结合多模态索引与知识图谱的迭代RAG管道,实现地理空间异构数据的语义检索、图谱溯源和对话合成,在单A100部署下支持约100并发用户,提升检索覆盖与答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22530 2026-06-16 cs.LG 78%

Multimodal Training to Unimodal Deployment: Leveraging Unstructured Data During Training to Optimize Structured Data Only Deployment

多模态训练到单模态部署:利用训练中的无结构数据优化仅结构化数据的部署

Zigui Wang, Minghui Sun, Jiang Shu, Matthew M. Engelhard, Lauren Franz, Benjamin A. Goldstein

机构 * Department of Biostatistics and Bioinformatics, Duke University School of Medicine(生物统计学与生物信息学系,杜克大学医学中心) Department of Pediatrics, Duke University School of Medicine(儿科学系,杜克大学医学中心) Duke Center for Autism and Brain Development, Duke University School of Medicine(杜克大学自主与脑发展中心,杜克大学医学中心) Department of Psychiatry and Behavioral Sciences, Durham, NC, USA(精神病学与行为科学系,新伯尔尼,NC,美国)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出一种多模态学习框架,利用训练中的无结构EHR数据提升模型对结构化数据的识别能力,通过对比学习和知识蒸馏损失联合训练,实现仅结构化数据部署的高效分类模型。

Comments 10 pages,3 figures

Journal ref Proceedings of the AMIA 2026 Annual Symposium, American Medical Informatics Association (AMIA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08976 2026-06-16 cs.CV cs.DC cs.IR 版本更新 77%

MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition

MIRAGE:基于层次分解的多向量图像检索运行时调度

Maoliang Li, Ke Li, Yaoyang Liu, Jiayu Chen, Zihao Zheng, Yinjun Wu, Chenchen Liu, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Information, Renmin University of China(中国人民大学信息学院) School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出MIRAGE框架,通过层次化分解和跨层次相似性一致性减少冗余计算,实现多向量图像检索的精度提升和3.5倍计算加速。

Comments Will appear in DAC'2026, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15514 2026-06-16 cs.RO cs.LG 新提交 71%

Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities

强化学习引导的软融合检索用于缺失模态下的鲁棒多模态模仿学习

Hassan Ismkhan, Hamid Bouchahcia

机构 * Bournemouth University(伯恩茅斯大学)

专题命中 跨模态检索 :multimodal(title)

AI总结 提出RL4IL方法,利用强化学习策略从训练库中检索最相关专家演示,并通过软交叉注意力融合生成动作,有效处理传感器缺失问题,在LIBERO基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20623 2026-06-16 cs.CV cs.AI 版本更新 62%

RSRCC: A Remote Sensing Regional Change Comprehension Benchmark Constructed via Retrieval-Augmented Best-of-N Ranking

RSRCC:通过检索增强的最佳N排序构建的遥感区域变化理解基准

Roie Kazoom, Yotam Gigi, George Leifman, Tomer Shekel, Genady Beryozkin

机构 * Google Research(谷歌研究)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出RSRCC基准,包含12.6万个细粒度遥感变化问答对,采用层次化半监督流程结合最佳N排序解决歧义,实现局部语义变化推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06212 2026-06-16 cs.CV cs.AI 版本更新 62%

Akasha 2: Hamiltonian State Space Duality and Visual-Language Joint Embedding Predictive Architectur

Akasha 2: 哈密顿状态空间对偶与视觉-语言联合嵌入预测架构

Yani Meziani

机构 * Independent AI Researcher(独立AI研究员) Québec (QC), Canada(魁北克(QC),加拿大)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出 Akasha 2 多模态架构,结合哈密顿状态空间对偶与视觉-语言联合嵌入预测,通过稀疏混合哈密顿专家和哈密顿流匹配实现超低延迟视频预测与合成,在保持能量守恒下取得 SOTA 性能。

Comments No supporting claims were validated in this automated agentic R&D research run

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17027 2026-06-16 cs.CV 新提交 57%

MeshLoom: Feed-Forward Non-Rigid Registration of Mesh Sequences

MeshLoom: 网格序列的前馈式非刚性配准

Jianqi Chen, Jiraphon Yenphraphai, Xiangjun Tang, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, Rameen Abdal

机构 * KAUST Saudi Arabia(沙特阿拉伯国王科技大学) Snap Inc. United States of America(Snap Inc. 美国) Purdue University United States of America(普渡大学 美国)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出MeshLoom,一种前馈式配准网络,通过拓扑感知编码器-解码器直接重建网格序列的顶点变形,实现秒级多网格配准,并在非刚性配准任务上达到最先进水平,同时支持运动插值和网格变形。

Comments Project page: https://meshloom.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14941 2026-06-16 cs.AI 新提交 57%

Semantics-Enhanced Retrieval-Augmented Time Series Forecasting

语义增强的检索增强时间序列预测

Shiqiao Zhou, Zipeng Wu, Holger Schöner, Edouard Fouché, IAG Wilson, Shuo Wang

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Montreal(蒙特利尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对非平稳性下仅靠时间序列相似性检索不足的问题,提出SERAF框架,通过双模态检索(时间序列及其自生成文本描述)联合利用历史模式,提升预测性能。

Comments Accepted to the ICML 2026 Workshop on Forecasting as a New Frontier of Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新 57%

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16388 2026-06-16 cs.LG 新提交 50%

Robust Neural Tucker Factorization with Bias Correction and Adaptive Initialization

鲁棒神经Tucker分解:偏差校正与自适应初始化

Yuchao Su, Yixin Ran

机构 * School of Computer Science and Engineering, Chongqing University of Science and Technology(重庆科技大学计算机科学与工程学院) College of Computer and Information Science, School of Software, Southwest University(西南大学计算机与信息科学学院 软件学院)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 提出KaBiN模型,结合Kaiming初始化和偏差校正,解决高维不完全张量补全中初始化不当和偏差缺失导致的优化不稳定问题。

Comments 9 pages,3 figures, 106 conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15784 2026-06-16 cs.LG cs.CE 新提交 50%

Bayesian Networks with Latent Time Embedding for Stage-Aware Causal Modeling of Alzheimer's Disease Progression

具有潜在时间嵌入的贝叶斯网络用于阿尔茨海默病进展的阶段感知因果建模

Nguyen Linh Dan Le

机构 * Alzheimer's Disease Neuroimaging Initiative(阿尔茨海默病神经影像学倡议) Open Access Series of Imaging Studies(开放获取影像学研究系列)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 提出BN-LTE框架,结合贝叶斯网络与潜在时间嵌入,利用AT(N)级联约束建模AD进展,在ADNI数据上优于基线,并识别出淀粉样蛋白敏感性的中期伪时间窗口。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏