arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-16 至 2026-06-16 共收录 109 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2606.16193 2026-06-16 cs.CV cs.AI cs.LG 新提交 89%

Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs

级联稀疏自编码器在多模态大语言模型中学习多级视觉概念

Yusong Zhao, Hengyi Wang, Tanuja Ganu, Akshay Nambi, Hao Wang

机构 * Rutgers University(罗格斯大学) Microsoft Research(微软研究院)

专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出级联稀疏自编码器(CSAEs),通过在第一级SAE解码器权重上训练第二级SAE来学习层次化视觉概念,避免嵌套或堆叠SAE的缺点,在多个MLLM和数据集上提升了概念层次一致性和干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16484 2026-06-16 cs.CV cs.AI cs.MM 新提交 82%

Unified Multimodal Model for Brain MRI Imputation and Understanding

统一多模态模型用于脑MRI补全与理解

Zhiyun Song, Che Liu, Tian Xia, Avinash Kori, Wenjia Bai

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出UniBrain模型,通过统一训练策略联合处理脑MRI模态补全与图像理解,采用自对齐和动态隐藏状态机制,在多疾病数据集上实现高性能。

Comments Early accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14883 2026-06-16 cs.CV cs.LG 新提交 79%

Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective

理解连续视觉-语言模型中的跨模态贡献:一个理论视角

Salimeh Sekeh, Mary Wisell

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文从理论角度分析连续视觉-语言模型中跨模态(视觉-语言)贡献,提出新视角并通过实验验证其有效性,揭示任务顺序和相似性对贡献鲁棒性的影响,提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15714 2026-06-16 cs.CL cs.RO 新提交 57%

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

超越英语:揭示视觉-语言-动作模型中的多语言差距

Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究首次系统探究VLA模型的多语言指令跟随能力,发现英语训练模型在其他语言上性能显著下降,并提出多语言主成分对齐方法缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 13 篇

2606.14786 2026-06-16 cs.MM cs.AI cs.CV 新提交 89%

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite: 一种可扩展的MLLM-to-Lite框架用于重复内容识别

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu

机构 * Tiktok(字节跳动) National University of Singapore School of Computing(新加坡国立大学计算机学院)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出MatchLM2Lite框架,通过将多模态大语言模型蒸馏为轻量模型,实现视频、音频和文本联合建模的实时重复内容识别,在降低35倍计算成本的同时保持高准确率,并成功部署于大规模生产环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15117 2026-06-16 cs.MM cs.AI cs.CV cs.LG cs.SD 新提交 82%

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

用于集成视听视频深度伪造检测中领域适应的师生结构

Elham Abolhasani, Maryam Ramezani, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工学院计算机工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出EAV-DFD方法,结合师生框架的领域适应机制,提升模型在未见领域上的泛化能力,在三个数据集上AUC分别提升4.09%、17.94%和0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 81%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14788 2026-06-16 cs.SD cs.AI cs.LG eess.AS 新提交 81%

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

统一声学特征与文本的多模态大语言模型用于神经退行性疾病筛查

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 提出NeurMLLM框架,通过多模态大语言模型融合声谱图、MFCC和文本,实现阿尔茨海默病和帕金森病的精细分期,优于传统方法和现有LLM方法。

Comments IEEE International Conference on Healthcare Informatics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12688 2026-06-16 cs.LG cs.AI cs.DC 新提交 79%

M*: A Modular, Extensible, Serving System for Multimodal Models

M*: 一个模块化、可扩展的多模态模型服务系统

Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出M*系统,通过将模型表示为数据流图并引入Walk Graph抽象,支持多模态复合模型的高效服务,在多个任务上降低延迟并提升吞吐量。

Comments The codebase is available at https://github.com/mstar-project/mstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15848 2026-06-16 cs.CV 新提交 70%

EmoZone-Talker: Regional Semantic Control of Audio-Driven 3DGS Talking Heads via Facial Action Units

EmoZone-Talker: 基于面部动作单元的音频驱动3DGS说话人头部的区域语义控制

Tingting Chen, Shaojun Wang, Huaye Zhang, Diqiong Jiang, Chenglizhao Chen

机构 * China University of Petroleum (East China)(中国石油大学(华东))

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出EmoZone-Talker框架,通过区域解耦和时序建模解决音频与表情信号的冲突,实现精细、可解释的面部表情控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15888 2026-06-16 cs.SD cs.AI eess.AS 新提交 62%

NVMOS: Non-Verbal Vocalization Quality Assessment in Speech

NVMOS:语音中非语言发声质量评估

Jialong Mai, Jinxin Ji, Xiaofen Xing, Wencui Liu, Xiangmin Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对非语言发声(如笑声、叹息)的感知质量评估空白,构建NV-MOS数据集,提出首个专用模型NVMOS,通过局部聚焦模块达到专家级评估一致性。

Comments 6 pages. Code and model: https://github.com/yongaifadian1/NVMOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16539 2026-06-16 eess.AS cs.SD 新提交 57%

Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition

解码与自适应:基于音频-文本提示的零样本在线说话人自适应用于老年人语音识别

Chengxi Deng, Xurong Xie, Shujie Hu, Mengzhe Geng, Tianzi Wang, Youjun Chen, Huimeng Wang, Haoning Xu, Jiajun Deng, Xunying Liu

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Institute of Software, Chinese Academy of Sciences, China(中国科学院软件研究所) National Research Council Canada, Canada(加拿大国家研究理事会)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 提出一种基于跨语句音频-文本提示的说话人自适应方法,实现零样本实时适应未见说话人,在老年人语音数据集上显著降低词错误率/字符错误率,并大幅提升实时因子。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16472 2026-06-16 cs.CL 新提交 57%

From Awareness to Adherence: Bridging the Context Gap in Spoken Dialogue Systems via Context-Aware Decoding

从意识到遵循:通过上下文感知解码弥合口语对话系统中的上下文鸿沟

Che Hyun Lee, Heeseung Kim, Sungroh Yoon

机构 * ECE, Seoul National University(首尔大学电气与计算机工程系) IPAI, Seoul National University(首尔大学IPAI研究所) Department of AI, University of Seoul(首尔市立大学人工智能系)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出音频适配的上下文感知解码方法,通过对比有无关键上下文的输出分布,放大多模态上下文信号,解决口语对话系统中上下文遵循问题。

Comments Interspeech 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16351 2026-06-16 cs.CL 新提交 57%

TMASC: Transmasculine Attitude and Speech Corpus

TMASC:跨男性态度与语音语料库

Sidney Wong

机构 * Centre for Sustainability Research, University of Otago(奥塔哥大学可持续发展研究中心) Te Pūnaha Matatini Centre of Research Excellence for Complex Systems(Te Pūnaha Matatini复杂系统卓越研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 介绍一个包含196名跨男性个体的多模态语料库,包括问卷和66份录音,用于支持跨男性个体研究。

Comments Accepted to Interspeech 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09098 2026-06-16 eess.AS 新提交 57%

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音

Wenhao Guan, Yifan Duan, Junxi Liu, Yu Gu, Feng Dang, Kaidi Wang, Qingyang Hong, Lin Li, Xie Chen

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07015 2026-06-16 cs.SD cs.AI 新提交 57%

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

面向统一歌曲生成与带伴奏共生成的歌声转换

Ziyu Zhang, Chunyu Qiang, Xiaopeng Wang, Yuxin Guo, Kang Yin, Wenjie Tian, Jingbin Hu, Tianlun Zuo, Zhao Guo, Teng Ma, Yuzhe Liang, Chen Zhang, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Kuaishou Technology(快手科技) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出UniSinger框架,基于多模态扩散Transformer统一零样本歌曲生成与伴奏共生成歌声转换,通过共享说话人嵌入和课程学习策略实现跨任务音色控制与多任务优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15902 2026-06-16 cs.HC 新提交 50%

The Missing Layer: Why EdTech Needs Design-Time Generative UI, Not Just Runtime Personalization

缺失的层次:为什么教育科技需要设计时的生成式用户界面,而非仅运行时个性化

Seyed Parsa Neshaei, Abhinand Shibu, Fatma Betül Güres

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对教育科技中运行时生成式UI导致可访问性不足的问题,提出在创作层采用基于卡片的语义单元编码,由生成式AI在教学设计时生成多种界面表示,经教师验证后交付,实现公平可扩展的适应性教育。

Comments Accepted at the NextGen Learning Interfaces Workshop in AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2606.16198 2026-06-16 cs.CV 新提交 84%

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16580 2026-06-16 cs.LG cs.CV 新提交 79%

Multi-Modal Spatio-Temporal Graph Neural Network with Mixture of Experts for Soil Organic Carbon Prediction

基于专家混合的多模态时空图神经网络用于土壤有机碳预测

Daniele Mos, Felipe Drummond, Anton Bossenbroek, Soufiane el Khinifri

机构 * Spatialise B.V.

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出SpTGNN,一种多模态时空图神经网络,通过异构图注意力、微调基础模型特征提取和稀疏专家混合融合,结合异方差回归与深度集成的不确定性量化,在三个区域数据集上优于XGBoost基线。

Comments Paper is 27 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15026 2026-06-16 cs.CL 新提交 79%

Deep Temporal Modeling and Ensemble Fusion for Multimodal Emotion Recognition from Physiological Signals

基于生理信号的深度时间建模与集成融合多模态情感识别

Desta Haileselassie Hagos, Saurav Keshari Aryal, Patrick Ymele-Leki, Anietie Andy, Legand L. Burge

机构 * Howard University(霍华德大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究评估LSTM、TCN和Transformer在WESAD数据集上的多模态情感识别性能,通过消融实验和传感器级早期融合,并采用晚期融合集成策略,最终集成方法达到98.91%准确率和98.56%宏F1分数。

Comments Accepted for publication in the 17th ACM International Conference on Bioinformatics, Computational Biology and Health Informatics (ACM BCB 2026). DOI: https://doi.org/10.1145/3807503.3819363

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 70%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15200 2026-06-16 cs.CV 新提交 57%

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用

Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。

Comments 45 pages. https://icml.cc/virtual/2026/poster/63682

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16053 2026-06-16 cs.SI cs.CY 新提交 50%

Modeling Engagement with Brand and Organizational TikTok Videos Using Machine-Assisted Theory-Ensemble Annotation

使用机器辅助理论集成标注建模品牌和组织TikTok视频的参与度

Sander Paekivi, Andres Karjus

专题命中 视频多模态 :multimodal(abstract)

AI总结 利用多模态大语言模型标注77个理论驱动的结构变量,分析约1万个TikTok视频,以预测参与度并探索短视频文化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15330 2026-06-16 cs.IR 新提交 50%

OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds

OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架

Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。

Comments Any questions feel free to contact: benchen4395@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14893 2026-06-16 cs.HC 新提交 50%

Automated Gaze-based Behavioral Segmentation and Temporal Representation for Bridge Inspection in Unconstrained 3D Environments

基于自动注视行为分割与时间表示的非约束三维环境桥梁检测

Daniel Jimenez Gil, Haosen Zhang, Zixin Wang, Mohamad Alipour

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出自动分析框架,将非约束3D注视、头部运动、无人机导航和场景几何数据分割为全局扫描、局部检测和导航三种功能模式的时间序列,提取行为描述符,揭示检测策略差异及与性能的关系。

Comments 46 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 13 篇

2606.15694 2026-06-16 cs.MM cs.AI cs.CV cs.LG 新提交 89%

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

MAF: 面向情感分析的多模态自适应少样本提示方法

Hangling Xie

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出MAF框架,通过动态检索与查询相关的多模态示例,利用轻量级系数生成网络实时融合多模态相似度,结合多数投票提升MLLM在情感分析中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16161 2026-06-16 cs.CV 新提交 89%

Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification

多模态大语言模型赋能的通用行人重识别重排序

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 提出利用多模态大语言模型(MLLM)的泛化能力,通过微调MLLM并计算μ-距离来改进推理阶段的重排序,从而提升领域泛化行人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15134 2026-06-16 cs.CV cs.AI cs.LG 新提交 88%

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

超越标量距离:来自冻结MLLM的语义属性梯度用于视觉嵌入

Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 跨模态检索 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出SAGA框架,利用冻结的多模态大语言模型(MLLM)通过GRPO奖励机制为视觉编码器提供属性级监督,替代传统标量距离,提升零样本图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15906 2026-06-16 cs.IR cs.AI cs.CL cs.DB cs.MM 新提交 87%

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

MAGE-RAG:面向长文档问答的多粒度自适应图证据多模态RAG

Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.MM

AI总结 提出MAGE-RAG框架,通过离线构建包含页面和元素节点的证据图,在线自适应构建证据子图,平衡证据覆盖与噪声控制,在长文档多模态问答中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17053 2026-06-16 cs.CL cs.CV 新提交 81%

Context-Aware RL for Agentic and Multimodal LLMs

上下文感知强化学习用于智能体与多模态大语言模型

Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

机构 * Princeton University(普林斯顿大学) UC Davis(加州大学戴维斯分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏