arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-04 至 2026-06-04 共收录 106 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2502.01576 2026-06-04 cs.CV 85%

Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models

Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性

Hashmat Shadab Malik, Fahad Shamshad, Muzammal Naseer, Karthik Nandakumar, Fahad Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) Khalifa University(卡利法大学) Michigan State University(密歇根州立大学) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。

Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14054 2026-06-04 cs.AI cs.CV 84%

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multimodal(title,title_cn);分类 cs.CV、cs.AI

AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。

Comments Accepted by ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04613 2026-06-04 cs.CV cs.LG 70%

Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

超越对称对齐:医学领域视觉-语言模型中模态不平衡的光谱诊断

Alessandro Gambetti, Qiwei Han, Cláudia Soares, Hong Shen

机构 * NOVA School of Science and Technology(诺瓦科学与技术学校) Nova School of Business and Economics(诺瓦商业与经济学校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出非对称光谱对齐分数(SAS),通过特征值加权的特征模态相关性量化模态信息不平衡,并在医学图像-文本数据集上评估15个VLM,发现医学图像比临床报告保留更丰富的结构信息,且SAS与检索性能的相关性最强。

Comments 10 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 67%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02914 2026-06-04 cs.AI cs.CL 62%

Large AI Models in Dental Healthcare: From General-Purpose Systems to Domain-Specific Foundation Models

牙科医疗中的大型AI模型:从通用系统到领域特定基础模型

Sema Helali, Lina Abu Nada, Sausan Al Kawas, Alaa Abd-Alrazaq, Faleh Tamimi, Rafat Damseh

机构 * University of Al Ain, UAE(阿联酋阿恩大学) Sharjah University, UAE(阿联酋谢尔杰大学) Cornell University, Qatar(卡塔尔康奈尔大学) McGill University(麦吉尔大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统综述,提出二维分类框架,比较语言生成模型、判别视觉基础模型和牙科特定基础模型在牙科任务中的表现,发现集成管道优于单一模型,并指出数据不对称、幻觉和缺乏标准化基准等障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12433 2026-06-04 cs.CV cs.AI cs.LG 62%

Revisiting Model Stitching In the Foundation Model Era

重新审视基础模型时代的模型拼接

Zheda Mai, Ke Zhang, Fu-En Wang, Zixiao Ken Wang, Albert Y. C. Chen, Lu Xia, Min Sun, Wei-Lun Chao, Cheng-Hao Kuo

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学) Amazon(亚马逊)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过系统协议研究视觉基础模型(如CLIP、DINOv2、SigLIP 2)的可拼接性,提出基于目标模型倒数第二层特征匹配损失的拼接方法,并构建VFM拼接树(VST)实现多模态大模型中多个VFM的准确率-延迟权衡。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00862 2026-06-04 cs.CV cs.CL 62%

UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding

UniFine: 一种统一且细粒度的零样本视觉-语言理解方法

Rui Sun, Zhecan Wang, Haoxuan You, Noel Codella, Kai-Wei Chang, Shih-Fu Chang

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出UniFine框架,通过利用句子关键词和图像对象等细粒度信息进行图像-文本匹配,在零样本设置下统一处理VQA、SNLI-VE和VCR等视觉-语言任务,并在多个数据集上取得显著改进。

Comments 14 pages, 4 figures, ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04610 2026-06-04 cs.DB 50%

Selectivity Estimation for Semantic Filters on Image Data

图像数据语义过滤器的选择性估计

Matthias Urban, Vu Huy Nguyen, Gabriele Sanmartino, Paolo Papotti, Carsten Binnig

专题命中 图文多模态 :multi-modal(abstract)

AI总结 针对图像数据上的语义过滤器,提出基于共享嵌入空间的语义直方图方法,通过估计查询特异性来绕过传统在线采样,实现高效选择性估计,将查询优化与执行的端到端运行时开销降低高达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2512.03553 2026-06-04 cs.CV cs.AI 89%

Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching

直播中的动态内容审核:结合监督分类与MLLM增强的相似度匹配

Wei Chee Yew, Hailun Xu, Sanjay Saha, Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Kanchan Sarkar, Zhenheng Yang, Danhui Guan

机构 * TikTok Singapore Singapore(TikTok新加坡) TikTok San Jose United States(TikTok旧金山美国) TikTok Shanghai China(TikTok上海中国)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种混合审核框架,结合监督分类和基于参考的相似度匹配,利用多模态大语言模型提升准确性,在保持轻量推理的同时实现大规模直播内容审核。

Comments To be published at KDD 2026 (ADS track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04205 2026-06-04 cs.MM cs.AI cs.CL cs.CV cs.LG cs.SD 70%

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

DetectZoo:一个用于跨文本、音频和图像模态的AI生成内容检测的统一工具包

Sajad Ebrahimi, Nima Jamali, Bardia Shirsalimian, Kelly McConvey, Wentao Zhang, Jalehsadat Mahdavimoghaddam, Maksym Taranukhin, Maura Grossman, Vered Shwartz, Yuntian Deng, Ebrahim Bagheri

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出DetectZoo,一个首个统一的多模态AI生成内容检测工具包,通过标准化数据预处理、评估流程和集成61个检测器与22个基准数据集,实现公平可重复的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.07347 2026-06-04 eess.SY cs.SY 67%

Dynamical Systems On Weighted Lattices: General Theory

带权晶格上的动力系统:一般理论

Petros Maragos

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 本文提出了一种统一多种非线性离散时间动力系统的方法,这些系统满足加权最大或最小类型的叠加,研究了在带权晶格上的状态和输入输出信号演变,以及非线性卷积、非线性矩阵方程求解、稳定性与可控性等问题,并探讨了其在非线性滤波、动态规划、最短路径、模糊马尔可夫链及多模态信息流中显著事件跟踪等应用。

Comments 38 pages, 4 figures

Journal ref Math. Control Signals Syst. (2017) 29: 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04106 2026-06-04 cs.LG cs.AI 57%

Building The Ph(ysical)AI Layer Of Machine Intelligence

构建机器智能的物理AI层

Ulbert Jose Botero, Liam Smith, Brooks Olney, Pooya Khorrami, Steven Kusiak, Watson Jia, Sage Trudeau, Daniel Capecci

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出基于信号处理原理的基座模型,通过射频数据训练实现跨模态迁移,无需目标域微调,以1.99M参数在15个任务上平均准确率77.7%。

Comments 102 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 13 篇

1803.02099 2026-06-04 cs.LG cs.SY eess.SY 78%

A Hybrid Method for Traffic Flow Forecasting Using Multimodal Deep Learning

一种用于交通流预测的混合方法:使用多模态深度学习

Shengdong Du, Tianrui Li, Xun Gong, Shi-Jinn Horng

机构 * School of Information Science and Technology, National Engineering Laboratory of Integrated Transportation Big Data Application Technology(信息科学与技术学院,集成交通大数据应用技术国家工程实验室) Department of Computer Science and Information Engineering, National Taiwan University of Science and Technology(计算机科学与工程系,台湾大学科技学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出了一种混合多模态深度学习方法,用于短期交通流预测,通过注意力辅助多模态深度学习架构联合和自适应学习多模态交通数据的空间时间相关特征和长期时间依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05115 2026-06-04 cs.CV cs.AI cs.CL 75%

Continual Visual and Verbal Learning Through a Child's Egocentric Input

通过儿童自我中心输入进行持续的视觉与语言学习

Xiaoyang Jiang, Yanlai Yang, Kenneth A. Norman, Brenden Lake, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学) Department of Psychology, Princeton University(心理学系,普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出BabyCL持续多模态学习框架,在单一时间顺序处理SAYCam数据集,通过流式视觉表示学习和图像-文本对比目标,在SAYCam Labeled-S 4AFC基准上优于流式学习基线,缩小了与离线训练上限的差距。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-06-04 cs.CL 70%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04806 2026-06-04 cs.CV cs.AI 62%

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

NoRA: 评估视觉第一人称规范性动作推理中的基于事实的合理性

Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

机构 * The University of Sydney(悉尼大学) Australian National University(澳大利亚国立大学) RMIT University(皇家墨尔本理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出NoRA基准,通过事实-理由-动作支持图评估多模态模型生成合理动作并基于可见事实进行推理的能力,发现当前VLM在构建完整动作空间和绑定正确支持方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03598 2026-06-04 cs.RO cs.AI cs.CV 62%

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

PHASER: 面向视觉-语言-动作模型的相位感知与语义经验回放

Ziyang Chen, Shaoguang Wang, Weiyu Guo, Qianyi Cai, He Zhang, Pengteng Li, Yiren Zhao, Yandong Guo

机构 * Thrust of AI, HKUST(Guangzhou)(人工智能 thrust,香港科技大学(广州)) AI 2 Robotics, Shenzhen, China(人工智能与机器人,深圳,中国)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出PHASER框架,通过相位感知容量分配和多模态干扰路由策略,结合自动相位提取管线Auto-PC,解决VLA模型在持续学习中的灾难性遗忘问题,在LIBERO基准上平均成功率提升高达31%。

Comments 20 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09686 2026-06-04 cs.AI cs.CV 62%

Belief-Aware VLM Model for Human-like Reasoning

信念感知的VLM模型用于类人推理

Anshul Nayak, Shahil Shaik, Yue Wang

机构 * Mechanical Engineering Department, Clemson University(克莱姆森大学机械工程系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种信念感知的视觉语言模型框架,通过检索式记忆和强化学习近似信念,提升长时程意图推理能力,在HD-EPIC等数据集上优于零样本基线。

Comments Accepted for publication at the IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). 6 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22121 2026-06-04 cs.CV cs.AI 62%

GenSpan: Generation-Calibrated Motion Span Priors for Multi-Verb Video Corpus Moment Retrieval

GenSpan: 用于多动词视频语料库时刻检索的生成校准运动跨度先验

Yunzhuo Sun, Xinyue Liu, Yanyang Li, Nanding Wu, Linlin Zong, Xianchao Zhang, Wenxin Liang

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出GenSpan框架,利用LLM生成辅助视频作为时间先验,结合令牌选择器和双向状态空间模型,提升多动词查询下的视频语料库时刻检索与定位性能。

Comments Major revision with title change, updated method, and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04836 2026-06-04 cs.CV 57%

3D Temporal Analysis for Autism Spectrum Disorder Screening During Attention Tasks

注意力任务期间自闭症谱系障碍筛查的3D时间分析

Inam Qadir, Elizabeth B Varghese, Dena Al-Thani, Marwa Qaraqe

机构 * College of Science and Engineering, Hamad Bin Khalifa University, Qatar Foundation, Doha, Qatar(科学与工程学院,哈马德·本·哈利法大学,卡塔尔基金会,多哈,卡塔尔)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于DECA的3D时间分析框架,提取头部姿态和面部表情特征,利用LSTM/GRU分类器在VR-CPT任务中实现ASD筛查,多模态融合达到84.6%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04596 2026-06-04 cs.CL 57%

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

多视频摘要中位置偏差的系统评估:基于多模态大语言模型

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(未来科学国际中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究系统评估了多模态大语言模型在多视频摘要任务中的位置偏差,通过构建基准和三种互补指标揭示了领域与模型依赖的偏差特性,并分析了提示级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04323 2026-06-04 cs.CV 57%

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge

面向CVPR 2026 VidLLMs挑战赛的基于边际触发问题重新仲裁的答案自一致性方法

Tomoya Miyazawa, Hiroyasu Okuno

机构 * Data Analytics Labo Co.(数据分析师实验室公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种无需训练的测试时推理框架ASC-MQRA,通过答案自一致性聚合多轮视频问答结果,并利用边际触发机制对低置信度样本进行条件性重新仲裁,在CVPR 2026 VidLLMs挑战赛Track 2上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04098 2026-06-04 cs.CV 57%

When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection

当眼见不再为实——面向搜索辅助的视频虚假信息检测基准

Tao Yu, Yujia Yang, Shenghua Chai, Zhang Jinshuai, Haopeng Jin, Hao Wang, Minghui Zhang, Zhongtian Luo, Yuchen Long, Xinlong Chen, Jiabing Yang, Zhaolu Kang, Yuxuan Zhou, Zhengyu Man, Xinming Wang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) BAAI(百度人工智能研究院) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EVID-Bench基准,通过跨视频对比和开放网络搜索检测视频虚假信息,涵盖9种操纵类型,评估前沿多模态模型发现准确率低且面临多种挑战。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.09914 2026-06-04 eess.SY cs.PF cs.SY q-bio.MN 50%

Semi-Quantitative Abstraction and Analysis of Chemical Reaction Networks

化学反应网络的半定量抽象与分析

Milan Češka, Jan Křetínský

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种新的方法,用于预测和解释化学反应网络的暂态和稳态行为,通过半定量的抽象和分析,实现对复杂动态系统的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.09104 2026-06-04 q-bio.QM cond-mat.stat-mech cs.NA math.NA q-bio.MN q-bio.SC 50%

Distribution approximations for the chemical master equation: comparison of the method of moments and the system size expansion

化学主方程的分布近似:矩法与系统规模展开法的比较

Alexander Andreychenko, Luca Bortolussi, Ramon Grima, Philipp Thomas, Verena Wolf

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文比较了矩法和系统规模展开法在近似化学主方程分布中的准确性,通过单峰和多峰蛋白质分布的基因表达网络验证了两种方法的优劣。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 9 篇

2606.04240 2026-06-04 cs.CV cs.AI cs.CL 82%

Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

EReL@MIR 2025 多模态文档检索挑战赛(赛道1)概述

Jingbiao Mei

机构 * University of Cambridge(剑桥大学) Cambridge United Kingdom(剑桥英国)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文介绍了EReL@MIR 2025多模态文档检索挑战赛(赛道1)的设计、数据集、评估协议、最终排名及前三名获胜系统的分析,所有系统均基于Qwen2-VL系列解码器多模态大语言模型嵌入器。

Comments MDR Challenge Report at WWW2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04591 2026-06-04 cs.CL cs.CV 81%

Fine-grained Fragment Retrieval in Multi-modal Long-form Dialogues

多模态长对话中的细粒度片段检索

Hanbo Bi, Zhiqiang Yuan, Chongyang Li, Qiwei Yan, Zexi Jia, Jiapei Zhang, Xiaoyue Duan, Yingchao Feng, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(模式识别中心、微信AI、腾讯公司) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所、中国科学院)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出细粒度片段检索任务,通过强化学习训练的生成式检索模型F2RVLM和两阶段系统FFRS,实现多模态长对话中多语句、多图像片段的精准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04231 2026-06-04 cs.CL cs.AI 81%

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG:面向通用企业问答的多模态检索增强生成再思考

Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

机构 * JPMorgan Chase & Co.(摩根大通公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MM-BizRAG框架,通过文档结构感知分割和布局感知解析,结合统一LLM驱动的工件转换与推理时多模态组装,无需微调即可提升企业文档问答性能,在异构企业数据集和两个公开基准上超越基线最多32个百分点。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04604 2026-06-04 cs.CV 70%

COMBINER: Composed Image Retrieval Guided by Attribute-based Neighbor Relations

COMBINER: 基于属性邻居关系的组合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Haokun Wen, Xuemeng Song, Liqiang Nie

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对组合图像检索中视觉相似但属性不同的样本问题,提出基于属性原型的跨模态统一表示方法COMBINER,通过自适应语义解耦、统一原型组合和双重关系建模提升检索准确性。

Comments Accepted by IEEE TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00104 2026-06-04 cs.CV cs.AI 62%

R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架

Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出R3G框架,通过先制定推理计划指定所需视觉线索,再采用粗检索加细粒度重排序的两阶段策略选择证据图像,在MRAG-Bench上提升六种多模态大语言模型在九个子场景中的准确率,实现整体最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏