arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-29 至 2026-05-29 共收录 22 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 22 篇

2508.16873 2026-05-29 cs.CV cs.SI 89%

Multimodal LLMs See Sentiment

多模态大语言模型感知情感

Neemias B. da Silva, John Harrison, Rodrigo Minetto, Myriam R. Delgado, Bogdan T. Nassu, Thiago H. Silva

机构 * Universidade Tecnológica Federal do Paraná(联邦技术大学帕拉纳州大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 本文通过系统评估研究,探讨多模态大语言模型在图像情感分析中的三种方法,发现基于MLLM描述的两阶段流水线在微调后性能显著优于传统基线。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21151 2026-05-29 cs.IR 85%

VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion

VOGUE:面向时尚领域对话式推荐的多模态数据集

David Guo, Minqi Sun, Yilun Jiang, Jiazhou Liang, Scott Sanner

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);multimodal foundation model(abstract)

AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29462 2026-05-29 cs.CV cs.AI 84%

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset

大型视觉语言模型在CFMME上的基准测试:一个全面的中文金融多模态评估数据集

Qian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文言金团队,阿里云计算)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CFMME,一个包含6052个实例的中文金融多模态评估基准,涵盖八种主要金融图像模态和四项核心多模态任务,用于评估LVLMs在金融业务全流程中的感知、理解、推理和认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30168 2026-05-29 cs.CV 83%

OmniCD: A Foundational Framework for Remote Sensing Image Change Detection Guided by Multimodal Semantics

OmniCD:多模态语义引导的遥感图像变化检测基础框架

Chenhao Sun

机构 * Wuhan University(武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出OmniCD框架,通过多模态语义引导(图像和文本提示)统一遥感变化检测任务,结合层次化场景检索和风格解耦机制,并构建大规模数据集RSITCD,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29455 2026-05-29 cs.CV eess.SP 83%

Uni-RCM: Unified Reference-guided Cross-modal Mapping for Multi-Class Anomaly Detection

Uni-RCM:面向多类异常检测的统一参考引导跨模态映射

Yangchen Wu, Huiqiang Xie

机构 * School of Information Science and Technology, Jinan University(信息科学与技术学院,暨南大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出Uni-RCM框架,通过参考引导块和离线残差量化器,实现多类工业异常检测的统一建模,在MVTec-3D AD数据集上达到最优性能。

Comments This work has been submitted IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20743 2026-05-29 cs.HC cs.AI cs.CL 81%

Empathic Prompting: Non-Verbal Context Integration for Multimodal LLM Conversations

共情提示:多模态大语言模型对话中的非语言上下文整合

Lorenzo Stacchio, Andrea Ubaldi, Alessandro Galdelli, Maurizio Mauri, Emanuele Frontoni, Andrea Gaggioli

机构 * University of Macerata(马切拉塔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出共情提示框架,通过集成面部表情识别服务将非语言情感线索隐式融入大语言模型对话,实现无需用户显式控制的流畅多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16548 2026-05-29 cs.LG cs.AI cs.CV 81%

A Composable Multimodal Framework for cine CMR-Text-Driven Prediction of Heart Failure Outcomes

用于电影心脏磁共振-文本驱动的心力衰竭结局预测的可组合多模态框架

Jianzhou Chen, Jinyang Sun, Xiumei Wang, Xi Chen, Heyu Chu, Guo Song, Yuji Luo, Xingping Zhou, Rong Gu

机构 * Department of Cardiology, Nanjing Drum Tower Hospital, State Key Laboratory of Pharmaceutical Biotechnology, Nanjing University(南京鼓楼医院心内科,南京大学国家药物生物技术重点实验室) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) College of Electronic and Optical Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学电子与光学工程学院) College of Integrated Circuit Science and Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学集成电路科学与工程学院) Department of Cardiology, Nanjing Drum Tower Hospital Clinical College of Nanjing Medical University(南京医科大学南京鼓楼医院临床学院心内科) Institute of Quantum Information and Technology, Nanjing University of Posts and Telecommunications(南京邮电大学量子信息与技术研究院)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种可组合多模态框架,通过整合cine CMR影像、结构化临床指标和非结构化文本记录,实现比单模态AI算法更准确的心力衰竭预后预测,并支持个性化治疗优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30027 2026-05-29 cs.CV cs.IR 79%

DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark

DocRetriever:面向多模态文档检索的即插即用框架与综合基准

Ruofan Hu, Menghui Zhu, Jieming Zhu, Bo Chen, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Li Tang, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DocRetriever即插即用框架,通过布局感知的稀疏嵌入和推理增强的重排序器解决多模态文档检索中语义模糊和泛化瓶颈问题,并构建MultiDocR基准实现更严格评估。

Comments Accepted at KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29579 2026-05-29 cs.CV 79%

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

ReactBench:通过系统评估的多模态幻觉因果驱动基准

Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

机构 * East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ReactBench基准,通过对抗性图像和诱导幻觉的查询,系统评估多模态大模型在关系擦除、反事实属性、变化追踪和密集计数等任务中的因果幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29339 2026-05-29 cs.CV 79%

DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

DMC-CF: 用于因果推理的动态多模态反事实QA基准

Junzhe Zhang, Huixuan Zhang, Guirong Wang, Xingyao Zhang, Pei Liu, Lin Qu, Hu Wei, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有因果推理数据集规模有限或基于非真实数据的问题,提出基于真实视频的大规模多模态因果反事实推理基准DMC-CF-Static,并利用动态图干预框架构建动态评估基准DMC-CF-Dynamic,实验表明当前多模态大模型在真实场景下的因果推理能力仍需大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26255 2026-05-29 eess.IV cs.AI cs.LG 79%

Prospective evaluation of multimodal respiratory failure prediction: Do chest X-rays improve performance beyond EHR signals?

多模式呼吸衰竭预测的前瞻性评估:胸部X光片能否在电子健康记录信号之外提升性能?

Xiaolei Lu, Shamim Nemati

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出一种门控多模态框架,集成结构化电子健康记录时间序列数据和胸部X光片基础模型表示,用于前瞻性预测ICU患者24小时内是否需要有创机械通气,结果显示相比仅使用电子健康记录的模型和医生预测,多模态融合提高了区分度、敏感性和阳性预测值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24399 2026-05-29 cs.AI 79%

ConceptM$^3$oE: Concept-Guided Multimodal Mixture of Experts for Interpretable Computational Pathology

ConceptM$^3$oE:面向可解释计算病理学的概念引导多模态专家混合模型

Xuan Wang, Zhongling Xu, Gopi Kannedhara, Joakim Nguyen, Jian Yu, Jinrui Fang, Abdurrahmaan Baghdadi, Tianlong Chen, Awais Naeem, Chandra Krishnan, Edward Castillo, Andrew H. Song, Ankita Shukla, Ying Ding, Nicholas Konz, Hairong Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Dell Children’s Medical Center(德尔儿童医疗中心) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) University of Nevada, Reno(内华达大学里诺分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出ConceptM$^3$oE框架,通过概念引导的多模态专家混合路径嵌入概念形成,并利用残差路径保持性能与可解释性,在脑肿瘤分类中优于基线并提升小样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06063 2026-05-29 cs.AI cs.IT cs.LG math.IT 79%

TelecomTS: A Multi-Modal Observability Dataset for Time Series and Language Analysis

TelecomTS:面向时间序列与语言分析的多模态可观测性数据集

Austin Feng, Andreas Varvarigos, Ioannis Panitsas, Daniela Fernandez, Jinbiao Wei, Yuwei Guo, Jialin Chen, Ali Maatouk, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出TelecomTS,一个来自5G电信网络的大规模多模态可观测性数据集,通过保留绝对尺度信息的异质协变量和多样化下游任务(异常检测、根因分析、多模态问答),揭示了现有模型在处理可观测性数据的高噪声、突变特性时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29401 2026-05-29 cs.LG 78%

Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting

重新思考多模态时间序列预测的后训练方法

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出PostTime后训练方法,结合监督微调和基于可验证奖励的强化学习,利用大语言模型根据多模态上下文修正数值时间序列基础模型的预测,显著提升多模态时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29476 2026-05-29 cs.CL 70%

Comparative Evaluation of Machine Translation Systems on Images with Text

含文本图像的机器翻译系统比较评估

Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta

机构 * ValgrAI - Valencian Graduate School and Research Network for Artificial Intelligence(ValgrAI - 瓦伦西亚人工智能研究生学院和研究网络)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 本研究比较评估了三种机器翻译范式(模块化流水线、多模态大语言模型和端到端模型Translatotron-V)在含文本图像翻译任务上的性能,发现多模态大语言模型表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00969 2026-05-29 cs.SD cs.AI cs.CL 62%

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

MedMosaic:一个具有挑战性的多样化医学音频大规模基准

Harshit Rajgarhia, Shuubham Ojha, Asif Shaik, Akhil Pothanapalli, Rachuri Lokesh, Abhishek Mukherji, Prasanna Desikan

机构 * Centific Global Solutions Inc.(Centific全球解决方案公司) University of Maryland, College Park, MD, USA(马里兰大学学院市分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 为解决医学音频数据稀缺和现有基准不足的问题,提出MedMosaic数据集,包含多种医学音频类型和46701个问答对,用于评估语言和音频推理模型,实验表明推理仍具挑战性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27959 2026-05-29 cs.CV cs.AI 62%

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

ROVER: 面向对象中心视觉证据的路由用于基于多图像推理

Guannan Lv, Ren Nie, Hongjian Dou, Tingting Gao

机构 * Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ROVER,一种轻量级可学习插件,通过对象中心差分注意力聚合上下文、蒸馏图像内线索并路由历史感知证据,实现高效全局视觉证据路由,在多图像推理中提升答案和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30062 2026-05-29 cs.CV 57%

FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection

FakeVLM-R1:通过思维链内化物理定律进行合成图像检测

Leqi Zhu, Junyan Ye, Kaiqing Lin, Zhiyuan Yan, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Nanjing University(南京大学) Sun Yat-Sen University(中山大学) Shenzhen University(深圳大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出FakeVLM-R1框架,结合监督微调、组相对策略优化和批判性思维链机制,通过双向辩证推理和物理常识构建真实性反证,实现高精度、逻辑可解释的合成图像检测,解决现有方法的过度拒绝偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30029 2026-05-29 cs.AI 57%

RAISE: RAG Design as an Architecture Search Problem

RAISE:将RAG设计视为架构搜索问题

Zhen Chen, Yibing Liu, Weihao Xie, Yu Liang, Peilin Chen, Shiqi Wang

机构 * City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出将检索增强生成(RAG)系统的设计选择形式化为架构搜索问题,并构建RAISE框架和基准,通过标准化搜索空间和预算评估13种优化算法在7个数据集上的表现,发现优化性能高度依赖任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26994 2026-05-29 cs.CV 57%

ChartAct: A Benchmark for Dynamic Chart Understanding

ChartAct: 动态图表理解基准

Muye Huang, Lin Wu, Lingling Zhang, Hang Yan, Zhiyuan Wang, Yumeng Fu, Zesheng Yang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) MOE KLNN Lab, Xi’an Jiaotong University(西安交通大学MOE KLNN实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出ChartAct基准,通过收集673个动态图表和1440个问答样本,评估多模态模型在交互式图表理解中的能力,发现现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16658 2026-05-29 cs.AI cs.CE 57%

Large-Scale AI and Foundation Models for Neuroscience: A Comprehensive Review

大规模人工智能与基础模型在神经科学中的应用:综合综述

Shihao Yang, Xiying Huang, Danilo Bernardo, Jun-En Ding, Andrew Michael, Guoan Wang, Jingmei Yang, Alison Anderson, Dinesh Giritharan, Patrick Kwan, Ashish Raj, Yu Zhang, Feng Liu

机构 * Department of Systems Engineering, Stevens Institute of Technology(系统工程系,史蒂文斯理工学院) Department of Neurology and Weill Institute for Neurosciences, University of California San Francisco(神经病学系和Weill神经科学研究所,旧金山大学) Duke Institute for Brain Sciences, Duke University(杜克大学脑科学研究所) Division of Systems Engineering, Department of Electrical and Computer Engineering, Boston University(系统工程 division,电气与计算机工程系,波士顿大学) Department of Neuroscience, School of Translational Medicine, Monash University(神经科学系,转化医学学院,莫纳什大学) Department of Neurology, Alfred Hospital, Melbourne, Victoria, Australia(神经病学系,阿尔弗雷德医院,墨尔本,维多利亚州,澳大利亚) Department of Radiology and Biomedical Imaging, University of California, San Francisco, CA, USA(放射学与生物医学成像系,旧金山大学,加州,美国) Department of Psychiatry and Behavioral Sciences, School of Medicine, Stanford University(精神病学与行为科学系,医学院,斯坦福大学) Wu Tsai Neurosciences Institute, Stanford University(吴氏神经科学研究所,斯坦福大学) Stanford Institute for Human-Centered AI, Stanford University(斯坦福大学人本人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了大规模AI模型在神经科学四个主要领域(神经影像与数据处理、脑机接口与神经解码、临床决策支持与转化框架、神经系统与精神疾病特定应用)的应用,展示了其在多模态数据整合、时空模式解释和临床转化方面的潜力,并强调了严格评估、领域知识整合、临床验证和伦理指南的重要性。

Comments Accepted for publication in Meta-Radiology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20904 2026-05-29 cs.IR 50%

FORGE: Forming Semantic Identifiers for Generative Retrieval in Industrial Datasets

FORGE:面向工业数据集中生成式检索的语义标识符构建

Kairui Fu, Tao Zhang, Shuwen Xiao, Ziyang Wang, Xinming Zhang, Chenchi Zhang, Yuliang Yan, Junjun Zheng, Xiangheng Kong, Shengyu Zhang, Kun Kuang, Yuning Jiang

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出FORGE基准,通过多视角分类和离线实验研究语义标识符构建策略,并设计无需完整GR训练的新评估指标,在淘宝线上A/B测试中实现交易量提升0.35%。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏