arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2603.21597 2026-03-25 cs.AI cs.CV 84%

Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment

Cerebra:一个多学科AI平台用于多模态痴呆症特征化和风险评估

Sheng Liu, Long Chen, Zeyun Zhao, Qinglin Gou, Qingyue Wei, Arjun Masurkar, Kevin M. Spiegler, Philip Kuball, Stefania C. Bray, Megan Bernath, Deanna R. Willis, Jiang Bian, Lei Xing, Eric Topol, Kyunghyun Cho, Yu Huang, Ruogu Fang, Narges Razavian, James Zou

机构 * Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科) Center for Data Science, New York University(纽约大学数据科学中心) J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学杰·克雷顿·普瑞特家庭生物医学工程系) Department of Biomedical Engineering and Informatics, Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校生物医学工程与信息学系) Department of Neurology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科) Department of Neuroscience, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科学系) UF Health Family Medicine – Haile Plantation(佛罗里达大学健康家庭医学-海莱种植园) Department of Family Medicine, Indiana University School of Medicine(印第安纳大学医学院家庭医学系) Department of Biostatistics and Health Data Science, Indiana University School of Medicine(印第安纳大学医学院生物统计学与健康数据科学系) Scripps Research Translational Institute(斯克里普斯研究转化研究所) Courant Institute, New York University(纽约大学柯朗研究所) Center for Biomedical Informatics, Regenstrief Institute(再生斯蒂夫研究所生物医学信息中心) Center for Cognitive Aging and Memory, McKnight Brain Institute, University of Florida(佛罗里达大学麦金托神经研究所认知衰老与记忆中心) Population Health Department, NYU Langone Health(纽约大学兰戈恩健康人口健康部) Radiology Department, NYU Langone Health(纽约大学兰戈恩健康放射科)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 Cerebra通过多智能体协调处理电子病历、临床笔记和医学影像,提供可视化分析和对话界面,提升临床决策支持的可解释性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08174 2026-03-25 cs.CV 83%

MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

MERLIN:构建低信噪比鲁棒的多模态大语言模型以电磁信号

Junyu Shen, Zhendong She, Chenghanyu Zhang, Yuchuang Sun, Luqing Luo, Dingwei Tan, Zonghao Guo, Bo Guo, Zehua Han, Wupeng Xie, Yaxin Mu, Peng Zhang, Peipei Li, Fengxiang Wang, Yangang Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所) HKUST (Guangzhou)(香港科技大学(广州)) National University of Defense Technology(国防科技大学) Beihang University(北航) Beijing Information Science and Technology University(北京信息科技大学) Artificial Intelligence Institute of China Electronics Technology Group Corporation(中国电子科技集团人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MERLIN框架,通过构建EM-100k数据集和EM-Bench基准,解决电磁信号多模态大语言模型在低信噪比环境下的鲁棒性问题,验证了方法在EM-Bench上的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22321 2026-03-25 cs.CV cs.AI cs.CL 82%

From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs

从指令到协助:一个对齐指令手册与装配视频的数据集用于评估多模态大语言模型

Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工大学DEIB学院) KASTEL, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院KASTEL研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出M2AD数据集,用于评估多模态大语言模型在技术任务中的协助能力,探讨其推理、步骤跟踪和指令引用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI 81%

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23229 2026-03-25 cs.CL 79%

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义

Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) National Research Council Canada(加拿大国家研究委员会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文评估了八种最先进的生成式多模态大语言模型在检测和解释六种隐喻意义类型上的能力,并通过人工评估验证其解释的合理性与忠实性。

Comments LREC 2026, 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV 79%

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22756 2026-03-25 cs.CV 79%

MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding

MVPBench: 一个多视频感知评估基准用于多模态视频理解

Purui Bai, Tao Wu, Jiayang Sun, Xinyue Liu, Huaibo Huang, Ran He

机构 * MAIS \& NLPR, Institute of Automation Chinese Academy of Sciences Beijing, China SIST ShanghaiTech University Shanghai, China

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 MVPBench通过14个跨多样本域的子任务评估模型从视频序列中提取相关信息的能力,揭示当前模型在多视频处理上的局限性。

Comments 15 pages, 7 figures, accepted by IJCNN 2026, code and dataset available at https://github.com/MVPBench/MVPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04406 2026-03-25 cs.IR cs.AI cs.IT cs.LG cs.SI math.IT 79%

Training-free Adjustable Polynomial Graph Filtering for Ultra-fast Multimodal Recommendation

无需训练的可调多项式图过滤器用于超快多模态推荐

Yu-Seung Roh, Joo-Young Kim, Jin-Duk Park, Won-Yong Shin

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) NAVER Corporations(NAVER公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的多模态推荐方法,通过构建相似性图并利用多项式图滤波器融合多模态信号,提升推荐准确率并降低计算成本。

Comments 21 pages, 9 figures, 7 tables; published in the Engineering Applications of Artificial Intelligence (Please cite our journal version.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23358 2026-03-25 q-bio.NC 78%

A Synchronous EEG-fNIRS BCI: A Proof-of-Concept for Multimodal Avalanche Analysis of Motor Cognition in Older Adults

一种同步EEG-fNIRS脑机接口:多模态雪崩分析在老年人运动认知中的证明概念研究

Eva Guttmann-Flury, Yun-Hsuan Chen, Qiaoyuan Xiang, Hao Zhang, Mohamad Sawan

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出一种结合同步EEG-fNIRS与神经雪崩分析的多模态框架,用于检测阿尔茨海默病早期网络功能障碍。研究通过小样本试点验证了多模态框架的技术可行性,并发现条件依赖的网络组织模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22933 2026-03-25 q-bio.NC 78%

An Open-Access Multi-modal Dataset for Cognitive, Motor, and Cognitive-Motor Tasks

一个开放获取的多模态数据集用于认知、运动及认知-运动任务

Zaineb Ajra, Grégoire Vergotte, Stéphane Perrey, Lilian Evra, Simon Pla, Gérard Dray, Jacky Montmain, Binbin Xu

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出一个包含EEG、fNIRS、ECG等多模态数据的开放数据集,用于研究认知与运动任务的交互作用,支持开发先进的预处理方法和分析流程,应用于脑机接口和神经康复等领域。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07990 2026-03-25 cs.LG 78%

MJ1: Multimodal Judgment via Grounded Verification

MJ1: 通过 grounded 验证实现多模态判断

Bhavesh Kumar, Dylan Feng, Leonard Tang

机构 * Haize Labs(哈泽实验室)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22915 2026-03-25 cs.CV 70%

When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse

当AVSR遇见视频会议:数据集、退化及性能崩溃的隐藏机制

Yihuan Huang, Jun Xue, Liu Jiajun, Daixian Li, Tong Zhang, Zhuolin Yi, Yanzhen Ren, Kai Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education(航空航天信息安全部与可信计算教育部重点实验室) School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全科学与工程学院) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文系统评估了主流视频会议平台上的最新AVSR模型,发现传输失真和人类超表达导致性能退化,通过构建MLD-VC数据集揭示语音增强算法引起分布偏移,细调模型可降低17.5%的CER。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21395 2026-03-25 cs.CV 70%

Momentum Memory for Knowledge Distillation in Computational Pathology

动量记忆用于计算病理学中的知识蒸馏

Yongxin Guo, Hao Lu, Onur C. Koyun, Zhengjie Zhu, Muhammet Fatih Demir, Metin Nafi Gurcan

机构 * Wake Forest University School of Medicine(威克森林大学医学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MoMKD框架,通过动量更新的记忆机制整合基因组和病理学信息,提升跨模态知识蒸馏性能,实验表明其在病理学任务中表现优异。

Comments Accepted by CVPR 2026. Code: https://github.com/CAIR-LAB-WFUSM/MoMKD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 67%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22492 2026-03-25 cs.AI 57%

RealCQA-V2: A Diagnostic Benchmark for Structured Visual Entailment over Scientific Charts

RealCQA-V2:结构化科学图表视觉蕴含的诊断基准

Saleem Ahmed, Srirangaraj Setlur, Venu Govindaraju

机构 * University at Buffalo, Buffalo, NY, USA(布法罗大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 RealCQA-V2通过将图表问答转化为视觉前提证明任务,提供结构化视觉蕴含验证,揭示多模态推理中的局部-全局推理差距。

Comments Under Review : Code and Data will be made public soon - https://cse-ai-lab.github.io/VPP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23034 2026-03-25 cs.CV 57%

Traffic Sign Recognition in Autonomous Driving: Dataset, Benchmark, and Field Experiment

自动驾驶中的交通标志识别:数据集、基准测试与实地实验

Guoyang Zhao, Weiqing Qi, Kai Zhang, Chenguang Zhang, Zeying Gong, Zhihai Bi, Kai Chen, Benshan Ma, Ming Liu, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lingnan University(岭大) Shenzhen Unity Drive Innovation Technology Co., Ltd.(深圳Unity Drive创新技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TS-1M数据集及诊断基准,通过跨区域识别、稀有类别识别等挑战性任务,评估现代交通标志识别模型的性能,揭示语义对齐对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22689 2026-03-25 cs.CV 57%

Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth

Think 360°: 评估MLLMs的宽度中心推理能力超越深度

Mingrui Chen, Hexiong Yang, Haogeng Liu, Huaibo Huang, Ran He

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR&MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR&MAIS) School of Advanced Interdisciplinary Science, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一个全面的多模态基准,评估MLLMs的推理能力,特别关注推理宽度,作为深度的补充维度。通过1200+高质量多模态案例,提出细粒度树状思维评估协议,评估12种模型家族的推理宽度和深度,揭示当前模型在结合深度推理与广泛探索搜索方面的能力不足。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02448 2026-03-25 cs.CV cs.RO 57%

nuScenes Revisited: Progress and Challenges in Autonomous Driving

nuScenes 重新审视:自动驾驶领域的进展与挑战

Whye Kit Fong, Venice Erin Liong, Kok Seang Tan, Holger Caesar

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文重新审视nuScenes数据集,探讨其在自动驾驶发展中的核心作用,分析其技术细节及对后续研究的影响,总结多模态传感器融合与标准化评估的关键贡献。

Comments 18 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23470 2026-03-25 cs.SE 50%

ConceptCoder: Improve Code Reasoning via Concept Learning

ConceptCoder: 通过概念学习提升代码推理

Md Mahbubur Rahman, Hengbo Tong, Wei Le

专题命中 多模态评测 :multimodal(abstract)

AI总结 ConceptCoder通过学习代码概念提升代码推理能力,在漏洞检测任务中显著提高F1值,优于现有方法,并扩展至分支预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22410 2026-03-25 astro-ph.GA astro-ph.SR 50%

Detailed Analysis of the NGC 2168 Cluster, Leveraging Gaia DR3

NGC 2168星团的详细分析,利用Gaia DR3

Nasser M. Ahmed, Remziye Canbay, Deniz Cennet Çınar

专题命中 多模态评测 :multimodal(abstract)

AI总结 利用Gaia DR3数据对NGC 2168星团的运动学、结构和天体物理性质进行分析,确定其年龄、金属度和距离,发现其存在扩展的恒星晕和垂直方向的潮汐加热特征。

Comments 23 pages, including 21 figures and 7 tables accepted for publication in the Advances in Space Research

详情

展开后加载摘要…

URL PDF HTML 收藏