arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-25 至 2026-05-25 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2605.01018 2026-05-25 cs.CV 88%

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Junzhe Huang, Xiaoxiao Sun, Yan Yang, Yuxuan Hou, Ruotian Zhang, Sirui Li, Hehe Fan, Serena Yeung-Levy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Stanford University(斯坦福大学) The Australian National University(澳大利亚国立大学) Zhejiang University(浙江大学) Murdoch University(莫纳什大学) The University of Adelaide(阿德莱德大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23157 2026-05-25 cs.CL 84%

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面

Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

机构 * Appen(Appliance)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CL

AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22907 2026-05-25 cs.CV 83%

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

VideoOdyssey: 超长上下文与全模态视频理解基准

Haichen He, Jiayi Zhou, Sifeng Shang, Yihan Hu, Yuanhan Zhang, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) S-Lab, Nanyang Technological University(S 实验室,南洋理工大学) GVC Lab, Great Bay University(GVC 实验室,Great Bay 大学)

专题命中 多模态评测 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出VideoOdyssey基准,通过连续证书长度度量认知负荷,评估多模态大模型在超长视频(平均109分钟)上的连续跟踪、信息整合与记忆能力,涵盖视觉与音视频双模态,揭示模型在长上下文推理、细粒度感知和非语言全模态理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 81%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08945 2026-05-25 cs.AI 79%

FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation

FATHOMS-RAG:评估使用检索增强生成的多模态系统思考与观察的框架

Samuel Hildebrand, Curtis Taylor, Sean Oesch, James M Ghawaly, Amir Sadovnik, Ryan Shivers, Brandon Schreiber, Kevin Kurian

机构 * Louisiana State University(路易斯安那州立大学) Oak Ridge National Lab(橡树岭国家实验室) University of Florida(佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一个评估RAG管道的基准,包含93个多模态问题、短语级召回率指标、最近邻嵌入分类器,并对比开源与闭源管道性能,发现闭源管道在正确性和幻觉指标上显著优于开源。

Comments Accepted at SAFE-ML 2026 Workshop at the International Conference on Software Testing (ICST) 2026 Code: https://github.com/Sam-Hildebrand/FATHOMS-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02719 2026-05-25 cs.LG 78%

An Empirical Analysis of Calibration and Selective Prediction in Multimodal Clinical Condition Classification

多模态临床状况分类中的校准与选择性预测的实证分析

L. Julián Lechuga López, Farah E. Shamout, Tim G. J. Rudner

机构 * New York University(纽约大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究通过实证分析多标签临床状况分类中基于不确定性的选择性预测,发现其性能可能严重下降,原因是类别依赖的误校准,尤其对少数类别,并强调需要校准感知评估来确保临床AI的安全性。

Comments 40 pages, 14 figures, 16 tables. Accepted as a conference paper at AHLI Conference on Health, Inference, and Learning (CHIL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22891 2026-05-25 cs.LG hep-ex 78%

Pointwise Metrics Mislead: An Evaluation Protocol for Multimodal Inverse Problems

逐点度量误导:多模态逆问题的评估协议

Mads H. Baattrup, Jörn Bach, Laurids Jeppe, Finn Labe, Alexander Grohsjean, Christian Schwanenberger, Peer Stelldinger

机构 * Deutsches Elektronen-Synchrotron(德意志电子同步辐射研究中心) CERN(欧洲核子研究中心) University of Hamburg(汉堡大学) HAW Hamburg(汉堡应用技术大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对多模态后验的逆问题,指出逐点度量(如RMSE、MAE)会导致谱特征压缩,提出包含CRPS、谱保真度和校准的三部分评估协议。

Comments 29 pages, 9 figures, and 8 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03530 2026-05-25 cs.MM cs.CL cs.CV 75%

How Far Are We from Generating Missing Modalities with Foundation Models?

我们距离用基础模型生成缺失模态还有多远?

Guanzhou Ke, Bo Wang, Guoqing Chao, Weiming Hu, Shengfeng He

机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。

Comments T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23326 2026-05-25 cs.CL 74%

ClimateChat-300K: A Multi-Modal Facebook Dataset for Understanding Diverse Perspectives in Climate Communication

ClimateChat-300K:一个用于理解气候传播中不同观点的多模态Facebook数据集

Wajdi Zaghouani, Md. Rafiul Biswas, Mabrouka Bessghaier, Shimaa Ibrahim, George Mikros

机构 * Northwestern University in Qatar(卡塔尔西北大学) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CL

AI总结 通过CrowdTangle平台收集2020年5月至2024年5月间的299,329条Facebook公开帖子,利用主题建模和情感分析识别出政策、行动主义、合作、科学和保护五大领域十个主题,揭示了情感基调、帖子格式和页面身份对受众参与度的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23068 2026-05-25 cs.CV 74%

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

RoboSurg-VQA:面向手术分割感知的视觉问答多模态基准

Chengyi Zhang, Zi Ye, Ziyang Wang

机构 * Swansea University, UK(威尔士大学) Maynooth University, Ireland(迈诺特大学) Aston University, UK(阿斯顿大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出RoboSurg-VQA基准,通过重新利用公共手术分割数据集,构建分割感知的视觉问答任务,以评估在机器人辅助和微创手术中恶劣视觉条件下的语言化临床问题理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23580 2026-05-25 cs.CV 70%

Calibration-Informative Region Selection for Online LiDAR--Camera Calibration in Agricultural Environments

农业环境中在线LiDAR-相机标定的标定信息区域选择

Rajitha de Silva, Grzegorz Cielniak

机构 * Lincoln Institute for Agri-Food Technology, University of Lincoln, UK(林肯农业食品技术研究所,林肯大学,英国)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出一种基于支持图的在线LiDAR-相机标定方法,通过密集标定支持图识别可靠观测区域,提升标定精度。

Comments Accepted to ICRA 2026 Workshop on Agricultural Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 62%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23629 2026-05-25 cs.CV 57%

DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs

DDX-TRACE: 视觉语言模型中医学诊断轨迹的基准

Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) Aalto University(阿尔托大学) Imperial College London(伦敦帝国学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出DDX-TRACE基准,通过隐藏证据的多轮诊断轨迹评估VLM在神经放射学中的工作流质量,揭示最终诊断分数无法反映的推理缺陷。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23397 2026-05-25 cs.CV 57%

Joint Target-Less Intrinsic and Extrinsic Camera-LiDAR Calibration using Deep Point Correspondences

基于深度点对应的无靶标联合相机-激光雷达内参和外参标定

Simon Bultmann, Daniele Cattaneo, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg, Germany(弗赖堡大学计算机科学系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出首个完全无靶标的联合标定流程,通过深度像素-点对应同时估计相机内参(含畸变)和相机-激光雷达外参,并采用结构运动初始化内参、联合非线性优化。

Comments presented at 2nd German Robotics Conference (GRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23287 2026-05-25 cs.CV 57%

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

LangFlash: 基于前馈的3D语言高斯泼溅从稀疏无位姿图像

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出LangFlash,一种前馈框架,从稀疏无位姿多视图图像直接预测3D高斯原语及其语言对齐语义特征,实现低延迟3D重建和语义一致场景理解。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23219 2026-05-25 cs.LG cs.AI 57%

PaP-NF: Probabilistic Long-Term Time Series Forecasting via Prefix-as-Prompt Reprogramming and Normalizing Flows

PaP-NF: 通过前缀作为提示重编程和归一化流进行概率长期时间序列预测

Minju Kim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国Inha大学工业工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 提出PaP-NF框架,利用前缀作为提示机制对齐连续时间序列表示与冻结的大语言模型,并基于归一化流解码器生成概率预测,在长期基准上捕获多模态不确定性并保持点预测精度。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28048 2026-05-25 cs.CL cs.SI 57%

Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

稳定行为,有限变化:城市情感感知中LLM智能体的角色有效性

Neemias B da Silva, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究通过多角色提示生成LLM智能体,发现角色内行为稳定但角色间差异有限,且无角色模型在某些任务中表现更优。

Comments 8 pages, 8 figures. IEEE DCOSS - UrbCom

Journal ref IEEE DCOSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13249 2026-05-25 q-bio.BM cs.AI cs.LG 57%

A Systematic Evaluation of Co-folding Model Representations for Small-Molecule Learning

小分子学习的共折叠模型表示的系统评估

Hyosoon Jang, Hyunjin Seo, Honghui Kim, Seonghyun Park, Taewon Kim, Yunhui Jang, Sungsoo Ahn

机构 * KAIST(韩国科学技术院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 本研究利用现代共折叠模型Boltz2,通过系统探测和蒸馏,评估其原子级配体表示在小分子任务中的表现,发现共折叠表示在ADMET基准上匹配或超越现有模型,加速分子生成建模,并提高结构引导配体优化的样本效率,表明蛋白质-配体共折叠是小分子表示学习的有前景的预训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17171 2026-05-25 cs.CV cs.LG 57%

FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle

FireScope: 基于思维链预言机的野火风险栅格预测

Mario Markov, Stefan Maria Ailuro, Luc Van Gool, Konrad Schindler, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出FireScope框架,利用视觉语言模型结合强化学习和视觉监督,通过推理轨迹生成野火风险栅格,在跨大陆泛化中取得显著性能提升。

Comments CVPR 2026, Project Page: https://firescope.ai/research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23516 2026-05-25 eess.SP 50%

Comprehensive Dataset and Signal Processing Framework for Phonocardiogram-Based Heart Rate and Blood Pressure Estimation

基于心音图的心率和血压估计的综合数据集与信号处理框架

Abdul Ahad Mamun, Utsab Saha, Md Hasibul Hasan, Shahed Ahmed, MD Jahin Alam

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出一种仅使用心音图信号测量心率和血压的低成本PhonoTrack系统,通过峰值检测和多元回归模型实现高精度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02612 2026-05-25 hep-ph 50%

Model Parameter Reconstruction of Electroweak Phase Transition with TianQin and LISA: Insights from the Dimension-Six Model

天琴和LISA对电弱相变模型参数的重建:来自维度-6模型的见解

Aidi Yang, Chikako Idegawa, Fa Peng Huang

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究天琴和LISA通过随机引力波背景的谱特征重建维度-6希格斯算子扩展标准模型中模型参数Λ的能力,采用Fisher矩阵分析、贝叶斯嵌套采样和机器学习方法实现高精度重建。

Comments 48 pages, 15 figures, 7 tables, accepted version of Physical Review D

详情

展开后加载摘要…

URL PDF HTML 收藏