arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-13 至 2026-05-13 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2605.11693 2026-05-13 cs.AI 89%

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

超越文本的衡量:通过质量、对齐和多样性评估多模态摘要

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);image-text(abstract)

AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10357 2026-05-13 cs.MM cs.AI 81%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post: 实时可审计的多模态事实核查证据基础

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 RW-Post提出一个可审计的多模态事实核查基准,通过人机协同提取和审计流程,链接社交媒体帖子与推理轨迹及证据项,评估不同场景下的视觉 grounding 和证据利用能力。

Comments This submission was made in error. It was intended to replace the existing submission arXiv:2512.22933 rather than create a new submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22933 2026-05-13 cs.AI cs.CL 81%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post:可审计的证据导向多模态事实核查

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

机构 * School of Computing (SoC), National University of Singapore (NUS)(新加坡国立大学计算机学院(SoC)) National University of Singapore (NUS)(新加坡国立大学) Department of Electrical and Computer Engineering (ECE), National University of Singapore (NUS)(新加坡国立大学电子与计算机工程系(ECE))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 RW-Post提出一种可审计的多模态事实核查基准,通过人类事实核查文章提取证据,支持不同场景下的可控评估,提升视觉 grounding 和证据利用能力。

Comments Code and dataset will be released at https://github.com/xudanni0927/AgentFact

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12154 2026-05-13 cs.AI 79%

MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling

MM-OptBench:一种面向多模态优化建模的求解器导向基准

Zhong Li, Qi Huang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen, Zaiwen Wen, Lincen Yang

机构 * Great Bay University(大湾大学) Leiden University(莱顿大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院) Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MM-OptBench,一个基于求解器的多模态优化建模基准,通过文本和视觉信息生成数学模型和求解器代码,评估9种多模态大语言模型在不同难度实例上的表现,结果显示任务仍远未解决。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12031 2026-05-13 cs.LG cs.CV 79%

Resilient Vision-Tabular Multimodal Learning under Modality Missingness

在模态缺失下的视觉-表格多模态学习的鲁棒性

Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Research Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统研究单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与干预系,辐射物理,生物医学工程,乌梅大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态Transformer框架,用于在普遍存在模态缺失的情况下进行视觉-表格联合学习,通过可学习的模态标记和中间融合实现鲁棒的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09266 2026-05-13 cs.AI 79%

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

SeePhys Pro:多模态RLVR中模态迁移和盲训练效应的诊断

Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世人工智能中心) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 SeePhys Pro研究多模态RLVR中模态迁移对物理推理的影响,发现当前模型在信息从语言迁移到图像时表现下降,盲训练可提升性能,但依赖残余文本和分布特征而非有效视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11663 2026-05-13 cs.CL 79%

Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability

具有90万规模日本全国学业能力评估学生响应分布的多模态基准

Kyosuke Takami, Yuka Tateisi, Satoshi Sekine, Yusuke Miyao

机构 * Osaka Kyoiku University(大阪教养大学) University of Tokyo(东京大学) NII LLMC(日本国家信息与通信技术研究所大语言模型中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一个基于日本全国学业能力评估的多模态数据集,包含真实考试布局、图表和教育文本,用于评估多模态大语言模型的性能,通过精确匹配准确率和字符级F1分数分析不同学科间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24602 2026-05-13 eess.SP cs.AI 79%

MuViS: Multimodal Virtual Sensing Benchmark

MuViS:多模态虚拟感知基准

Jens U. Brandt, Noah C. Puetz, Jobel Jose George, Niharika Vinay Kumar, Elena Raponi, Marc Hilbert, Thomas Bäck, Thomas Bartz-Beielstein

机构 * TH Köln, Germany(TH Köln大学) Leiden University(莱顿大学) Toyota Racing(丰田赛车)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MuViS基准测试平台整合多种数据集,评估多模态虚拟感知方法,证明现有方法无统一优势,需发展通用架构。

Comments Accepted at European Signal Processing Conference (EUSIPCO) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11935 2026-05-13 cs.LG 78%

SurvBench: A Standardised Preprocessing Pipeline for Multi-Modal Electronic Health Record Survival Analysis

SurvBench:多模态电子健康记录生存分析标准化预处理流程

Munib Mesinovic, Tingting Zhu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 SurvBench提供标准化预处理流程,通过YAML配置实现多模态EHR数据的统一处理,支持四种关键数据库和输入模态,确保生存分析模型的可比性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11439 2026-05-13 cs.CV cs.LG 77%

Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

Instruct-ICL:基于指令的上下文学习用于灾后损害评估

Armin Zarbaft, Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出Instruct-ICL方法,通过指令引导的上下文学习提升预训练多模态大语言模型在灾后视觉问答中的可靠性,实验表明结合CoT推理能显著提高回答准确性。

Comments Accepted by the 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05269 2026-05-13 cs.CV 77%

B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding

B4DL:用于空间时间理解的4D激光雷达LLM基准

Changho Choi, Youngwoo Shin, Gyojin Han, Dong-Jae Lee, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出B4DL基准,用于训练和评估多模态大语言模型对4D激光雷达数据的理解,结合可扩展的数据生成管道和新模型,实现动态户外环境的空间时间推理。

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11727 2026-05-13 cs.AI cs.CL cs.CV 67%

Allegory of the Cave: Measurement-Grounded Vision-Language Learning

洞穴的寓言:基于测量的视觉-语言学习

Kepeng Xu, Li Xu, Gang He, Wenxin Yu

机构 * Xidian University(西电大学) Southwest University of Science and Technology(西南科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究了视觉-语言模型在更接近底层相机测量的视觉接口下,基于测量的视觉-语言学习是否能提升性能。PRISM-VL模型结合RAW数据、相机条件接地和曝光括号监督聚合,通过高质量数据集和基准测试,提升了BLEU、ROUGE-L和LLM-Judge的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10865 2026-05-13 cs.AI cs.CV cs.SE 62%

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

BenchCAD: 一个全面的、行业标准的程序化CAD基准测试

Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Rice University(莱斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BenchCAD通过视觉问答、代码问答、图像到代码生成和指令引导的代码编辑评估模型,发现当前系统在生成精确参数化CAD程序方面存在不足,需进一步改进工业应用能力。

Comments 9 page 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11680 2026-05-13 cs.CV 57%

ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes

ShapeCodeBench:一种可再生的基准,用于合成形状场景的感知到程序重建

Shivam Kumar

机构 * Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ShapeCodeBench是一个合成基准,用于测试从渲染图像生成可执行程序的能力。该基准包含不同难度层级的样本,评估了多种模型在精确匹配、像素精度和执行成功率上的表现。

Comments 14 pages, 5 figures, 2 tables. Code, data, and artifacts: https://github.com/shivamk3r/shape-code-bench ; archival release: https://doi.org/10.5281/zenodo.20132286

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11268 2026-05-13 cs.CR 50%

Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data

具有上下文意识的钓鱼攻击:通过公共社交媒体数据利用生成式AI对个人进行攻击

Elham Pourabbas Vafa, Sayak Saha Roy, Shirin Nilizadeh

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文研究了如何利用公开社交媒体数据和生成式AI自动化并扩大针对个人的个性化、上下文感知的钓鱼攻击。通过模块化框架结合多模态信号提取、沟通风格分析和攻击类型实例化,展示了七种攻击策略,并通过大规模多模型评估验证了生成式AI邮件在个性化、上下文相关性和说服力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏