arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2605.12034 2026-05-15 cs.MM cs.AI cs.CV 85%

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

提升多模态语言模型:带有视觉偏见评估的分阶段训练

Che Liu, Lichao Ma, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Xuerui Yang, Fei Tian

机构 * StepFun-Audio Team(StepFun-Audio团队)

专题命中 多模态评测 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。

Comments Project page: https://cheliu-computation.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 82%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15128 2026-05-15 cs.CV cs.CL cs.IR 81%

MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

MemEye:一种以视觉为中心的多模态代理记忆评估框架

Minghao Guo, Qingyue Jiao, Zeru Shi, Yihao Quan, Boxuan Zhang, Danrui Li, Liwei Che, Wujiang Xu, Shilong Liu, Zirui Liu, Mubbasir Kapadia, Vladimir Pavlovic, Jiang Liu, Mengdi Wang, Yiyu Shi, Dimitris N. Metaxas, Ruixiang Tang

机构 * Rutgers(罗格斯大学) Notre Dame(圣母大学) Princeton(普林斯顿大学) UMN(明尼苏达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MemEye框架从视觉证据的粒度和证据使用的复杂性两个维度评估多模态代理记忆,通过8个生活场景任务构建新基准,验证记忆方法在细粒度视觉细节保留和时间状态推理上的不足。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14635 2026-05-15 cs.CV cs.AI 81%

MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models

MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型

Tianwei Chen, Takuya Furusawa, Yuki Hirakawa, Ryotaro Shimizu, Mo Fan, Takashi Wada

机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10550 2026-05-15 cs.CL 79%

Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy

多领域多模态文档分类基准与多级分类法

Denghao Ma, Qing Liu, Zulong Chen, Chuanfei Xu, Jia Xu, Zhibo Yang, Wei Shao, Zhao Li

机构 * Beijing Information Science and Technology University(北京信息科学与技术大学) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Guangzhou University(广州大学) Zhejiang Lab(浙江实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL

AI总结 本文提出首个多级多领域多模态文档分类基准MMMBench,包含五级多级分类体系和12个商业领域的5990个真实多模态文档,通过系统实验识别出四个核心挑战并提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02920 2026-05-15 cs.LG cs.CV cs.SI 79%

Learning Multimodal Embeddings for Traffic Accident Prediction and Causal Estimation

学习多模态嵌入用于交通事故预测和因果估计

Ziniu Zhang, Minxuan Duan, Haris N. Koutsopoulos, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过结合道路网络数据与卫星图像,提出多模态学习方法,提升交通事故预测精度,并发现降水、高速道路和季节因素对事故率的影响。

Comments 17 pages. Appeared in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL 79%

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03519 2026-05-15 cs.LG 67%

Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment

重新审视模型反向评估:从误导性标准到可靠的隐私评估

Sy-Tuyen Ho, Koh Jun Hao, Ngoc-Bao Nguyen, Alexander Binder, Ngai-Man Cheung

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 多模态评测 :MLLM(abstract,abstract_cn)

AI总结 本文重新审视模型反向攻击的评估框架,揭示其存在虚假正例问题,并提出基于大规模语言模型的新评估方法以提升隐私评估的可靠性。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15016 2026-05-15 cs.CL cs.AI 62%

COTCAgent: Preventive Consultation via Probabilistic Chain-of-Thought Completion

COTCAgent:通过概率性思维链完成实现预防性咨询

Zihan Deng, Xiaozhen Zhong, Chuanzhi Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(中国电子科学与技术大学深圳高级研究所) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出COTCAgent框架,通过概率性思维链完成实现纵向电子健康记录的预防性咨询,解决了现有大语言模型在纵向EHR推理中的统计学推理不足和时间序列依赖性捕捉困难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25855 2026-05-15 cs.CV cs.AI 62%

SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring

SIEVES:通过视觉证据评分实现选择性预测

Hector G. Rodriguez, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 62%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14399 2026-05-15 cs.CV cs.GR 57%

SceneForge: Structured World Supervision from 3D Interventions

SceneForge: 从3D干预中获取结构化世界监督

Jizhizi Li, Jiayang Ao, Danny Wicks, Petru-Daniel Tudosiu

机构 * Canva Research(Canva研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SceneForge通过生成可编辑3D世界状态的结构化监督,提升多模态学习中干预一致性。其利用显式干预和场景依赖传播,生成对齐的输出,如反事实观察和阴影反射信号,覆盖单视图和多视图场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06226 2026-05-15 cs.AI 57%

GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines

GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准

Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 GeoLaux通过2186道计算与证明题,评估23个领先MLLMs在长步骤推理和辅助线构造上的表现,揭示模型在长步骤问题上性能显著下降,强调提升辅助线理解的重要性,并发现有限答案提示能提高过程正确性。

Comments 26 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-05-15 cs.CL 57%

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22197 2026-05-15 cs.LG cs.AI eess.SP 57%

Neural Signals Generate Clinical Notes in the Wild

神经信号在真实环境中生成临床笔记

Jathurshan Pradeepkumar, Zheng Chen, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SANKEN, Osaka University(大阪大学SANKEN)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CELM模型,首个能从长期EEG记录中生成多尺度临床报告的EEG-语言基础模型,通过整合预训练EEG模型与语言模型,实现了可扩展的多模态学习,实验表明其在多个评估设置中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14186 2026-05-15 cs.LG 50%

LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling

Qi Cao, Yufan Wang, Peijia Qin, Shuhao Zhang, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态评测 :multimodal(abstract)

AI总结 大型语言模型(LLMs)在解决问题前后能够产生自我监控信号,如对自身能否成功解决问题的预判以及对答案正确性的后验判断,但这些信号通常未被用于控制推理过程。本文提出一种元认知控制框架,基于认知心理学中的纳尔逊-纳雷恩斯理论,将监控与推理分离,使模型在推理过程中根据预判和后验判断动态决定是否信任当前结果、是否重试或汇总多轮结果。实验表明,该框架无需参数更新或特定任务微调,即可显著提升基础模型在文本、代码和多模态任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14142 2026-05-15 stat.ML cs.LG stat.CO 50%

To discretize continually: Mean shift interacting particle systems for Bayesian inference

持续离散化:用于贝叶斯推断的均值偏移交互粒子系统

Ayoub Belhadji, Daniel Sharp, Youssef M. Marzouk

机构 * Center for Computational Science and Engineering(计算科学中心) Laboratory for Information and Decision Systems(信息与决策系统实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出基于均值偏移交互粒子系统的新型方法,用于近似概率分布的积分,该方法通过最小化最大均差来构建权重样本,适用于连续分布的贝叶斯推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13871 2026-05-15 cs.NE cs.LG 50%

Indian Wedding System Optimization (IWSO): A Novel Socially Inspired Metaheuristic with Operational Design and Analysis

印度婚礼系统优化(IWSO):一种受社会文化动态启发的新型元启发式算法及其操作设计与分析

Deepika Saxena, Kishu Gupta, Jitendra Kumar, Jatinder Kumar, Sakshi Patni, Vinaytosh Mishra, Niharika Singh, Ashutosh Kumar Singh

机构 * Department of Computer Science, the VIZJA University, Warsaw, 01-043, Poland(VIZJA大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种基于群体的元启发式算法IWSO,受印度传统婚礼的社会文化动态启发,通过家庭、候选人和牵线人的协作模拟匹配过程,采用匹配师引导影响策略和自适应淘汰重初始化机制,提升收敛性与多样性,实验表明其在高维多模态函数上的收敛速度、解质量及鲁棒性优于GA、PSO、DE等算法。

详情

展开后加载摘要…

URL PDF HTML 收藏