arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-11 至 2026-05-11 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 26 篇

2604.19697 2026-05-11 cs.CV 85%

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18744 2026-05-11 cs.AI cs.LG 83%

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench: 一个全面的多任务多模态时间序列推理基准,用于通用模型

Fangxu Yu, Xingang Guo, Lingzhi Yuan, Haoqiang Kang, Hongyu Zhao, Lianhui Qin, Furong Huang, Bin Hu, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 TSRBench通过4125个问题和15个任务评估通用模型的时间序列推理能力,揭示了感知和推理中的缩放定律失效以及多模态融合的不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06894 2026-05-11 cs.CR cs.LG 82%

McNdroid: A Longitudinal Multimodal Benchmark for Robust Drift Detection in Android Malware

McNdroid:用于Android恶意软件鲁棒漂移检测的纵向多模态基准

Md Mahmuduzzaman Kamol, Jesus Lopez, Saeefa Rubaiyet Nowmi, Emilia Rivas, Md Ahsanul Haque, Edward Raff, Aritran Piplai, Mohammad Saidur Rahman

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系) CrowdStrike

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 McNdroid是首个大规模纵向多模态Android恶意软件基准,通过静态、动态和图谱特征分析,评估不同训练-测试时间间隔下的ML和深度学习检测器性能,揭示多模态融合在长期时间间隔中的优势。

Comments 28 pages, 14 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07640 2026-05-11 cs.CV cs.AI 81%

LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

LithoBench:用于遥感岩石学解释的大型多模态模型基准测试

Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han

机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机学院) PRADA Lab, King Abdullah University of Science and Technology(科廷大学PRADA实验室) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LithoBench,一个用于评估遥感岩石学解释中地质语义理解的多级基准,包含10000个专家标注实例,涵盖12种岩石类型,通过专家反馈的半自动化流程提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03454 2026-05-11 cs.CV cs.AI 81%

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15204 2026-05-11 cs.CV cs.AI 81%

Physics-Based Benchmarking Metrics for Multimodal Synthetic Images

基于物理的多模态合成图像基准度量指标

Kishor Datta Gupta, Marufa Kamal, Md. Mahfuzur Rahman, Fahad Rahman, Mohd Ariful Haque, Sunzida Siddique

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07561 2026-05-11 cs.CV 79%

Multimodal Stepwise Clinically-Guided Attention Learning for Pathological Complete Response Prediction in Breast Cancer

多模态逐步临床引导注意力学习用于乳腺癌病理完全响应预测

Alice Natalina Caragliano, Valerio Guarrasi, Michela Gravina, Carlo Sansone, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Electrical Engineering and Information Technology, University of Naples Federico II(电气工程与信息科技系,那不勒斯费德里科二世大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态逐步临床引导注意力学习框架,通过医学引导的空间指导和多模态整合,提升乳腺MRI中病理完全响应预测的敏感性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07488 2026-05-11 cs.AI cs.LG 79%

Efficient Data Selection for Multimodal Models via Incremental Optimization Utility

通过增量优化效用实现多模态模型的数据选择效率

Jinhao Jing, Qiannian Zhao, Chao Huang, Zhan Su

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出OST框架,将数据选择转化为增量优化效用排名问题,通过轻量代理模拟单步更新估算样本边际效用,实验证明在减少训练成本的同时提升性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06728 2026-05-11 q-bio.GN cs.AI q-bio.CB 79%

OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

OmicsLM:一种多模态大语言模型用于多样本组学推理

Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński, Remigiusz Kinas, Przemysław Pietrzak, Tomasz Jetka, Rafał Powalski

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 OmicsLM通过整合定量组学数据与自然语言任务,实现多样本组学推理,其在多任务类型上表现优异,尤其在生物语言指导的推理任务中超越专用模型和通用LLM。

Comments 13 pages (main text), 14 pages (appendix), 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02206 2026-05-11 cs.CV cs.LG 79%

Metric Unreliability in Multimodal Machine Unlearning: A Systematic Analysis and Principled Unified Score

多模态机器去学习中的度量不可靠性:系统分析与原则统一分数

Abdullah Ahmad Khan, Hamid Laga, Ferdous Sohel

机构 * Murdoch University(墨尔本大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文系统分析了多模态去学习中度量可靠性问题,提出统一质量评分(UQS)以解决不同度量标准间的冲突,通过实验验证了UQS在稳定排序方面的有效性。

Comments 9 Pages , 6 figures, Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 79%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15884 2026-05-11 cs.CV 79%

Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching

Contrast-X:一个多模态对比图像合成基准及通用模态流匹配

Yifan Chen, Fei Yin, Hao Chen, Jia Wu, Chao Li

机构 * University of Cambridge(剑桥大学) MD Anderson Cancer Center(MD安德森癌症中心) University of Dundee(邓迪大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 Contrast-X通过多器官CT和乳腺DCE-MRI数据,提出FlowMI模型解决多模态缺失问题,评估合成图像质量及跨器官泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07141 2026-05-11 cs.CV cs.AI 79%

Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding

Qwen3-VL-Seg: 解锁基于视觉-语言接地的开放世界指代分割

Yuan Yao, Qiushi Yang, Humen Zhong, Jiangning Wei, Yifang Men, Shuai Bai, Miaomiao Cui, Zhibo Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Qwen3-VL-Seg通过视觉-语言接地框架实现开放世界指代分割,采用轻量级的框引导掩码解码器,结合多尺度空间特征注入和迭代掩码感知查询优化,实现参数高效且精确的像素级分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06952 2026-05-11 cs.AR 78%

EDA-Schema-V2: A Multimodal Schema, Open Datasets, and Benchmarks for Machine Learning in Digital Physical Design

EDA-Schema-V2:一种多模态架构,开放数据集和机器学习在数字物理设计中的基准测试

Pratik Shrestha, Alec Aversa, Ioannis Savidis

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出EDA-Schema-V2,一种多模态架构,通过生成和分析开放数据集,为数字物理设计中的机器学习提供标准化框架和基准测试,提升研究的可重复性和可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24789 2026-05-11 cs.LG stat.ML 78%

Fidel-TS: A High-Fidelity Multimodal Benchmark for Time Series Forecasting

Fidel-TS:一种高保真多模态时间序列预测基准

Zhijian Xu, Wanxu Cai, Xilin Dai, Zhaorong Deng, Qiang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学) School of Software(软件学院) Tsinghua University(清华大学) ZJU-UIUC Institute(浙大-UIUC研究院) Zhejiang University(浙江大学) School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen(深圳香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出Fidel-TS,一种高保真多模态时间序列预测基准,解决现有基准数据源不纯、泄露问题及结构不清晰的问题,通过实验揭示现有基准的局限性和模型评估中的潜在差异。

Comments new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07477 2026-05-11 cs.CV 77%

ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

ReasonEdit:通过强化学习实现可解释图像编辑评估

Honghua Chen, Zitong Xu, Huiyu Duan, Xinyun Zhang, Xiongkuo Min, Guangtao Zhai

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出ReasonEdit,通过引入ReasonEdit-22K数据集和RE-Reward模型,训练出可解释的图像编辑评估模型,提升评估的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06115 2026-05-11 cs.AI 77%

CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs

CrossCult-KIBench:一种用于多模态大语言模型跨文化知识插入的基准测试

Zhen Zeng, Leijiang Gu, Feng Li, Jing Yu, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理国家重点实验室,中央民族大学) School of Information Engineering, Minzu University of China(中央民族大学信息工程学院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出CrossCult-KIBench基准测试,用于评估跨文化知识插入的有效性及非目标文化的影响,通过9800个图像场景测试不同语言文化的适应性,提出MCKI方法并揭示了当前模型在文化适应与行为保持间的平衡难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07439 2026-05-11 q-bio.BM 71%

CA-DEL: An Open Multi-Target, Multi-Modal Benchmark for Learning from DNA-Encoded Library Screens

CA-DEL:一个开放的多目标、多模态基准,用于从DNA编码库筛选中学习

Mutian He, Hanqun Cao, Cheng Tan, Zijun Gao, Xiaojun Yao, Chunbin Gu, Pheng-Ann Heng

专题命中 多模态评测 :multi-modal(title)

AI总结 CA-DEL通过整合实验确定的结合亲和力,为学习DNA编码库筛选中的选择性挑战提供多维公共基准,解决数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07760 2026-05-11 cs.AI 70%

RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation

RuleSafe-VL:评估视觉-语言内容审核中的规则条件决策推理

Zhifeng Lu, Dianyuan Wang, Yuhu Shang, Zhenbo Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 RuleSafe-VL通过构建93个基本规则和92种规则关系,评估视觉-语言内容审核中规则条件决策推理的诊断能力,发现规则关系恢复是主要瓶颈,最佳模型仅达到64.8 Macro-F1。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07149 2026-05-11 cs.CV 70%

Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection

Real-IAD MVN:一种多视角法向量数据集和基准,用于高保真工业异常检测

Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng

机构 * Fudan University(复旦大学) Shanghai Ocean University(上海海洋大学) Donghua University(东华大学) Rongcheer Co., Ltd.(荣驰科技有限公司)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Real-IAD-MVN数据集,通过多视角法向量捕捉微细几何缺陷,验证密集多视角伪3D数据在工业异常检测中的优越性能。

Comments Accepted to CVPR 2025. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06815 2026-05-11 cs.AI cs.CV 62%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07338 2026-05-11 cs.CV 57%

ShellfishNet: A Domain-Specific Benchmark for Visual Recognition of Marine Molluscs

ShellfishNet:面向海洋软体动物视觉识别的领域专用基准数据集

Ziheng Zhou, Yang Wang, Nan Wang, Chengliang Wu, Jun Yan

机构 * IT College, Shanghai Ocean University(上海海洋大学信息学院) Fudan University(复旦大学) DP Technology(DP技术)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文构建了ShellfishNet数据集,包含8691张图像,用于评估视觉模型在真实环境下的泛化能力,测试了80种神经网络模型及多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07178 2026-05-11 cs.CV 57%

Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection

掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测

Kai Zheng, Hang-Cheng Dong, Jiatong Pan, Zhenkai Wu, Fupeng Wei, Wei Zhang

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) North China University of Water Resources and Electric Power(华北水利水电大学) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 57%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15356 2026-05-11 eess.IV cs.AI 57%

Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing

Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率

Xiang Li, Xueheng Li, Yu Wang, Xuanhua He, Zhangchi Hu, Weiwei Yu, Chengjun Xie

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06863 2026-05-11 cs.RO cs.HC 50%

Bi3: A Biplatform, Bicultural, Biperson Dataset for Social Robot Navigation

Bi3:一个双平台、双文化、双人数据集用于社交机器人导航

Andrew Stratton, Phani Teja Singamaneni, Pranav Goyal, Rachid Alami, Christoforos Mavrogiannis

机构 * Department of Robotics, University of Michigan(机器人系,密歇根大学) LAAS-CNRS, University of Toulouse(LAAS-CNRS,图卢兹大学) INRIA, University of Lorraine(INRIA,洛林大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 Bi3数据集通过双平台、双文化、双人交互,为社交机器人导航提供多样性模型复杂性的基准,用于研究人类与机器人在受限环境中的协同活动。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏