arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 595 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 595 篇

2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 91%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 91%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11738 2026-08-13 cs.CV cs.AI 新提交 91%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02897 2026-07-07 cs.CR cs.AI cs.CV 新提交 91%

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments 17 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26595 2026-07-30 cs.CV 新提交 91%

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

SpatialQ:基于视觉的多模态大语言模型(MLLM)理解3D Gaussian Splatting场景质量

Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Fuzhou University(福州大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 针对3DGS场景质量评估的局限,本文提出SpatialQ框架,通过VGGT编码器与Qwen-MLLM实现结构感知的多模态质量评估,解决传统IQA仅依赖2D线索的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21061 2026-07-24 cs.CV 新提交 91%

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商

Daiqing Wu, Dongbao Yang, Jiashu Yao, Hongrui Zhang, Can Ma, Yu Zhou, Sicheng Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 90%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract)

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26432 2026-07-30 cs.CV cs.AI 新提交 90%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 多模态评测 :MLLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16514 2026-07-21 cs.CV cs.AI 新提交 89%

Geometry-Enhanced Portion Estimation for Multimodal LLMs

用于多模态大语言模型的几何增强部分估计

Lin Liao, Peng Li

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型部分估计弱的问题,提出用精确部分头部增强冻结商业MLLM的方法,该头部基于DINOv2主干构建,无需深度传感器和微调,在三个基准测试中降低部分误差,优于旗舰MLLM及原图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01258 2026-08-04 cs.CV 新提交 89%

A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2

多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2

Zirui Zhang, Yinbo Yu, Donghai Guan, Chunwei Tian, Daoqiang Zhang, Qi Zhu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 多模态评测 :MLLM(title,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00125 2026-07-02 cs.CV 新提交 89%

Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

分解、比较与决策:多模态大语言模型是隐式少样本学习者

Yunhan Wang, Eshika Khandelwal, Edson Araujo, Walid Bousselham, Nina Shvetsova, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根大学图宾根人工智能中心)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 提出DeCoDe方法,通过将少样本分类分解为成对图像比较,利用现有多模态大语言模型(MLLM)的logit作为相似度分数,无需额外训练即可实现强少样本分类,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04034 2026-08-06 cs.CR 新提交 88%

A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination

基于原子越狱策略解耦与组合的多模态自动红队评估

Shiji Zhao, Yuxuan Zhou, Chen Xiong, Dongxian Wu, Yang Bai, Xun Chen

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);image-text(abstract)

AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16682 2026-06-29 cs.LG cs.CL 新提交 88%

Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

多模态评估者偏好坍缩:自进化智能体中的跨模态传染

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL

AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21455 2026-07-24 cs.NI 新提交 88%

Out-of-Distribution Detection in Wireless Multimodal Foundation Models for 6G ISAC

6G智能感知与通信无线多模态基础模型中的分布外检测

Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract)

AI总结 研究6G智能感知与通信中无线多模态基础模型的分布外检测问题,提出WMFM - OOD框架,通过构建基站原型和温度缩放概率评分机制区分异常,在DeepVerse6G数据集验证,显著优于基线,提升检测灵敏度,保障网络可靠性。

Comments presented at IEEE VTC 2026 Fall, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09281 2026-08-11 cs.AI 新提交 87%

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

MMArch:基于建筑证据的多模态推理基准测试

Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 87%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn);分类 cs.CV

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01849 2026-08-04 cs.AI 新提交 87%

Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models

探索与弥合未学习多模态大语言模型中的知识缺口

Junxiang You, Junkai Chen, Yuhao He, Ruiqi Liu, Zhetao Guo, Shu Wu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对未学习多模态大语言模型存在的知识缺口问题,提出带锚定正则化的选择性保护方法,在保障未学习安全性的同时大幅恢复模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27667 2026-07-31 cs.CV 新提交 87%

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

证据见证组合:针对闭集多模态答案的单预填充风险检测

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。

Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24957 2026-07-29 cs.CV 新提交 87%

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

感知基准:评估多模态大语言模型中的原子视觉感知

Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

机构 * Moonshot AI(登月人工智能)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08839 2026-07-13 cs.CV cs.LG 新提交 87%

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

混合探针:通过探针在多模态大语言模型中从特权模态学习

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.CV

AI总结 研究多模态大语言模型在特权模态设置下的问题,提出混合探针(MoP)框架及MoP跨模态训练(MoP-X),通过结构化探测机制分离模态信号,经评估在多任务中优于基线,有效利用辅助模态训练可提升性能。

Comments Preprint (16 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06538 2026-06-08 cs.CV 新提交 87%

WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

WorldBench: 一个具有挑战性且视觉多样的多模态推理基准

Yida Yin, Harish Krishnakumar, Chung Peng Lee, Boya Zeng, Wenhao Chai, Shengbang Tong, Wenhu Chen, Hu Xu, Xingyu Fu, Gabriel Sarch, Aleksandra Korolova, Zhuang Liu

机构 * Princeton University(普林斯顿大学) NYU(纽约大学) University of Waterloo(滑铁卢大学) Meta, FAIR(Meta和FAIR)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出WorldBench,通过构建多领域视觉概念分类法并收集多样化图像,设计前沿MLLM难以回答的问题,以评估多模态大语言模型的视觉理解能力,揭示其弱点。

Comments Project page: https://worldbench-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05560 2026-08-07 cs.CV cs.CL 新提交 87%

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 多模态评测 :MLLM(title_cn,summary_cn);分类 cs.CV、cs.CL

AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。

Comments Preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 87%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CL、cs.AI

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03644 2026-07-07 cs.CV cs.AI 新提交 87%

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

月光石:用于月球遥感的多模态基础模型及基准

Ayush Prasad, Swarnalee Mazumder

机构 * Space and Earth Observation Centre, Finnish Meteorological Institute(芬兰气象研究所空间与地球观测中心) German Climate Computing Centre(德国气候计算中心)

专题命中 多模态评测 :multimodal(title);multimodal foundation model(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对月球多模态遥感数据分散且无评估机器学习基准的问题,引入月光石基准。贡献包括构建全球月球预训练数据集,提出MG-MAE模型,创建涵盖多任务的基准,其预训练特征在各任务中表现出色。

Comments Accepted for publication in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15743 2026-06-16 cs.LG 新提交 87%

Unsupervised Learning for Missing Modalities in Multimodal Learning

多模态学习中缺失模态的无监督学习

Hassan Ismkhan, Hamid Bouchahcia

机构 * Bournemouth University(伯恩茅斯大学)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 提出UL4M4框架,通过无监督聚类和迭代插补处理任意缺失模态,实现跨模态结构保持和尺度不变性,在超过50%模态缺失时仍稳定达到F1-Micro>0.7。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 87%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-14 cs.CV 新提交 86%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 86%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-06 cs.CV cs.CL 新提交 86%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏