MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
专题命中 多模态评测 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICML 2024 (Oral)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICML 2024 (Oral)
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL、cs.AI
多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2
机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) ; College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
专题命中 多模态评测 :MLLM(title,summary_cn);multimodal(abstract);分类 cs.CV
AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。
模拟有效性:在MLLM生成的科学图表反馈中的模态解耦
机构 * University of Georgia, AI4STEM Education Center(佐治亚大学AI4STEM教育中心) ; Gazi University, Department of Mathematics and Science Education(加齐大学数学与科学教育系)
专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI
AI总结 研究探讨了多模态大语言模型生成的科学图表反馈中模态解耦问题,发现反馈常存在 grounding 失败,表明需超越常规提示策略的 grounding 机制。
Comments Accepted as AIED Short Paper 2026, Seoul, South Korea. Submission #1147. This is the long paper version
分解、比较与决策:多模态大语言模型是隐式少样本学习者
机构 * Tuebingen AI Center, University of Tuebingen(图宾根大学图宾根人工智能中心)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV
AI总结 提出DeCoDe方法,通过将少样本分类分解为成对图像比较,利用现有多模态大语言模型(MLLM)的logit作为相似度分数,无需额外训练即可实现强少样本分类,在多个基准上显著超越现有方法。
BusterX:基于MLLM的AI生成视频伪造检测与解释
机构 * University of Liverpool, UK(利物浦大学) ; Nanyang Technological University, SG(南洋理工大学) ; The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)) ; Wuhan University(武汉大学) ; Hangzhou Dianzi University(杭州电子科技大学)
专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出BusterX,一种基于多模态大语言模型的视频伪造检测系统,通过改进数据集和评估基准,提升检测准确性和解释质量。
认知:从评估到对抗多模态大语言模型CAPTCHA求解器
机构 * Missouri University of Science and Technology(密苏里科技大学) ; University of South Florida(佛罗里达州立大学) ; Visa Inc.(Visa公司) ; George Mason University(乔治·马歇尔大学)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI
AI总结 本文研究多模态大语言模型如何削弱视觉CAPTCHA的安全性,评估7种主流MLLM在18种CAPTCHA任务中的表现,揭示其解决能力及防御策略。
Comments Accepted by USENIX Sec'26
多模态大语言模型感知情感
机构 * Universidade Tecnológica Federal do Paraná(联邦技术大学帕拉纳州大学) ; University of Toronto(多伦多大学)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV
AI总结 本文通过系统评估研究,探讨多模态大语言模型在图像情感分析中的三种方法,发现基于MLLM描述的两阶段流水线在微调后性能显著优于传统基线。
Comments 24 pages, 7 figures
超越文本的衡量:通过质量、对齐和多样性评估多模态摘要
机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);image-text(abstract)
AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。
Comments Accepted to Findings of ACL 2026
Meow-Omni 1:用于猫类行为学的多模态大语言模型
机构 * University College London(伦敦大学学院) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);omni-modal(abstract)
AI总结 Meow-Omni 1通过融合视频、音频和生理时间序列数据,实现对动物意图的精准识别,其在MeowBench基准测试中达到71.16%的准确率,推动了跨物种意图理解及基础模型在兽医诊断和野生动物保护中的应用。
SCAM:多模态基础模型的现实世界字形鲁棒性评估
机构 * BLISS e.V.(BLISS协会) ; Berliner Hochschule für Technik (BHT)(柏林技术大学) ; Technische Universität Berlin(柏林技术大学) ; KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) ; Merantix Momentum(Merantix Momentum公司) ; Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。
Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2
Journal ref Journal of Data-centric Machine Learning Research (2026)
跨模态映射与双分支重建用于2D-3D多模态工业异常检测
机构 * CNR-ISASI, Institute of Applied Sciences and Intelligent Systems / National Research Council of Italy(CNR-ISASI应用科学与智能系统研究所/意大利国家研究理事会) ; CNR-STIIMA, Institute of Intelligent Industrial Technologies and Systems for Advanced Manufacturing(CNR-STIIMA智能工业技术与系统先进制造研究所) ; Institute d'Electronique de Microelectronique et de Nanotechnologie (IEMN) / Universite Polytechnique Hauts de France(微电子与纳米技术研究所(IEMN)/法国高等法国理工学院)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 CMDR-IAD通过跨模态映射与双分支重建实现2D-3D多模态工业异常检测,具有轻量、模态灵活和高鲁棒性的特点。
GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型
机构 * Univ City(大学城市)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。
Journal ref Communications in Transportation Research 4 (2024) 100116
Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) ; Stony Brook University(石溪大学) ; Brookhaven National Laboratory(布鲁赫斯国家实验室)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CL、cs.AI
AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。
Comments 34 pages, 18 figures
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL
Comments ACL 2025 Findings
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL、cs.AI
Journal ref Multimedia Systems 31, 4 (2025)
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CL、cs.AI
Comments ICLR 2025
专题命中 多模态评测 :multi-modal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.AI
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL、cs.AI
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL、cs.MM
Comments Accepted by IEEE Transactions on Multimedia (TMM)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.CL
Journal ref Published in EMNLP 2020
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV;MLLM(comments)
Comments Code and Model: https://github.com/Fancy-MLLM/R1-onevision
基于原子越狱策略解耦与组合的多模态自动红队评估
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);image-text(abstract)
AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。
R1-SyntheticVL:生成模型的合成数据是否已为多模态大语言模型做好准备?
机构 * Hong Kong Polytechnic University(香港理工大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 提出集体对抗数据合成(CADS)方法,通过集体智能和对抗学习自动生成高质量、多样且具有挑战性的多模态数据,用于增强多模态大语言模型(MLLM)在复杂现实任务中的性能。
Comments ICML 2026 Camera Ready
多模态评估者偏好坍缩:自进化智能体中的跨模态传染
机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL
AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。
Comments 17 pages, 0 figures
WildTableBench:在真实场景中评估多模态基础模型的表格理解能力
机构 * The University of Queensland(昆士兰大学) ; Stanford University(斯坦福大学) ; The Australian National University(澳大利亚国立大学) ; Zhejiang University(浙江大学) ; Murdoch University(莫纳什大学) ; The University of Adelaide(阿德莱德大学)
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV
AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。
通过InterSHAP量化多模态胶质瘤生存预测中的跨模态交互:证据显示信号整合是加性的
机构 * Department of Computer Science, Munster Technological University, Cork, Ireland(莫斯堡技术大学计算机科学系,爱尔兰科克)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI
AI总结 本文通过InterSHAP评估多模态深度学习在胶质瘤生存预测中的跨模态交互,发现性能提升源于互补信号聚合而非协同效应,为模型审计和联邦学习提供新视角。
Comments 8 pages, 1 figure, under review at XAI 2026 LBW
CAGMamba:基于上下文的门控跨模态Mamba网络用于多模态情感分析
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Xingning Power Supply Bureau, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司兴宁供电局)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL
AI总结 本文提出CAGMamba网络,通过门控机制实现跨模态信息融合,有效建模上下文依赖和情感演变,实验表明在多模态情感分析任务中表现优异。
MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进
机构 * National University of Defense Technology(国防科技大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) ; Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) ; National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.AI
AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。
MultiSHAP: 一种基于Shapley的框架,用于解释多模态AI模型中的跨模态交互
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI
AI总结 MultiSHAP是一种基于Shapley的框架,用于解释多模态AI模型中跨模态交互的可解释性方法,能够提供实例和数据集级别的解释,揭示模型预测的协同效应和跨模态整合机制。