arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9087 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9087 篇

2603.26859 2026-03-31 cs.CV cs.AI eess.IV 84%

Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation

超越文本知识的多模态知识库用于增强视觉-语言导航

Dongsheng Yang, Yinfeng Yu, Liejun Wang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语言认知计算联合国际研究实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BTK框架,通过整合环境特定文本知识与生成图像知识库,提升视觉-语言导航中的语义 grounding 和跨模态对齐,实验表明在R2R和REVERIE数据集上性能显著提升。

Comments Main paper (37 pages). Accepted for publication by the Information Processing and Management,Volume 63,Issue 6,September 2026,104766

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16629 2026-03-30 cs.CV cs.AI 84%

MLLM-based Textual Explanations for Face Comparison

基于MLLM的文本解释用于面部比较

Redwan Sony, Anil K Jain, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了MLLM在无约束面部验证任务中生成解释的可靠性,发现其解释常依赖不可验证的面部属性,并提出基于似然比的框架评估解释可信度。

Comments Accepted at 14th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19516 2026-03-27 cs.CV cs.AI 84%

Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis

Gastric-X:一种多模态多阶段基准数据集,用于推进胃癌分析中的视觉-语言模型

Sheng Lu, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Yuanzhe Li

机构 * Ruijin Hospital(瑞金医院) University of Cambridge(剑桥大学) Nanjing First Hospital(南京市第一医院) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Gastric-X通过1700例胃癌病例数据,评估视觉-语言模型在胃癌诊断中的多阶段任务能力,推动医疗领域VLM发展。

Comments Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21597 2026-03-25 cs.AI cs.CV 84%

Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment

Cerebra:一个多学科AI平台用于多模态痴呆症特征化和风险评估

Sheng Liu, Long Chen, Zeyun Zhao, Qinglin Gou, Qingyue Wei, Arjun Masurkar, Kevin M. Spiegler, Philip Kuball, Stefania C. Bray, Megan Bernath, Deanna R. Willis, Jiang Bian, Lei Xing, Eric Topol, Kyunghyun Cho, Yu Huang, Ruogu Fang, Narges Razavian, James Zou

机构 * Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科) Center for Data Science, New York University(纽约大学数据科学中心) J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学杰·克雷顿·普瑞特家庭生物医学工程系) Department of Biomedical Engineering and Informatics, Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校生物医学工程与信息学系) Department of Neurology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科) Department of Neuroscience, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科学系) UF Health Family Medicine – Haile Plantation(佛罗里达大学健康家庭医学-海莱种植园) Department of Family Medicine, Indiana University School of Medicine(印第安纳大学医学院家庭医学系) Department of Biostatistics and Health Data Science, Indiana University School of Medicine(印第安纳大学医学院生物统计学与健康数据科学系) Scripps Research Translational Institute(斯克里普斯研究转化研究所) Courant Institute, New York University(纽约大学柯朗研究所) Center for Biomedical Informatics, Regenstrief Institute(再生斯蒂夫研究所生物医学信息中心) Center for Cognitive Aging and Memory, McKnight Brain Institute, University of Florida(佛罗里达大学麦金托神经研究所认知衰老与记忆中心) Population Health Department, NYU Langone Health(纽约大学兰戈恩健康人口健康部) Radiology Department, NYU Langone Health(纽约大学兰戈恩健康放射科)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 Cerebra通过多智能体协调处理电子病历、临床笔记和医学影像,提供可视化分析和对话界面,提升临床决策支持的可解释性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18611 2026-03-20 cs.CL cs.CV 84%

Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Media

跨模态推理迁移用于社交媒体上可解释的人道主义分类

Thi Huyen Nguyen, Koustav Rudra, Wolfgang Nejdl

机构 * L3S Research Center \ University Hannover Hannover Germany Indian Institute of Technology Kharagpur Kharagpur India L3S Research Center\ University Hannover Hannover Germany L3S Research Center \ University Hannover Indian Institute of Technology Kharagpur L3S Research Center\ University Hannover

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种跨模态推理迁移框架,通过文本和图像联合表示提取文本和图像推理,提升人道主义分类的可解释性,实验表明在CrisisMMD数据集上宏F1提升2-35%,并在零样本模式下达到80%的准确率。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17173 2026-03-19 cs.CV cs.AI 84%

Generalist Multimodal LLMs Gain Biometric Expertise via Human Salience

通用多模态大语言模型通过人类显著性获得生物特征专家能力

Jacob Piland, Byron Dowling, Christopher Sweet, Adam Czajka

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究通用多模态大语言模型在隐私约束下通过人类显著性信息实现虹膜攻击检测的可行性,实验表明其在虹膜攻击检测中优于传统CNN模型和人工评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16934 2026-03-19 cs.CV cs.AI 84%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 84%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13238 2026-03-17 cs.CV cs.CL 84%

KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR

KazakhOCR: 一种用于评估多模态模型在低资源库尔德语手写体OCR中的合成基准

Henry Gagnier, Sophie Gagnier, Ashwin Kirubakaran

机构 * Pittsford Sutherland High School(皮茨福德萨瑟兰高中) Edison Academy Magnet School(埃德ison学院磁性学校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文构建了包含7219张图像的合成OCR数据集,用于评估多模态大语言模型在低资源库尔德语手写体OCR和语言识别中的性能,发现传统OCR在字符错误率上优于MLLMs。

Comments Accepted to AbjadNLP @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03101 2026-03-04 cs.LG cs.AI cs.CV 84%

ALARM: Automated MLLM-Based Anomaly Detection in Complex-EnviRonment Monitoring with Uncertainty Quantification

ALARM: 基于多模态大语言模型的复杂环境监控异常检测与不确定性量化

Congjing Zhang, Feng Lin, Xinyi Zhao, Pei Guo, Wei Li, Lin Chen, Chaoyue Zhao, Shuai Huang

机构 * Department of Industrial and Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) Wyze Labs, Inc.(Wyze实验室)

专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 ALARM通过结合不确定性量化与多模态大语言模型,实现了复杂环境中的异常检测,展现出在不同领域中的高准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07218 2026-03-04 cs.LG cs.AI cs.CV 84%

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力

Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23299 2026-03-02 cs.CV cs.MM 84%

MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection

MMSD3.0:一个多图像基准用于现实世界多模态讽刺检测

Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 MMSD3.0是一个多图像基准,用于现实世界多模态讽刺检测,引入了跨图像推理模型和相关引导的细粒度跨模态融合机制,验证了其在单图像和多图像场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04403 2026-02-27 cs.CV cs.CL cs.CR 84%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07525 2026-02-25 cs.CV cs.AI 84%

EHWGesture -- A dataset for multimodal understanding of clinical gestures

EHWGesture -- 一个用于多模态理解临床手势的数据集

Gianluca Amprimo, Alberto Ancilotto, Alessandro Savino, Fabio Quazzolo, Claudia Ferraris, Gabriella Olmo, Elisabetta Farella, Stefano Di Carlo

机构 * Department of Control and Computer Engineering, Politecnico di Torino(控制与计算机工程系,都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) CNR-IEIIT(意大利国家研究委员会-IEIIT)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 EHWGesture是一个包含五个临床相关手势的多模态视频数据集,用于提升临床手势理解的多模态分析能力。

Comments Accepted at ICCV 2025 Workshop on AI-driven Skilled Activity Understanding, Assessment & Feedback Generation

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07543 2026-02-24 cs.CV cs.CL 84%

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

MathScape:在现实数学情境中评估多模态大语言模型

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Baichuan Inc.(百度文心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13028 2026-02-16 cs.CV cs.CL 84%

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析

Runzhou Liu, Hailey Weingord, Sejal Mittal, Prakhar Dungarwal, Anusha Nandula, Bo Ni, Samyadeep Basu, Hongjie Chen, Nesreen K. Ahmed, Li Li, Jiayi Zhang, Koustava Goswami, Subhojyoti Mukherjee, Branislav Kveton, Puneet Mathur, Franck Dernoncourt, Yue Zhao, Yu Wang, Ryan A. Rossi, Zhengzhong Tu, Hongru Du

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学) Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Dolby Laboratories(杜比实验室) Cisco Research(思科研究) University of Southern California(南加州大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Oregon(俄勒冈大学) Texas A&M University(德克萨斯大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08275 2026-02-16 cs.CL cs.AI 84%

MLLM-CTBench: A Benchmark for Continual Instruction Tuning with Reasoning Process Diagnosis

MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断

Haiyun Guo, Zhiyan Hou, Yandu Sun, Jinghan He, Yu Chen, Yuzhe Zhou, Yuheng Jia, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19379 2026-02-11 cs.LG cs.AI cs.MM 84%

OmniMER: Auxiliary-Enhanced LLM Adaptation for Indonesian Multimodal Emotion Recognition

OmniMER: 增辅增强的LLM适应用于印度尼西亚多模态情感识别

Xueming Yan, Boyan Xu, Yaochu Jin, Lixian Xiao, Wenlong Ye, Runyang Cai, Zeqi Zheng, Jingfa Liu, Aimin Yang, Yongduan Song

机构 * School of Information Science and Technology, Guangdong University of Foreign Studies(广东外语外贸大学信息科学与技术学院) School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) Faculty of Asian Languages and Cultures, Guangdong University of Foreign Studies(广东外语外贸大学亚洲语言文化学院) School of Engineering, Westlake University(西湖大学工程学院) School of Computer Science and Intelligence Education, Lingnan Normal University(岭南师范学院计算机科学与智能教育学院) School of Automation, Chongqing University(重庆大学自动化学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 OmniMER通过三种辅助任务提升印度尼西亚多模态情感识别性能,实现情感分类和识别的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04739 2026-02-05 cs.CL cs.AI cs.HC 84%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03268 2026-02-04 cs.LG cs.AI cs.MM 84%

Unveiling Covert Toxicity in Multimodal Data via Toxicity Association Graphs: A Graph-Based Metric and Interpretable Detection Framework

通过毒性关联图揭示多模态数据中的隐性毒性:一种基于图的度量方法和可解释检测框架

Guanzong Wu, Zihao Zhu, Siwei Lyu, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出基于图的毒性关联图方法,通过多模态毒性隐性度度量标准实现对隐性毒性的可解释检测,提升多模态毒性检测的透明度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16648 2026-02-02 cs.AI cs.CL cs.LG 84%

FESTA: Functionally Equivalent Sampling for Trust Assessment of Multimodal LLMs

FESTA:用于多模态大语言模型信任评估的功能等效采样

Debarpan Bhattacharya, Apoorva Kulkarni, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究院) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 FESTA通过功能等效采样技术提升多模态大语言模型的预测选择性性能,实现33.3%和29.6%的改进。

Comments Accepted in the Findings of EMNLP, 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22162 2026-02-02 q-fin.GN cs.AI cs.CL 84%

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

UniFinEval: 向跨文本、图像和视频的金融多模态模型统一评估迈进

Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

机构 * SUFE(上海财经大学) Tencent(腾讯) Gatech(佐治亚理工学院) HiThink Research(慧图研究)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 UniFinEval提出首个统一多模态基准,用于评估金融领域高信息密度下的多模态模型能力,通过五个真实金融场景和大规模数据集验证模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22155 2026-01-30 cs.CV cs.CL 84%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19616 2026-01-30 cs.LG cs.AI cs.CV 84%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 84%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14961 2026-01-28 cs.CV cs.SD eess.AS eess.IV 84%

Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities

自适应多模态人物识别:一种处理缺失模态的稳健框架

Aref Farhadipour, Teodora Vukovic, Volker Dellwo, Petr Motlicek, Srikanth Madikeri

机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系) Faculty of Information Technology, Brno University of Technology(布拉格技术大学信息学院) Idiap Research Institute(Idiap研究机构)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出一种自适应多模态人物识别框架,通过融合上半身运动、面孔和语音信息,提升在缺失模态下的识别准确率,达到99.51%的Top-1准确率。

Comments 9 pages and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21182 2026-01-22 cs.CV cs.CL 84%

KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution

KBE-DME: 通过知识增强的基准进化实现动态多模态评估

Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 KBE-DME通过整合多模态知识和动态基准进化,实现对多模态大语言模型能力的更全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-01-08 cs.CV cs.CL 84%

PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Songyang Zhang, Weijia Li, Bin Wang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02422 2026-01-07 cs.CV cs.AI 84%

Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning

拓宽视野并深入思考:协作式跨模态链式推理用于复杂视觉推理

Wenting Lu, Didi Zhu, Tao Shen, Donglin Zhu, Ayong Ye, Chao Wu

机构 * Fujian Normal University(福建师范大学) Zhejiang University(浙江大学) Zhejiang Normal University(浙江师范大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CoCoT通过动态多区域定位和关系感知推理,提升复杂视觉推理性能,在多个基准测试中实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02443 2026-01-07 cs.CV cs.AI eess.IV 84%

Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative

评估多模态大语言模型的诊断分类能力:来自骨关节炎倡议的见解

Li Wang, Xi Chen, XiangWen Deng, HuaHui Yi, ZeKun Jiang, Kang Li, Jian Li

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究发现,多模态大语言模型在医学图像分类中表现不佳,建议优先优化视觉编码器和数据集质量。

详情

展开后加载摘要…

URL PDF HTML 收藏