arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9111 篇

2507.19551 2025-12-03 cs.CY cs.AI cs.CV 81%

Rainbow Noise: Stress-Testing Multimodal Harmful-Meme Detectors on LGBTQ Content

彩虹噪声:对多模态有害迷因检测器进行压力测试以应对LGBTQ内容

Ran Tong, Songtao Wei, Jiaqi Liu, Lanruo Wang

机构 * Mathematics and Statistics Department University of Texas at Dallas(德克萨斯大学达拉斯分校数学与统计学系) Computer Science Department University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Naveen Jindal School of Management University of Texas at Dallas(德克萨斯大学达拉斯分校奈文·金达尔管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出彩虹噪声基准测试,通过压力测试多模态有害迷因检测器,引入轻量级TDA提升鲁棒性,揭示当前模型弱点并展示改进方向。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01274 2025-12-02 cs.CL cs.AI cs.LG 81%

SUPERChem: A Multimodal Reasoning Benchmark in Chemistry

SUPERChem:化学领域的多模态推理基准

Zehua Zhao, Zhixian Huang, Junren Li, Siyu Lin, Junting Zhou, Fengqi Cao, Kun Zhou, Rui Ge, Tingting Long, Yuexiang Zhu, Yan Liu, Jie Zheng, Junnian Wei, Rong Zhu, Peng Zou, Wenyu Li, Zekai Cheng, Tian Ding, Yaxuan Wang, Yizhao Yan, Tingru Wei, Haowei Ming, Weijie Mao, Chen Sun, Yiming Liu, Zichen Wang, Zuo Zhang, Tong Yang, Hao Ma, Zhen Gao, Jian Pei

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 SUPERChem通过多模态推理基准测试,评估LLMs在化学领域的能力,揭示模型对视觉信息的依赖,并区分高保真推理与启发式推理。

Comments 35 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00060 2025-12-02 cs.CV cs.AI 81%

PEFT-DML: Parameter-Efficient Fine-Tuning Deep Metric Learning for Robust Multi-Modal 3D Object Detection in Autonomous Driving

PEFT-DML:参数高效微调深度度量学习用于自动驾驶中鲁棒的多模态3D物体检测

Abdolazim Rezaei, Mehdi Sookhak

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 PEFT-DML通过参数高效微调深度度量学习,提升自动驾驶中多模态3D物体检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12861 2025-12-01 cs.CL cs.CV 81%

From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models

从感知到推理:深度思考赋能多模态大语言模型

Wenxin Zhu, Andong Chen, Yuchen Song, Kehai Chen, Conghui Zhu, Ziyan Chen, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Global Tone Communication Technology(全球语音通信技术)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出多模态链式思维方法,旨在提升多模态大语言模型的推理能力,通过系统性综述分析其理论基础、实现方法及未来发展方向。

Comments Survey; 7 figures, 3 tables, 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21339 2025-11-27 cs.CV cs.AI 81%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12307 2025-11-27 cs.CV cs.CL 81%

LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?

LogicOCR: 大型多模态模型在文本丰富的图像上逻辑推理是否表现优异?

Maoyuan Ye, Haibin He, Qihuang Zhong, Jing Zhang, Juhua Liu, Bo Du

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心、人工智能研究院、多媒体与网络通信工程湖北省重点实验室、武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 LogicOCR通过构建包含生成和现实图像问题的基准测试,评估大型多模态模型在文本丰富图像上的逻辑推理能力,并提出TextCue方法提升模型对关键文本区域的感知。

Comments GitHub: https://github.com/MiliLab/LogicOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19537 2025-11-26 cs.CV cs.AI cs.LG eess.IV 81%

Cross-Domain Generalization of Multimodal LLMs for Global Photovoltaic Assessment

多领域泛化用于全球光伏评估的多模态大语言模型

Muhao Guo, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19470 2025-11-26 cs.LG cs.AI cs.CL 81%

Quantifying Modality Contributions via Disentangling Multimodal Representations

通过解构多模态表示量化模态贡献

Padegal Amit, Omkar Mahesh Kashyap, Namitha Rayasam, Nidhi Shekhar, Surabhi Narayan

机构 * PES University(PES大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于部分信息分解的框架,通过分解多模态表示中的预测信息,量化各模态的贡献,提供更清晰的多模态行为分析。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18874 2025-11-25 cs.AI cs.CV cs.LG cs.MA cs.RO cs.SI 81%

GContextFormer: A global context-aware hybrid multi-head attention approach with scaled additive aggregation for multimodal trajectory prediction

GContextFormer: 一种基于全局上下文的混合多头注意力方法,通过缩放加法聚合实现多模态轨迹预测

Yuzhi Chen, Yuanchang Xie, Lei Zhao, Pan Liu, Yajie Zou, Chen Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GContextFormer通过全局上下文感知的混合多头注意力和缩放加法聚合,实现无地图依赖的多模态轨迹预测,提升鲁棒性和预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17576 2025-11-25 cs.CV cs.AI cs.LG 81%

Multimodal AI for Body Fat Estimation: Computer Vision and Anthropometry with DEXA Benchmarks

多模态AI用于脂肪率估计:计算机视觉与体态测量结合DEXA基准测试

Rayan Aldajani

机构 * Dept. of Electrical Engineering and Computer Science(电气工程与计算机科学系) York University(约克大学) Toronto, Canada(加拿大多伦多)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出利用多模态AI结合计算机视觉和体态测量数据,通过DEXA基准测试验证了低成本脂肪率估计方法的有效性。

Comments 2 pages, 2 figures, accepted at IEEE CASCON 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16221 2025-11-21 cs.CV cs.CL 81%

Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions

大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15059 2025-11-20 cs.CV cs.CL 81%

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(日本国立信息机构) NII LLMC Tokyo, Japan(日本国立信息机构LLMC东京)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18015 2025-11-20 cs.CV cs.AI 81%

Beyond Diagnosis: Evaluating Multimodal LLMs for Pathology Localization in Chest Radiographs

Advait Gosai, Arun Kavishwar, Stephanie L. McNamara, Soujanya Samineni, Renato Umeton, Alexander Chowdhury, William Lotter

机构 * University of California(加州大学) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Massachusetts General Hospital(麻省总医院) St. Jude Children’s Research Hospital(圣犹大儿童研究医院) Brigham and Women’s Hospital & Harvard Medical School(布里法伦医院及哈佛医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Proceedings of the 5th Machine Learning for Health (ML4H) Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13259 2025-11-18 cs.CV cs.AI 81%

GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models

Yushuo Zheng, Jiangyong Ying, Huiyu Duan, Chunyi Li, Zicheng Zhang, Jing Liu, Xiaohong Liu, Guangtao Zhai

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09894 2025-11-18 cs.AI cs.CV cs.LG 81%

EgoEMS: A High-Fidelity Multimodal Egocentric Dataset for Cognitive Assistance in Emergency Medical Services

Keshara Weerasinghe, Xueren Ge, Tessa Heick, Lahiru Nuwan Wijayasingha, Anthony Cortez, Abhishek Satpathy, John Stankovic, Homa Alemzadeh

机构 * School of Engineering and Applied Science(工程与应用科学学院) School of Medicine(医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to AAAI 2026 (Preprint), 45 pages, 29 figures, updated references and figure orderings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12008 2025-11-18 cs.AI cs.CV cs.LG 81%

Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models

Yunqi Hong, Johnson Kao, Liam Edwards, Nein-Tzu Liu, Chung-Yen Huang, Alex Oliveira-Kowaleski, Cho-Jui Hsieh, Neil Y. C. Lin

机构 * Computer Science Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Mechanical and Aerospace Engineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系) Department of Pathology, Tri-Service General Hospital, National Defense Medical Center, Taipei, Taiwan(台湾国防医学院三军总医院病理部) Department of Pathology, National Taiwan University Hospital, Taipei, Taiwan(台湾国立台湾大学医院病理部) Department of Pathology, David Geffen School of Medicine, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校大卫·Geffen医学院病理部) Bioengineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校生物工程系) Institute for Quantitative and Computational Biosciences, University of California, CA, USA(加州大学定量与计算生物科学研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11299 2025-11-17 cs.CV cs.AI 81%

AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models

Haokun Chen, Jianing Li, Yao Zhang, Jinhe Bi, Yan Xia, Jindong Gu, Volker Tresp

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

Comments AAAI 2026. Code: https://github.com/HaokunChen245/AUVIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10521 2025-11-17 cs.AI cs.CL 81%

Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning

Yuhao Zhou, Yiheng Wang, Xuming He, Ao Shen, Ruoyao Xiao, Zhiwei Li, Qiantai Feng, Zijie Guo, Yuejin Yang, Hao Wu, Wenxuan Huang, Jiaqi Wei, Dan Si, Xiuqi Yao, Jia Bu, Haiwen Huang, Manning Wang, Tianfan Fu, Shixiang Tang, Ben Fei, Dongzhan Zhou, Fenghua Ling, Yan Lu, Siqi Sun, Chenhui Li, Guanjie Zheng, Jiancheng Lv, Wenlong Zhang, Lei Bai

机构 * PrismaX Team Shanghai Artificial Intelligence Laboratory(普斯玛X团队上海人工智能实验室)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CL、cs.AI

Comments 82 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11034 2025-11-17 cs.CV cs.AI 81%

CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging

Pooja Singh, Siddhant Ujjain, Tapan Kumar Gandhi, Sandeep Kumar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10690 2025-11-17 cs.CL cs.AI 81%

Saying the Unsaid: Revealing the Hidden Language of Multimodal Systems Through Telephone Games

Juntu Zhao, Jialing Zhang, Chongxuan Li, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 MTI-LLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16926 2025-11-17 cs.CV cs.CL 81%

Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input

Chenxu Li, Zhicai Wang, Yuan Sheng, Xingyu Zhu, Yanbin Hao, Xiang Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00060 2025-11-17 cs.CV cs.AI 81%

MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image

Shezheng Song, Chengxiang He, Shan Zhao, Chengyu Wang, Qian Wan, Tianwei Yan, Meng Wang

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) CCNU(中国地质大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07250 2025-11-14 cs.CV cs.AI 81%

MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs

Tianhao Peng, Haochen Wang, Yuanxing Zhang, Zekun Wang, Zili Wang, Gavin Chang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Steven Huang, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所) Kuaishou Technology(快手科技) M-A-P

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15721 2025-11-14 cs.CL cs.AI 81%

EcomMMMU: Strategic Utilization of Visuals for Robust Multimodal E-commerce Models

Xinyi Ling, Hanwen Du, Zhihui Zhu, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Translational Data Analytics Institute, The Ohio State University(俄亥俄州立大学转化数据分析研究所) Department of Biomedical Informatics, The Ohio State University(俄亥俄州立大学生物医学信息学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments ICJNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09067 2025-11-13 cs.CL cs.AI 81%

MM-CRITIC: A Holistic Evaluation of Large Multimodal Models as Multimodal Critique

Gailun Zeng, Ziyang Luo, Hongzhan Lin, Yuchen Tian, Kaixin Li, Ziyang Gong, Jianxiong Guo, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist 大学) National University of Singapore(新加坡国立大学) Beijing Normal University(北京师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 28 pages, 14 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24792 2025-11-13 cs.CV cs.AI 81%

PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models

Patrick Haller, Fabio Barth, Jonas Golde, Georg Rehm, Alan Akbik

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 11 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13231 2025-11-12 cs.CV cs.AI 81%

WildFireCan-MMD: A Multimodal Dataset for Classification of User-Generated Content During Wildfires in Canada

Braeden Sherritt, Isar Nejadgholi, Efstratios Aivaliotis, Khaled Mslmani, Marzieh Amini

机构 * Carleton University(卡尔顿大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07010 2025-11-11 cs.CL cs.CV cs.HC 81%

A Picture is Worth a Thousand (Correct) Captions: A Vision-Guided Judge-Corrector System for Multimodal Machine Translation

Siddharth Betala, Kushan Raj, Vipul Betala, Rohan Saswade

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted at The 12th Workshop on Asian Translation, co-located with IJCLNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20665 2025-11-11 cs.CV cs.MM 81%

SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection

Yuxuan Li, Xiang Li, Yunheng Li, Yicheng Zhang, Yimian Dai, Qibin Hou, Ming-Ming Cheng, Jian Yang

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.MM

Comments Accepted as Oral in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04948 2025-11-10 cs.CV cs.AI 81%

A benchmark multimodal oro-dental dataset for large vision-language models

Haoxin Lv, Ijazul Haq, Jin Du, Jiaxin Ma, Binnian Zhu, Xiaobing Dang, Chaoan Liang, Ruxu Du, Yingjie Zhang, Muhammad Saqib

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏