arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9087 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9087 篇

2501.10768 2025-07-04 cs.AI 83%

MAPS: Advancing Multi-Modal Reasoning in Expert-Level Physical Science

Erle Zhu, Yadi Liu, Zhe Zhang, Xujun Li, Jin Zhou, Xinjie Yu, Minlie Huang, Hongning Wang

机构 * The Conversational AI (CoAI) Group(对话人工智能小组) Department of Computer Science & Technology(计算机科学与技术系) Department of Electrical Engineering(电子工程系)

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI

Journal ref Proceedings of the 13th International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00841 2025-07-02 cs.AI cs.CR 83%

SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents

Siyuan Liang, Tianmeng Fang, Zhe Liu, Aishan Liu, Yan Xiao, Jinyuan He, Ee-Chien Chang, Xiaochun Cao

机构 * Nanyang Technological University(南洋理工大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Beihang University(北京航空航天大学) Sun Yat-sen University(中山大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23481 2025-07-01 cs.CV eess.IV 83%

Evaluation of Geolocation Capabilities of Multimodal Large Language Models and Analysis of Associated Privacy Risks

Xian Zhang, Xiang Cheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(信息工程测绘遥感国家重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15668 2025-06-27 cs.CV 83%

What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models

Abdelrahman Abdelhamed, Mahmoud Afifi, Alec Go

机构 * Google Research(谷歌研究)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20093 2025-06-26 cs.CL 83%

ITFormer: Bridging Time Series and Natural Language for Multi-Modal QA with Large-Scale Multitask Dataset

Yilin Wang, Peixuan Lei, Jie Song, Yuzhe Hao, Tao Chen, Yuxuan Zhang, Lei Jia, Yuanxiang Li, Zhongyu Wei

机构 * School of Aeronautics and Astronautics, Shanghai Jiao Tong University, Shanghai, China(上海交通大学航空航天学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) School of Data Science, Fudan University, China(复旦大学数据科学学院)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07001 2025-06-24 cs.CV cs.LG 83%

Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models

Bidur Khanal, Sandesh Pokhrel, Sanjay Bhandari, Ramesh Rana, Nikesh Shrestha, Ram Bahadur Gurung, Cristian Linte, Angus Watson, Yash Raj Shrestha, Binod Bhattarai

机构 * Rochester Institute of Technology, Rochester, NY, USA(罗切斯特技术学院) Nepal Applied Mathematics and Informatics Institute for Research (NAAMII)(尼泊尔应用数学与信息技术研究所) Kathmandu University(加德满都大学) University of Lausanne(洛桑大学) University of Aberdeen(阿伯丁大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

Comments Accepted at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00618 2025-06-23 cs.AI 83%

RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents

Jingyi Yang, Shuai Shao, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

Comments 40 pages, 6 figures, Project Page: https://yjyddq.github.io/RiOSWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15569 2025-06-19 cs.CL 83%

SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification

Chengye Wang, Yifei Shen, Zexi Kuang, Arman Cohan, Yilun Zhao

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10465 2025-06-13 cs.CV 83%

MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models

Yu Huang, Zelin Peng, Yichen Zhao, Piao Yang, Xiaokang Yang, Wei Shen

机构 * Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine, Hangzhou, Zhejiang, China(放射科、浙江大学医学院附属第一医院、浙江大学医学院)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments †: Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09834 2025-06-13 cs.CV 83%

MMME: A Spontaneous Multi-Modal Micro-Expression Dataset Enabling Visual-Physiological Fusion

Chuang Ma, Yu Pei, Jianhang Zhang, Shaokai Zhao, Bowen Ji, Liang Xie, Ye Yan, Erwei Yin

机构 * The Defense Innovation Institute, Academy of Military Sciences(国防科技创新院,军事科学学院) Northwestern Polytechnical University(西北工业大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09424 2025-06-12 cs.CL 83%

Hidden in Plain Sight: Evaluation of the Deception Detection Capabilities of LLMs in Multimodal Settings

Md Messal Monem Miah, Adrita Anika, Xi Shi, Ruihong Huang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07837 2025-06-10 cs.AI 83%

HAIBU-ReMUD: Reasoning Multimodal Ultrasound Dataset and Model Bridging to General Specific Domains

Shijie Wang, Yilun Zhang, Zeyu Lai, Dexing Kong

机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07202 2025-06-10 cs.AI 83%

Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation

Ming Liu, Wensheng Zhang

机构 * Department of Computer Science(计算机科学系) Iowa State University(爱荷华州立大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03360 2025-06-05 cs.CL cs.CY cs.SI 83%

A Multimodal, Multilingual, and Multidimensional Pipeline for Fine-grained Crowdsourcing Earthquake Damage Evaluation

Zihui Ma, Lingyao Li, Juan Li, Wenyue Hua, Jingxiao Liu, Qingyuan Feng, Yuki Miura

机构 * New York University(纽约大学) University of South Florida(佛罗里达州立大学) Google LLC(谷歌公司) University of California, Santa Barbara(加州大学圣巴巴拉分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01586 2025-06-03 cs.CV cs.LG 83%

Multi-Modal Dataset Distillation in the Wild

Zhuohang Dang, Minnan Luo, Chengyou Jia, Hangwei Qian, Xiaojun Chang, Ivor W. Tsang

机构 * Xi’an Jiaotong University(西安交通大学) A*STAR(新加坡科技研究局) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12567 2025-06-02 cs.CL 83%

FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning

Seunghee Kim, Changhyeon Kim, Taeuk Kim

机构 * Hanyang University(翰阳大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23793 2025-06-02 cs.CR cs.AI 83%

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Baolin Zheng, Guanlin Chen, Hongqiong Zhong, Qingyang Teng, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Huiyun Jing, Jincheng Wei, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22250 2025-05-30 cs.CV q-bio.QM 83%

YH-MINER: Multimodal Intelligent System for Natural Ecological Reef Metric Extraction

Mingzhuang Wang, Yvyang Li, Xiyang Zhang, Fei Tan, Qi Shi, Guotao Zhang, Siqi Chen, Yufei Liu, Lei Lei, Ming Zhou, Qiang Lin, Hongqiang Yang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17758 2025-05-27 eess.IV cs.CV 83%

Glioma Multimodal MRI Analysis System for Tumor Layered Diagnosis via Multi-task Semi-supervised Learning

Yihao Liu, Zhihao Cui, Liming Li, Junjie You, Xinle Feng, Jianxin Wang, Xiangyu Wang, Qing Liu, Minghua Wu

机构 * Cancer Research Institute, Central South University(中南大学肿瘤研究所) School of Physics & Electronic Science, Changsha University of Science & Technology(长沙理工大学物理与电子科学学院) IFLYTEK Research(iFlytek研究院) School of Life Sciences, Central South University(中南大学生命科学学院) Department of Radiology, Xiangya Hospital, Central South University(中南大学湘雅医院放射科) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Neurosurgery, Xiangya Hospital, Central South University(中南大学湘雅医院神经外科)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17682 2025-05-23 cs.LG cs.AI 83%

Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback

Jiaming Ji, Xinyu Chen, Rui Pan, Conghui Zhang, Han Zhu, Jiahao Li, Donghai Hong, Boyuan Chen, Jiayi Zhou, Kaile Wang, Juntao Dai, Chi-Min Chan, Yida Tang, Sirui Han, Yike Guo, Yaodong Yang

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13419 2025-05-20 cs.CV 83%

FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning

Zhuozhao Hu, Kaishen Yuan, Xin Liu, Zitong Yu, Yuan Zong, Jingang Shi, Huanjing Yue, Jingyu Yang

机构 * Tianjin University(天津大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Lappeenranta-Lahti University of Technology LUT(拉佩兰塔-拉赫蒂技术大学) Great Bay University(大湾大学) Southeast University(东南大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13403 2025-05-20 cs.CL 83%

MR. Judge: Multimodal Reasoner as a Judge

Renjie Pi, Felix Bai, Qibin Chen, Simon Wang, Jiulong Shan, Kieran Liu, Meng Cao

机构 * HKUST(香港科技大学) Apple(苹果公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11216 2025-05-19 cs.CV 83%

GeoMM: On Geodesic Perspective for Multi-modal Learning

Shibin Mei, Hang Wang, Bingbing Ni

机构 * Huawei(华为) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

Comments 15 pages, 3 figures, accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10486 2025-05-15 cs.LG cs.AI 83%

Deep Metric Loss for Multimodal Learning

Sehwan Moon, Hyunju Lee

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

Comments 18 pages, 9 figures

Journal ref Mach Learn 114, 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06796 2025-05-13 cs.CV 83%

Multimodal Fake News Detection: MFND Dataset and Shallow-Deep Multitask Learning

Ye Zhu, Yunan Wang, Zitong Yu

机构 * School of Artificial Intelligence, Hebei University of Technology(河北工业大学人工智能学院) School of Computing and Information Technology, Great Bay University(大湾大学计算与信息学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing & Shenzhen Key Laboratory of Media Security, Shenzhen University(广东省智能信息处理重点实验室 & 深圳市媒体安全重点实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能信息科技重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06418 2025-05-13 cs.CL 83%

Is your multimodal large language model a good science tutor?

Ming Liu, Liwen Wang, Wensheng Zhang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05148 2025-05-09 cs.CL 83%

A Benchmark Dataset and a Framework for Urdu Multimodal Named Entity Recognition

Hussain Ahmad, Qingyang Zeng, Jing Wan

机构 * College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, 100029, China(信息科学与技术学院,北京化工大学,北京)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

Comments 16 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04941 2025-05-09 cs.CV 83%

Building-Guided Pseudo-Label Learning for Cross-Modal Building Damage Mapping

Jiepan Li, He Huang, Yu Sheng, Yujun Guo, Wei He

机构 * Wuhan University(武汉大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01064 2025-05-05 cs.CV cs.LG 83%

Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs

Hari Chandana Kuchibhotla, Sai Srinivas Kancheti, Abbavaram Gowtham Reddy, Vineeth N Balasubramanian

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments preprint; earlier version accepted at NeurIPS 2024 Workshop on Adaptive Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14432 2025-05-05 cs.CV 83%

Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models

Yuhao Dong, Zuyan Liu, Hai-Long Sun, Jingkang Yang, Winston Hu, Yongming Rao, Ziwei Liu

机构 * S-Lab, NTU(NTU的S-Lab) Tencent(腾讯) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏