arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9111 篇

2508.13938 2025-08-20 cs.CL cs.CV 81%

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models

Jiacheng Ruan, Dan Jiang, Xian Gao, Ting Liu, Yuzhuo Fu, Yangyang Kang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13485 2025-08-20 cs.CV cs.AI 81%

CORENet: Cross-Modal 4D Radar Denoising Network with LiDAR Supervision for Autonomous Driving

Fuyang Liu, Jilin Mei, Fangyuan Mao, Chen Min, Yan Xing, Yu Hu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Control Engineering(北京控制工程研究所)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 5 figures, Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11021 2025-08-18 cs.CV cs.CL 81%

Can Multi-modal (reasoning) LLMs detect document manipulation?

Zisheng Liang, Kidus Zewde, Rudra Pratap Singh, Disha Patil, Zexi Chen, Jiayu Xue, Yao Yao, Yifei Chen, Qinzhe Liu, Simiao Ren

机构 * Duke University(杜克大学) Indian Institute of Technology, Roorkee(印度理工学院,罗尔基) New York University(纽约大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Columnbia University(哥伦比亚大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments arXiv admin note: text overlap with arXiv:2503.20084

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18932 2025-08-18 cs.MM cs.CL 81%

MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks

Lei Zhang, Xin Zhou, Chaoyue He, Di Wang, Yi Wu, Hong Xu, Wei Liu, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10769 2025-08-15 cs.AI cs.MM 81%

Modeling Human Responses to Multimodal AI Content

Zhiqi Shen, Shaojing Fan, Danni Xu, Terence Sim, Mohan Kankanhalli

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10655 2025-08-15 cs.CV cs.AI 81%

Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking

Zhangyong Tang, Tianyang Xu, Xuefeng Zhu, Chunyang Cheng, Tao Zhou, Xiaojun Wu, Josef Kittler

机构 * Jiangnan University(江南大学) Nanjing University of Science and Technology(南京理工大学) University of Surrey(萨里大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10429 2025-08-15 cs.AI cs.CR cs.CV 81%

MM-Food-100K: A 100,000-Sample Multimodal Food Intelligence Dataset with Verifiable Provenance

Yi Dong, Yusuke Muraoka, Scott Shi, Yi Zhang

机构 * Codatta Kite AI Binance Wallet Community Codatta Community

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages, 5 figures, 6 tables. The dataset is available at https://huggingface.co/datasets/Codatta/MM-Food-100K

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08224 2025-08-14 cs.CL cs.AI 81%

Capabilities of GPT-5 on Multimodal Medical Reasoning

Shansong Wang, Mingzhe Hu, Qiang Li, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科、Winship癌症研究所、埃默里大学医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12207 2025-08-14 cs.CV cs.AI 81%

Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind

Qingmei Li, Yang Zhang, Zurong Mai, Yuhang Chen, Shuohong Lou, Henglian Huang, Jiarui Zhang, Zhiwei Zhang, Yibin Wen, Weijia Li, Haohuan Fu, Jianxi Huang, Juepeng Zheng

机构 * Tsinghua University(清华大学) Sun Yat-Sen University(中山大学) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02141 2025-08-13 cs.CV cs.CL 81%

WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image

Yuci Liang, Xinheng Lyu, Wenting Chen, Meidan Ding, Jipeng Zhang, Xiangjian He, Song Wu, Xiaohan Xing, Sen Yang, Xiyue Wang, Linlin Shen

机构 * Shenzhen University(深圳大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL

Comments ICCV 2025, 38 pages, 22 figures, 35 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06272 2025-08-12 cs.CV cs.AI 81%

LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance

Zhang Li, Biao Yang, Qiang Liu, Shuo Zhang, Zhiyin Ma, Liang Yin, Linger Deng, Yabo Sun, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07689 2025-08-08 cs.CV cs.MM cs.RO 81%

RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving

Zhijian Huang, Chengjian Feng, Feng Yan, Baihui Xiao, Zequn Jie, Yujie Zhong, Xiaodan Liang, Lin Ma

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meituan(美团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12772 2025-08-07 cs.CV cs.AI cs.RO 81%

NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language Models

Sung-Yeon Park, Can Cui, Yunsheng Ma, Ahmadreza Moradipari, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03008 2025-08-06 eess.IV cs.AI cs.CV 81%

ClinicalFMamba: Advancing Clinical Assessment using Mamba-based Multimodal Neuroimaging Fusion

Meng Zhou, Farzad Khalvati

机构 * TD Bank Group, Toronto, Canada(TD银行集团,加拿大) Department of Computer Science, University of Toronto, Toronto, Canada(多伦多大学计算机科学系,加拿大) Department of Medical Imaging, University of Toronto, Toronto, Canada(多伦多大学医学影像系,加拿大)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at MICCAI MLMI 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22676 2025-08-06 cs.CL cs.MM 81%

Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment

Jia Li, Yang Wang, Wenhao Qian, Jialong Hu, Zhenzhen Hu, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments 8 pages, 4 figures, ACM MM 2025. github:https://github.com/MSA-LMC/365Aspects

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09071 2025-08-05 cs.CV cs.AI 81%

Segment Any Architectural Facades (SAAF):An automatic segmentation model for building facades, walls and windows based on multimodal semantics guidance

Peilin Li, Jun Yin, Jing Zhong, Ran Luo, Pengyu Zeng, Miao Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06252 2025-08-04 cs.CV cs.AI 81%

Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?

Kun Xiang, Zhili Liu, Zihao Jiang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Haoxiang Fan, Hanhui Li, Weiran Huang, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2411.11930

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22685 2025-07-31 cs.CV cs.AI 81%

Hydra-Bench: A Benchmark for Multi-Modal Leaf Wetness Sensing

Yimeng Liu, Maolin Gan, Yidong Ren, Gen Li, Jingkai Lin, Younsuk Dong, Zhichao Cao

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20872 2025-07-29 cs.CV cs.AI cs.LG 81%

Not Only Grey Matter: OmniBrain for Robust Multimodal Classification of Alzheimer's Disease

Ahmed Sharshar, Yasser Ashraf, Tameem Bakr, Salma Hassan, Hosam Elgendy, Mohammad Yaqub, Mohsen Guizani

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Published in Third Workshop on Computer Vision for Automated Medical Diagnosis CVAMD 2025 in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20737 2025-07-29 cs.CV cs.AI cs.HC 81%

Multi-Masked Querying Network for Robust Emotion Recognition from Incomplete Multi-Modal Physiological Signals

Geng-Xin Xu, Xiang Zuo, Ye Li

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen 518055, China(深圳先进技术研究院,中国科学院,深圳518055,中国) Southern University of Science and Technology, Shenzhen 518055, China(南方科技大学,深圳518055,中国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments MICCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19969 2025-07-29 cs.CL cs.CV 81%

Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text

Mizanur Rahman, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Dialpad Salesforce AI Research(Salesforce人工智能研究)

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19682 2025-07-29 cs.CV cs.AI 81%

DeepJIVE: Learning Joint and Individual Variation Explained from Multimodal Data Using Deep Learning

Matthew Drexler, Benjamin Risk, James J Lah, Suprateek Kundu, Deqiang Qiu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19172 2025-07-28 cs.AI cs.CV 81%

PhysDrive: A Multimodal Remote Physiological Measurement Dataset for In-vehicle Driver Monitoring

Jiyao Wang, Xiao Yang, Qingyong Hu, Jiankai Tang, Can Liu, Dengbo He, Yuntao Wang, Yingcong Chen, Kaishun Wu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Sichuan Agricultural University(四川农业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments It is the initial version, not the final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08427 2025-07-24 cs.CL cs.AI 81%

Impact of Stickers on Multimodal Sentiment and Intent in Social Media: A New Task, Dataset and Baseline

Yuanchen Shi, Biao Ma, Longyin Zhang, Fang Kong

机构 * School of Computer Science and Technology(计算机科学与技术学院) Soochow University(苏州大学) Institute for Infocomm Research, A*STAR(信息与通信研究院,A*STAR)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23121 2025-07-18 cs.CL cs.AI 81%

ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations

Yiming Lei, Zhizheng Yang, Zeming Liu, Haitao Leng, Shaoguo Liu, Tingting Gao, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北航) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院) Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21596 2025-07-16 cs.CL cs.AI cs.IR 81%

Evaluating Multimodal Large Language Models on Educational Textbook Question Answering

Hessa A. Alawwad, Anas Zafar, Areej Alhothali, Usman Naseem, Ali Alkhathlan, Amani Jamal

机构 * Faculty of Computing and Information Technology(计算与信息科技学院) King Abdulaziz University(阿卜杜勒阿齐兹大学) FAST School of Computing(快速计算学院) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) School of Computing(计算学院) Macquarie University(麦考瑞大学) Center of Research Excellence in AI and Data Science(人工智能与数据科学卓越研究中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03483 2025-07-09 cs.CL cs.AI 81%

BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset

Zhiheng Xi, Guanyu Li, Yutao Fan, Honglin Guo, Yufang Liu, Xiaoran Fan, Jiaqi Liu, Jingchao Ding, Wangmeng Zuo, Zhenfei Yin, Lei Bai, Tao Ji, Tao Gui, Qi Zhang, Philip Torr, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) East China Normal University(华东师范大学) Oxford(牛津大学) University of Sydney(悉尼大学) Yimudata(云墨数据)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23101 2025-07-08 cs.CL cs.AI cs.CY 81%

From Individuals to Interactions: Benchmarking Gender Bias in Multimodal Large Language Models from the Lens of Social Relationship

Yue Xu, Wenjie Wang

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09318 2025-07-08 cs.CL cs.CV 81%

ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models

Yahan Tu, Rui Hu, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02252 2025-07-04 cs.CV cs.AI 81%

SurgVisAgent: Multimodal Agentic Model for Versatile Surgical Visual Enhancement

Zeyu Lei, Hongyuan Yu, Jinlin Wu, Zhen Chen

机构 * University of Chinese Academy of Sciences Multimedia Department, Xiaomi Inc Chinese Academy of Sciences, Institute of Automation Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏