arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9087 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9087 篇

2510.21111 2025-10-27 cs.CV 83%

PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments

Weijie Zhou, Xuantang Xiong, Yi Peng, Manli Tao, Chaoyang Zhao, Honghui Dong, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Tencent Robotics X & Futian Laboratory, Shenzhen(腾讯机器人X及福田实验室,深圳) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所) ObjectEye Inc(ObjectEye公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systemss (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00063 2025-10-22 astro-ph.IM cs.AI 83%

AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy

Jinghang Shi, Xiaoyu Tang, Yang Huang, Yuyang Li, Xiao Kong, Yanxia Zhang, Caizhan Yue

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02104 2025-10-21 eess.IV cs.CV 83%

REACT-KD: Region-Aware Cross-modal Topological Knowledge Distillation for Interpretable Medical Image Classification

Hongzhao Chen, Hexiao Ding, Yufeng Jiang, Jing Lan, Ka Chun Li, Gerald W. Y. Cheng, Nga-Chun Ng, Yao Pu, Jing Cai, Liang-ting Lin, Jung Sun Yoo

机构 * Department of Health Technology and Informatics, Hong Kong Polytechnic University(健康科技与信息技术系,香港理工大学) Department of Nuclear Medicine and PET, Hong Kong Sanatorium and Hospital(核医学与PET部门,香港疗养院及医院)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15595 2025-10-20 cs.CV 83%

FlexiReID: Adaptive Mixture of Expert for Multi-Modal Person Re-Identification

Zhen Sun, Lei Tan, Yunhang Shen, Chengmao Cai, Xing Sun, Pingyang Dai, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) National University of Singapore(新加坡国立大学) Tencent YouTu Lab(腾讯优图实验室) Institute of Artificial Intelligence,Xiamen University(人工智能研究院,厦门大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12267 2025-10-15 cs.CV 83%

SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis

Chenghanyu Zhang, Zekun Li, Peipei Li, Xing Cui, Shuhan Xia, Weixiang Yan, Yiqiao Zhang, Qianyu Zhuang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Peking Union Medical College Hospital(北京佑安医学大学医院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Proceedings of the 33rd ACM International Conference on Multimedia,ACMMM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10464 2025-10-14 cs.CV 83%

Post-TIPS Prediction via Multimodal Interaction: A Multi-Center Dataset and Framework for Survival, Complication, and Portal Pressure Assessment

Junhao Dong, Dejia Liu, Ruiqi Ding, Zongxing Chen, Yingjie Huang, Zhu Meng, Jianbo Zhao, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Division of Vascular and Interventional Radiology, Department of General Surgery, Nanfang Hospital, Southern Medical University(南方医科大学普外科血管介入放射科) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 81 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24138 2025-10-14 cs.LG cs.AI 83%

AMSbench: A Comprehensive Benchmark for Evaluating MLLM Capabilities in AMS Circuits

Yichen Shi, Ze Zhang, Hongyang Wang, Zhuofu Tao, Zhongyi Li, Bingyu Chen, Yaxin Wang, Zhen huang, Xuhua Liu, Quan Chen, Zhiping Yu, Ting-Jung Lin, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(美国加州大学洛杉矶分校) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所)

专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09664 2025-10-14 cs.LG cs.CV cs.IR 83%

Semantic-Cohesive Knowledge Distillation for Deep Cross-modal Hashing

Changchang Sun, Vickie Chen, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Rensselaer Polytechnic Institute(拉特克利夫理工学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06871 2025-10-10 cs.LG cs.CV 83%

SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models

Huahui Yi, Kun Wang, Qiankun Li, Miao Yu, Liang Lin, Gongli Xi, Hao Wu, Xuming Hu, Kang Li, Yang Liu

机构 * West China Biomedical Big Data Center, West China Hospital, SCU(西昌生物医学大数据中心、西昌医院、SCU) NTU USTC TeleAI, China Telecom(TeleAI、中国电信) BUPT Tsinghua University(清华大学) HKUST(Guangzhou)(HKUST(广州))

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19378 2025-10-08 cs.CV cs.LG eess.IV 83%

Unified Cross-Modal Medical Image Synthesis with Hierarchical Mixture of Product-of-Experts

Reuben Dorent, Nazim Haouchine, Alexandra Golby, Sarah Frisken, Tina Kapur, William Wells

机构 * Harvard Medical School and the Brigham and Women’s Hospital(哈佛医学院和布里洛妇产科医院) MIND Team, Inria Saclay, Université Paris-Saclay, Palaiseau, France and Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM, CNRS, Inria, Inserm, AP-HP, Hôpital de la Pitié Salpêtrière(MIND团队、Inria Saclay、巴黎萨克雷大学、Palaiseau,法国以及索邦大学、巴黎脑研究所-ICM、CNRS、Inria、Inserm、AP-HP、皮蒂埃萨勒普蒂耶医院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

Comments Accepted in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07966 2025-10-08 cs.CV 83%

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

Ziyang Gong, Wenhao Li, Oliver Ma, Songyuan Li, Zhaokai Wang, Songyuan Li, Jiayi Ji, Xue Yang, Gen Luo, Junchi Yan, Rongrong Ji

机构 * SJTU(上海交通大学) XMU(厦门大学) Shanghai AI Lab(上海人工智能实验室) SYSU(南方科技大学) FDU(福建大学) NUS(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01713 2025-10-07 cs.CL 83%

SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning

Zhongwei Wan, Zhihao Dou, Che Liu, Yu Zhang, Dongfei Cui, Qinjian Zhao, Hui Shen, Jing Xiong, Yi Xin, Yifan Jiang, Chaofan Tao, Yangfan He, Mi Zhang, Shen Yan

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00883 2025-10-07 cs.CL 83%

Improve MLLM Benchmark Efficiency through Interview

Farong Wen, Yijin Guo, Junying Wang, Jiaohao Xiao, Yingjie Zhou, Ye Shen, Qi Jia, Chunyi Li, Zicheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00069 2025-10-02 cs.CV 83%

OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding

Jiancong Xie, Wenjin Wang, Zhuomeng Zhang, Zihan Liu, Qi Liu, Ke Feng, Zixun Sun, Yuedong Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Interactive Entertainment Group, Tencent Inc, China(腾讯互动娱乐集团) Key Laboratory of Machine Intelligence and Advanced Computing (MOE), China(机器智能与先进计算重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24791 2025-09-30 cs.CV 83%

Vision Function Layer in Multimodal LLMs

Cheng Shi, Yizhou Yu, Sibei Yang

机构 * Sun Yat-sen University(中山大学) School of Computing and Data Science(计算与数据科学学院) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025 (preview; camera-ready in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01667 2025-09-30 cs.CV 83%

EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM

Yan Shu, Bin Ren, Zhitong Xiong, Danda Pani Paudel, Luc Van Gool, Begüm Demir, Nicu Sebe, Paolo Rota

机构 * University of Trento(特伦托大学) BIFOLD and Technische Universität Berlin(BIFOLD和柏林技术大学) Technical University of Munich(慕尼黑技术大学) University of Pisa(比萨大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05271 2025-09-29 cs.CV 83%

Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, Lixin Gu, Xuehui Wang, Qingyun Li, Yiming Ren, Zixuan Chen, Jiapeng Luo, Jiahao Wang, Tan Jiang, Bo Wang, Conghui He, Botian Shi, Xingcheng Zhang, Han Lv, Yi Wang, Wenqi Shao, Pei Chu, Zhongying Tu, Tong He, Zhiyong Wu, Huipeng Deng, Jiaye Ge, Kai Chen, Kaipeng Zhang, Limin Wang, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) Nanjing University(南京大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21050 2025-09-26 cs.LG cs.AI 83%

GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions

Bing Liu, Wenqiang Yv, Xuzheng Yang, Shichang Wang, Junzhuo Liu, Peng Wang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19841 2025-09-25 cs.CV 83%

ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection

Tai-Ming Huang, Wei-Tung Lin, Kai-Lung Hua, Wen-Huang Cheng, Junichi Yamagishi, Jun-Cheng Chen

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12201 2025-09-25 cs.CV 83%

OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling

Yang Zhou, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Haoyu Guo, Zizun Li, Kaijing Ma, Xinyue Li, Yating Wang, Haoyi Zhu, Mingyu Liu, Dingning Liu, Jiange Yang, Zhoujie Fu, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Kaipeng Zhang, Tong He

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

Comments https://yangzhou24.github.io/OmniWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14051 2025-09-23 cs.CV 83%

PROFUSEme: PROstate Cancer Biochemical Recurrence Prediction via FUSEd Multi-modal Embeddings

Suhang You, Carla Pitarch-Abaigar, Sanket Kachole, Sumedh Sonawane, Juhyung Ha, Anish Sudarshan Gada, David Crandall, Rakesh Shiradkar, Spyridon Bakas

机构 * Division of Computational Pathology, Department of Pathology and Laboratory Medicine, Indiana University School of Medicine, Indianapolis, IN, USA(计算病理学部,病理与实验室医学部,印第安纳大学医学院,印第安纳波利斯,印第安纳州,美国) Indiana University Melvin and Bren Simon Comprehensive Cancer Center, Indianapolis, IN, USA(印第安纳大学Melvin和Bren Simon综合癌症中心,印第安纳波利斯,印第安纳州,美国) Luddy School of Informatics, Computing, and Engineering, Indiana University, IN, USA(卢迪信息学、计算与工程学院,印第安纳大学,印第安纳州,美国) Department of Radiology and Imaging Sciences, Indiana University School of Medicine, Indianapolis, IN, USA(放射学与成像科学部,印第安纳大学医学院,印第安纳波利斯,印第安纳州,美国) Department of Biostatistics and Health Data Science, Indiana University School of Medicine, Indianapolis, IN, USA(生物统计学与健康数据科学部,印第安纳大学医学院,印第安纳波利斯,印第安纳州,美国)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 11 pages, 1 figure, method paper for CHIMERA 2025 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20685 2025-09-23 cs.LG cs.AI 83%

Progressive Size-Adaptive Federated Learning: A Comprehensive Framework for Heterogeneous Multi-Modal Data Systems

Sajid Hussain, Muhammad Sohail, Nauman Ali Khan, Naima Iltaf, Ihtesham ul Islam

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

Comments Due to some technical issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15132 2025-09-19 cs.CY cs.CV 83%

From Pixels to Urban Policy-Intelligence: Recovering Legacy Effects of Redlining with a Multimodal LLM

Anthony Howell, Nancy Wu, Sharmistha Bagchi, Yushim Kim, Chayn Sun

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13773 2025-09-18 cs.AI cs.IR 83%

MIRA: Empowering One-Touch AI Services on Smartphones with MLLM-based Instruction Recommendation

Zhipeng Bian, Jieming Zhu, Xuyang Xie, Quanyu Dai, Zhou Zhao, Zhenhua Dong

机构 * Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

Comments Published in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), ACL 2025. Official version: https://doi.org/10.18653/v1/2025.acl-industry.103

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track) ACL 2025 1457-1465

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16405 2025-09-18 cs.MM 83%

EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment

Lancheng Gao, Ziheng Jia, Yunhao Zeng, Wei Sun, Yiming Zhang, Wei Zhou, Guangtao Zhai, Xiongkuo Min

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11112 2025-09-16 cs.NI cs.AI cs.ET cs.IT cs.LG math.IT 83%

Multi-Modal Sensing Aided mmWave Beamforming for V2V Communications with Transformers

Muhammad Baqer Mollah, Honggang Wang, Hua Fang

机构 * University of Massachusetts Dartmouth(马萨诸塞大学达特茅斯分校) Yeshiva University(耶鲁大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

Comments 6 Pages, Accepted to present at 2025 IEEE Global Communications Conference (GLOBECOM), Taipei, Taiwan

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06516 2025-09-16 cs.LG cs.AI 83%

QualityFM: a Multimodal Physiological Signal Foundation Model with Self-Distillation for Signal Quality Challenges in Critically Ill Patients

Zongheng Guo, Tao Chen, Manuela Ferrario

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院) State Key Laboratory of Industrial Control Technology, Zhejiang University(工业控制技术国家重点实验室,浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI

Comments 11 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09307 2025-09-12 cs.CV cs.AI cs.CL cs.MM 83%

Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization

Zhengzhao Lai, Youbin Zheng, Zhenyang Cai, Haonan Lyu, Jinpu Yang, Hongqing Liang, Yan Hu, Benyou Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13923 2025-09-10 cs.AI cs.CL cs.CV cs.MM 83%

PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents

Junjie Wang, Yuxiang Zhang, Minghao Liu, Yin Zhang, Yatai Ji, Weihao Xuan, Nie Lin, Kang Zhu, Zhiqiang Lin, Yiming Ren, Chunyang Jiang, Yiyao Yu, Zekun Wang, Tiezhen Wang, Wenhao Huang, Jie Fu, Qunshu Lin, Yujiu Yang, Ge Zhang, Ruibin Yuan, Bei Chen, Wenhu Chen

机构 * M-A-P

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Technical report v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04180 2025-09-09 cs.CV 83%

Slice-100K: A Multimodal Dataset for Extrusion-based 3D Printing

Anushrut Jignasu, Kelly O. Marshall, Ankush Kumar Mishra, Lucas Nerone Rillo, Baskar Ganapathysubramanian, Aditya Balu, Chinmay Hegde, Adarsh Krishnamurthy

机构 * Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024. For codebase, see https://github.com/idealab-isu/Slice-100K

详情

展开后加载摘要…

URL PDF HTML 收藏