arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2512.05959 2026-03-24 cs.CL cs.AI cs.CV 82%

M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG

M4-RAG:大规模多语言多文化多模态检索增强生成

David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata

机构 * Stanford University(斯坦福大学) MBZUAI Indian Institute of Science(印度科学研究院) Ontario Tech University(安大略技术大学) University of Toronto(多伦多大学) Capital One

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 M4-RAG提出一个覆盖42种语言、56种方言和189个国家的多模态大规模基准,通过构建8万多个文化多样化的图像-问题对,评估跨语言和模态的检索增强视觉问答性能,揭示模型大小与检索效果的不匹配问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21700 2026-03-24 cs.CV 79%

PPGL-Swarm: Integrated Multimodal Risk Stratification and Hereditary Syndrome Detection in Pheochromocytoma and Paraganglioma

PPGL-Swarm:集成多模态风险分层与遗传综合征检测的pheochromocytoma和paraganglioma诊断系统

Zelin Liu, Xiangfu Yu, Jie Huang, Ge Wang, Yizhe Yuan, Zhenyu Yi, Jing Xie, Haotian Jiang, Lichi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ruijin Hospital(瑞金医院) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PPGL-Swarm系统,通过多模态证据整合实现全面诊断报告,包括自动化GAPP评分、基因风险警报及可追溯的推理路径,解决传统诊断方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21245 2026-03-24 cs.CV 79%

CornOrb: A Multimodal Dataset of Orbscan Corneal Topography and Clinical Annotations for Keratoconus Detection

CornOrb:用于角膜变性检测的多模态数据集

Mohammed El Amine Lazouni, Leila Ryma Lazouni, Zineb Aziza Elaouaber, Mohammed Ammar, Sofiane Zehar, Mohammed Youcef Bouayad Agha, Ahmed Lazouni, Amel Feroui, Ali H. Al-Timemy, Siamak Yousefi, Mostafa El Habib Daho

机构 * Biomedical Engineering Laboratory(生物医学工程实验室) Abou Bakr Belkaid University(阿布·巴克·贝卡伊大学) LIST Laboratory(LIST实验室) M’Hamed Bougara Boumerdes University(穆哈梅德·布加拉 Boumerdes 大学) Lazouni Clinic(拉祖尼诊所) University of Western Brittany LaTIM UMR1101(西 Brittany 大学 LaTIM UMR1101) Inserm Brest(里尔 Brest 研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 CornOrb数据集包含744名患者1454只眼的多模态数据,包括889只正常眼和565例角膜变性病例,提供四类角膜图谱及结构化表格数据,用于支持AI驱动的角膜变性检测与分析。

Comments Preprint, 9 pages, 4 figures, dataset paper. Corresponding author: mostafa.elhabibdaho@univ-brest.fr

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 79%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20442 2026-03-24 cs.LG cs.AI 79%

Detecting Neurovascular Instability from Multimodal Physiological Signals Using Wearable-Compatible Edge AI: A Responsible Computational Framework

通过可穿戴设备的边缘AI检测神经血管不稳定性:一种负责任的计算框架

Truong Quynh Hoa, Hoang Dinh Cuong, Truong Xuan Khanh

机构 * H&K Research Studio, Clevix LLC(H&K研究室,Clevix LLC) Department of Cardiology, Hanoi Heart Hospital(心血管科,河内心脏医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Melaguard框架,通过融合多种生理信号检测神经血管不稳定性,优于单一模态设备,通过三阶段验证提升检测性能。

Comments 11 pages, 8 figures, 6 tables. Submitted to IEEE JBHI. Code: https://github.com/ClevixLab/Melaguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16753 2026-03-24 cs.CL 79%

GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs

GAICo:一个用于评估多样化和多模态生成式人工智能输出的部署和可扩展框架

Nitin Gupta, Pallav Koppisetti, Kausik Lakkaraju, Biplav Srivastava

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 GAICo提供统一框架,支持多种参考指标,用于评估生成式AI输出,提升评估标准化和可复现性,加速AI系统开发。

Comments 11 pages, 7 figures; accepted at IAAI/AAAI 2026; (updated) extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21092 2026-03-24 cs.NI 78%

Generative Artificial Intelligence Assisted Multi-modal Semantic Extraction for NOMA-based Image Transmissions

生成式人工智能辅助的多模态语义提取用于基于NOMA的图像传输

Songhan Zhao, Shimin Gong, Bo Gu, Hongyang Du, Xidong Mu, Zehui Xiong, Yuming Fang

专题命中 多模态评测 :multi-modal(title);cross-modal(abstract)

AI总结 本文提出利用生成式人工智能辅助的多模态语义提取方法,结合NOMA技术优化图像传输,通过联合优化语义特征选择和传输控制提升恢复性能与传输效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02763 2026-03-24 cs.CV 77%

ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration

ClearAIR: 一种受人类视觉感知启发的全能图像修复框架

Xu Zhang, Huan Zhang, Guoli Wang, Qian Zhang, Lefei Zhang

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ClearAIR,受人类视觉感知启发,采用分层粗到细的修复策略,通过多模态大语言模型进行整体评估,并引入区域意识和任务识别流程,提升图像修复精度与细节恢复能力。

Comments Accepted to AAAI 2026. Project page: https://github.com/House-yuyu/ClearAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20536 2026-03-24 cs.LG 71%

Towards Practical Multimodal Hospital Outbreak Detection

迈向实用的多模态医院暴发检测

Chang Liu, Jieshi Chen, Alexander J. Sundermann, Kathleen Shutt, Marissa P. Griffith, Lora Lee Pless, Lee H. Harrison, Artur W. Dubrawski

机构 * Auton Lab, Carnegie Mellon University(自主实验室,卡内基梅隆大学) Microbial Genomic Epidemiology Laboratory, Center for Genomic Epidemiology, University of Pittsburgh(微生物基因组流行病学实验室,流行病学研究中心,匹兹堡大学) Division of Infectious Diseases, University of Pittsburgh School of Medicine(传染病科,匹兹堡大学医学院) Department of Epidemiology, School of Public Health, University of Pittsburgh(流行病学系,公共卫生学院,匹兹堡大学)

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出利用多模态数据提升医院暴发检测效率,通过机器学习整合质谱、抗菌谱和电子病历数据,提高检测性能并减少全基因组测序依赖。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11026 2026-03-24 cs.CV 70%

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

GIR-Bench:用于生成图像的多功能基准

Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17495 2026-03-24 cs.CV 57%

GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation

GroundingME:通过多维评估揭示MLLMs中的视觉 grounding 隙

Rang Li, Lei Li, Shuhuai Ren, Hao Tian, Shuhao Gu, Shicheng Li, Zihao Yue, Yudong Wang, Wenhan Ma, Zhe Yang, Jingyuan Ma, Zhifang Sui, Fuli Luo

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) LLM-Core Xiaomi(小米LLM-Core) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GroundingME基准,通过四个维度评估MLLMs的视觉 grounding 能力,揭示其在区分相似物体、理解空间关系、处理遮挡和拒绝无解查询方面的不足,发现最佳模型仅达到45.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20807 2026-03-24 cs.CL 57%

BenchBench: Benchmarking Automated Benchmark Generation

BenchBench:自动化基准生成的评估

Yandan Zheng, Haoran Luo, Zhenghong Lin, Wenjin Liu, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 BenchBench通过三阶段流程评估自动化基准生成能力,生成16.7K问题并评估模型-问题响应质量,揭示基准设计与回答能力的弱相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20669 2026-03-24 cs.RO cs.CV 57%

ToFormer: Towards Large-scale Scenario Depth Completion for Lightweight ToF Camera

ToFormer:面向大规模场景深度补全的轻量级ToF相机

Juncheng Chen, Tiancheng Lai, Xingpeng Wang, Bingxin Liao, Baozhe Zhang, Chao Xu, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber Systems and Control, Zhejiang University, Hangzhou, China(浙江大学工业控制技术状态重点实验室,系统与控制研究所,杭州,中国) Huzhou Institute of Zhejiang University, Huzhou, China(浙江大学湖州研究院,湖州,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出全栈框架,通过多传感器平台收集大规模真实世界ToF样本,构建首个LASER-ToF数据集,并设计传感器感知深度补全网络,结合3D-2D联合传播池和多模态交叉协方差注意力模块,提升非均匀ToF深度稀疏性下的建模效果和3D-2D融合效率,实现轻量级部署和大规模场景映射。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17508 2026-03-24 cs.CV 57%

Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation

Omni-I2C:一个全面的图像到代码生成基准测试

Jiawei Zhou, Chi Zhang, Xiang Feng, Qiming Zhang, Haibo Qiu, Lihuo He, Dengpan Ye, Xinbo Gao, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Independent Researcher(独立研究者) Xidian University(西安电子科技大学) Guangzhou University(广州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-I2C基准测试,评估大多模态模型将复杂数字图形转化为可执行代码的能力,揭示当前模型在视觉感知与生成表达方面的协同挑战及性能差距。

Comments 35 pages, 26 figures, change authors' information in page 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20325 2026-03-24 cs.CV 57%

DCG-Net: Dual Cross-Attention with Concept-Value Graph Reasoning for Interpretable Medical Diagnosis

DCG-Net:双交叉注意力与概念-值图推理用于可解释的医学诊断

Getamesay Dagnaw, Xuefei Yin, Muhammad Hassan Maqsood, Yanming Zhu, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology(信息与通信技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 DCG-Net通过双交叉注意力和概念-值图推理,提升医学诊断的可解释性,实现白血球形态和皮肤病变诊断的高精度分类。

Journal ref ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20289 2026-03-24 cs.CV 57%

Remote Sensing Image Dehazing: A Systematic Review of Progress, Challenges, and Prospects

遥感图像去雾:进展、挑战与前景的系统综述

Heng Zhou, Xiaoxiong Liu, Zhenxi Zhang, Jieheng Yun, Chengyang Li, Yunchu Yang, Dongyi Xia, Chunna Tian, Xiao-Jun Wu

机构 * School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Josef Kittler Research Institute on Artificial Intelligence(乔塞夫·基特勒人工智能研究所) School of Electronic Engineering(电子工程学院) College of Artificial Intelligence(人工智能学院) Aerospace Information Research Institute(航天信息研究所) Department of Computer Science(计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文系统综述了遥感图像去雾的研究进展、挑战与前景,总结了超过30种方法,分析了不同模型在性能上的差异,并提出了未来研究方向。

Comments 82 pages, 23 figures,

Journal ref ISPRS P&RS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21263 2026-03-24 cs.SE 50%

From Natural Language to Executable Properties for Property-based Testing of Mobile Apps

从自然语言到可执行属性:用于移动应用基于属性测试的可执行属性

Yiheng Xiong, Ting Su, Jingling Sun, Jue Wang, Qin Li, Geguang Pu, Zhendong Su

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种新的结构化属性合成方法,将自然语言属性描述自动转换为可执行属性,并通过iPBT工具验证,展示了其在提升测试效率和鲁棒性方面的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20721 2026-03-24 cs.LG math.ST stat.ML stat.TH 50%

Scaling Laws are Redundancy Laws

缩放定律是冗余定律

Yuda Bi, Vince D Calhoun

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文通过核回归证明缩放定律可形式化为冗余定律,揭示学习曲线斜率依赖数据冗余,统一了经验观察与理论基础。

Comments This is not a serious research at this time

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03467 2026-03-24 cs.IT cs.CR cs.LG eess.SP math.IT stat.ME 50%

Differentially Private Distribution Release of Gaussian Mixture Models via KL-Divergence Minimization

基于KL散度最小化的高斯混合模型差分隐私分布发布

Hang Liu, Anna Scaglione, Sean Peisert

机构 * State Key Laboratory of Internet of Things for Smart City and the Department of Electrical and Computer Engineering, University of Macau(物联网智能城市国家重点实验室和澳门大学电子与计算机工程系) Department of Electrical and Computer Engineering, Cornell Tech, Cornell University(电气与计算机工程系,康奈尔科技,康奈尔大学) Computing Sciences Research, Lawrence Berkeley National Laboratory(计算科学研究所,劳伦斯伯克利国家实验室)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出通过KL散度度量高斯混合模型发布精度,结合差分隐私机制,在保证隐私安全的同时保持模型效用。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏