arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9111 篇

2602.22955 2026-02-27 cs.CV cs.AI 81%

MM-NeuroOnco: A Multimodal Benchmark and Instruction Dataset for MRI-Based Brain Tumor Diagnosis

MM-NeuroOnco: 一种多模态基准和指令数据集用于基于MRI的脑肿瘤诊断

Feng Guo, Jiaxiang Liu, Yang Li, Qianqian Shi, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Center for Brain-Inspired Computing Research (CBICR), Department of Precision Instrument, Tsinghua University(脑启发计算研究中心(CBICR)、精密仪器系,清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MM-NeuroOnco提出一个多模态数据集和基准,用于提升基于MRI的脑肿瘤诊断的多模态推理能力,通过生成诊断相关语义提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06008 2026-02-27 cs.CV cs.AI 81%

Detection and Measurement of Hailstones with Multimodal Large Language Models

利用多模态大语言模型检测和测量冰雹

Moritz Alker, David C. Schedl, Andreas Stöckl

机构 * Digital Media Lab University of Applied Sciences Upper Austria(数字媒体实验室 上奥地利应用科学大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 利用多模态大语言模型检测和测量冰雹,通过社交媒体图像实现快速评估

Comments 6 pages, 5 figures, accepted at The 2nd International Conference on Electrical and Computer Engineering Researches

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21225 2026-02-26 cs.CL cs.AI cs.LG 81%

Architecture-Agnostic Curriculum Learning for Document Understanding: Empirical Evidence from Text-Only and Multimodal

文档理解的架构无关课程学习:来自纯文本和多模态的实证证据

Mohammed Hamdan, Vincenzo Dentamaro, Giuseppe Pirlo, Mohamed Cheriet

机构 * 1 Synchromedia Laboratory, \' E cole de Technologie Sup\' e rieure (\' E TS), 1100 Notre-Dame St W, Montreal, QC H3C 1K3, Canada 2 Department of Computer Science, University of Bari Aldo Moro, Via Orabona 4, 70125 Bari, Italy

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过实验证明,渐进式数据调度在文档理解任务中能有效提升效率,尤其在容量受限模型中表现显著,但多模态模型因具备充足归纳偏置而未获明显收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 81%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12815 2026-02-25 cs.CL cs.AI cs.CY cs.MA 81%

Multimodal Multi-Agent Empowered Legal Judgment Prediction

多模态多智能体赋能的法律判决预测

Zhaolu Kang, Junhao Gong, Qingxi Chen, Hao Zhang, Jiaxin Liu, Rong Fu, Zhiyuan Feng, Yuan Wang, Simon Fong, Kaiyue Zhou

机构 * Peking University(北京大学) Chengdu Minto Tech(成都Minto科技) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Macau(澳门大学) Tsinghua university(清华大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出JurisMMA框架,通过多模态多智能体技术提升法律判决预测的准确性,并构建了包含大量司法记录的JurisMM数据集,验证了其在法律领域应用的广泛有效性。

Comments Accepted to the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05137 2026-02-25 cs.CV cs.AI 81%

FedGIN: Federated Learning with Dynamic Global Intensity Non-linear Augmentation for Organ Segmentation using Multi-modal Images

FedGIN: 一种用于多模态图像器官分割的联邦学习动态全局强度非线性增强

Sachin Dudda Nagaraju, Ashkan Moradi, Bendik Skarre Abrahamsen, Mattijs Elschot

机构 * Department of Circulation and Medical Imaging(循证医学与影像学系) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FedGIN通过动态全局强度非线性增强模块,在不共享原始数据的情况下实现多模态器官分割,提升跨模态泛化能力。

Comments Paper Accepted at MICCAI 2025 DeCaf Workshop Track

Journal ref MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19562 2026-02-24 cs.AI cs.CV 81%

A Multimodal Framework for Aligning Human Linguistic Descriptions with Visual Perceptual Data

一种多模态框架,用于将人类语言描述与视觉感知数据对齐

Joseph Bingham

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态框架,通过结合语言和视觉信息,实现了对人类指称行为的稳健建模,并在经典认知基准上取得了优于人类的表现。

Comments 19 Pages, 6 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 81%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18880 2026-02-24 cs.CV cs.AI 81%

FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model

FOCA:基于多模态大语言模型的频率导向跨域伪造检测、定位与解释

Zhou Liu, Tonghua Su, Hongshi Zhang, Fuxiang Yang, Donglin Di, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) DZ-Matrix Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) University of New South Wales(新南威尔士大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FOCA通过多模态大语言模型整合空间与频域特征,实现图像伪造的高精度检测、定位及可解释性解释,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05761 2026-02-24 cs.AI cs.CL 81%

Early Multimodal Prediction of Cross-Lingual Meme Virality on Reddit: A Time-Window Analysis

早期多模态预测跨语言Reddit迷因病毒性:时间窗口分析

Sedat Dogan, Nina Dethlefs, Debarati Chakraborty

机构 * School of Computer Science, University of Hull(赫尔大学计算机科学学院) Loughborough University(洛桑大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于多模态特征的迷因病毒性预测方法,通过时间窗口分析展示早期预测的可行性,并揭示了网络和时间特征对突破内容限制的重要性。

Comments Accepted to ACM WebSci 2026. 10 pages, 9 fiures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14879 2026-02-20 cs.CV cs.AI 81%

CT-Bench: A Benchmark for Multimodal Lesion Understanding in Computed Tomography

CT-Bench:一种用于CT中多模态病变理解的基准测试

Qingqing Zhu, Qiao Jin, Tejas S. Mathai, Yin Fang, Zhizheng Wang, Yifan Yang, Maame Sarfo-Gyamfi, Benjamin Hou, Ran Gu, Praveen T. S. Balamuralikrishna, Kenneth C. Wang, Ronald M. Summers, Zhiyong Lu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 CT-Bench是一个用于CT多模态病变理解的基准测试,包含病变图像和元数据集以及多任务视觉问答基准测试,通过评估多种多模态模型并展示其在临床中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12254 2026-02-18 cs.CV cs.AI cs.LG 81%

MMS-VPR: Multimodal Street-Level Visual Place Recognition Dataset and Benchmark

MMS-VPR:多模态街道级视觉地点识别数据集和基准

Yiwei Ou, Xiaobin Ren, Ronggui Sun, Guansong Gao, Kaiqi Zhao, Manfredo Manfredini

机构 * The University of Auckland(奥克兰大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMS-VPR提出一个大规模多模态数据集和基准,用于行人环境中的街道级视觉地点识别,整合了多模态数据和统一评估平台。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14285 2026-02-17 cs.DL cs.AI cs.CL cs.LG 81%

FMMD: A multimodal open peer review dataset based on F1000Research

FMMD:基于F1000Research的多模态开放同行评审数据集

Zhenzhen Zhuang, Yuqing Fu, Jing Zhu, Zhangping Zhou, Jialiang Lin

机构 * School of Computer Science and Engineering, Guangzhou Institute of Science and Technology(计算机科学与工程学院,广州科学与技术研究所) College of Foreign Languages and Cultures, Xiamen University(外语学院,厦门大学) Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology(科学与教育评估实验室,广州科学与技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 FMMD是一个基于F1000Research的多模态开放同行评审数据集,旨在通过整合多模态数据和版本特定的评审信息,填补现有数据集在同行评审与稿件演变关系上的空白。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14462 2026-02-17 cs.CV cs.CL 81%

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

RAVENEA:多模态检索增强视觉文化理解的基准

Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie

机构 * University of Copenhagen(哥本哈根大学) ETH Zürich(苏黎世联邦理工学院) University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 RAVENEA通过多模态检索增强方法提升视觉文化理解,验证了文化注释对多模态检索和下游任务的增强效果,并揭示了不同国家间性能差异。

Comments ICLR 2026; Project page: https://jiaangli.github.io/ravenea/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19176 2026-02-16 eess.IV cs.AI cs.CV 81%

Augmented Intelligence for Multimodal Virtual Biopsy in Breast Cancer Using Generative Artificial Intelligence

增强智能用于乳腺癌多模态虚拟活检的生成式人工智能

Aurora Rofena, Claudia Lucia Piccolo, Bruno Beomonte Zobel, Paolo Soda, Valerio Guarrasi

机构 * Department of Radiology, Fondazione Policlinico Campus Bio-Medico(放射学系,政策临床医学院) Department of Radiology, Università Campus Bio-Medico di Roma(放射学系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅拉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于生成式人工智能的多模态虚拟活检方法,整合FFDM和CESM模态以提高乳腺病变分类准确性,并公开数据集促进研究进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 81%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10886 2026-02-12 cs.CL cs.AI cs.CE 81%

The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems

CLEF-2026金融多语言多模态评估实验室:金融AI系统的多语言多模态评估框架

Zhuohan Xie, Rania Elbadry, Fan Zhang, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Dimitar Dimitrov, Vanshikaa Jani, Yuyang Dai, Jiahui Geng, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Preslav Nakov

机构 * MBZUAI The University of Tokyo(东京大学) The Fin AI(Fin AI) University of Arizona(亚利桑那大学) INSAIT

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CLEF-2026金融多语言多模态评估实验室提出首个多语言多模态金融AI评估框架,涵盖金融理解、推理和决策三个任务,旨在推动全球包容的金融AI发展。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10799 2026-02-12 cs.CV cs.AI 81%

RSHallu: Dual-Mode Hallucination Evaluation for Remote-Sensing Multimodal Large Language Models with Domain-Tailored Mitigation

RSHallu: 远程传感多模态大语言模型的双模式幻觉评估与领域定制缓解

Zihui Zhou, Yong Feng, Yanying Chen, Guofan Duan, Zhenxi Song, Mingliang Zhou, Weijia Jia

机构 * College of Computer Science, Chongqing University(重庆大学计算机科学学院) Heavy Rainfall Research Center of China(中国强降水研究中心) CMA Key Open Laboratory of Transforming Climate Resources to Economy, Chongqing Institute of Meteorological Sciences(中国气象局气候资源转化经济重点开放实验室、重庆气象科学研究院) Chongqing Metropolitan College of Science(重庆科学理工学院) School of Intelligence Science(智能科学学院) College of Artificial Intelligence, Harbin Institute of Technology(人工智能学院、哈尔滨工业大学) BNU-UIC Institute of Artificial Intelligence(北京师范大学-国际学院人工智能与未来网络研究院) Future Networks, Beijing Normal University at Zhuhai(未来网络、北京师范大学珠海分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 RSHallu通过双模式检查和领域定制数据集,提升遥感多模态大语言模型的幻觉缓解效果,提高无幻觉率21.63个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 81%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09315 2026-02-11 cs.CV cs.AI 81%

A Deep Multi-Modal Method for Patient Wound Healing Assessment

一种用于患者伤口愈合评估的深度多模态方法

Subba Reddy Oota, Vijay Rowtula, Shahid Mohammed, Jeffrey Galitz, Minghsun Liu, Manish Gupta

机构 * Woundtech Innovative Healthcare Solutions(Woundtech创新医疗解决方案) Microsoft AI Research(微软人工智能研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种深度多模态方法,通过整合伤口变量和图像数据,预测患者住院风险,以提高伤口诊断效率和早期发现愈合问题。

Comments 4 pages, 2 figures

Journal ref Medical Imaging Meets NeurIPS Workshop, 33rd Conference on Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07068 2026-02-10 eess.IV cs.AI cs.CV 81%

MRI Cross-Modal Synthesis: A Comparative Study of Generative Models for T1-to-T2 Reconstruction

MRI跨模态合成:生成模型在T1到T2重建中的比较研究

Ali Alqutayfi, Sadam Al-Azani

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文比较了Pix2Pix GAN、CycleGAN和VAE在T1到T2 MRI重建中的性能,发现CycleGAN在PSNR和SSIM上表现最佳,而VAE在潜在空间表示上有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05515 2026-02-06 cs.AI cs.CL 81%

A Unified Multimodal Framework for Dataset Construction and Model-Based Diagnosis of Ameloblastoma

一种统一的多模态框架用于数据集构建和基于模型的ameloblastoma诊断

Ajo Babu George, Anna Mariam John, Athul Anoop, Balu Bhasuran

机构 * DiceMed School of Sciences (SOS), Indira Gandhi National Open University(印度甘地国家开放大学科学学院) School of Information, Florida State University(佛罗里达州立大学信息学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种统一的多模态框架,用于构建ameloblastoma数据集并开发基于模型的诊断方法,通过多模态深度学习模型提高分类和手术规划的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04416 2026-02-05 cs.CV cs.AI 81%

Med-MMFL: A Multimodal Federated Learning Benchmark in Healthcare

Med-MMFL:医疗领域的多模态联邦学习基准

Aavash Chhetri, Bibek Niroula, Pratik Shrestha, Yash Raj Shrestha, Lesley A Anderson, Prashnna K Gyawali, Loris Bazzani, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) NepAl Applied Mathematics and Informatics Institute for research, Nepal(尼泊尔应用数学与信息学研究所) University of Lausanne(洛桑大学) West Virginia University(西弗吉尼亚大学) University of Verona(威尼斯大学) University College London(伦敦大学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Med-MMFL是首个医疗领域多模态联邦学习基准,涵盖多种模态和任务,评估六种先进算法以推动医疗多模态联邦学习的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01541 2026-02-03 cs.CV cs.AI 81%

Toward Cognitive Supersensing in Multimodal Large Language Model

迈向多模态大语言模型的认知超感知

Boyi Li, Yifan Shen, Yuanzhe Liu, Yifan Xu, Jiateng Liu, Xinzhuo Li, Zhengyuan Li, Jingyuan Zhu, Yunhan Zhong, Fangzhou Lan, Jianguo Cao, James M. Rehg, Heng Ji, Ismini Lourentzou, Xu Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 81%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19702 2026-01-28 eess.AS cs.AI 81%

SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation

SAM音频裁判:一种用于音频分离感知评估的统一多模态框架

Helin Wang, Bowen Shi, Andros Tjandra, John Hoffman, Yi-Chiao Wu, Apoorv Vyas, Najim Dehak, Ann Lee, Wei-Ning Hsu

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 SAM Audio Judge 提出了一种多模态细粒度参考自由客观指标,用于评估音频分离的感知性能,支持多种音频领域和输入类型,具有高一致性与实际应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18464 2026-01-27 cs.CV cs.AI 81%

Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System

Fair-Eye Net:一种公平、可信的多模态集成青光眼全流程人工智能系统

Wenbin Wei, Suyuan Yao, Cheng Huang, Xiangyu Gao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Fair-Eye Net通过多模态融合和公平性优化,实现青光眼全流程AI系统,提升诊断准确性与公平性,助力全球眼科健康公平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18250 2026-01-27 cs.CV cs.AI 81%

A multimodal vision foundation model for generalizable knee pathology

一种用于通用膝部病理的多模态视觉基础模型

Kang Yu, Dingyu Wang, Zimu Yuan, Nan Zhou, Jiajun Liu, Jiaxin Liu, Shanggui Liu, Yaoyan Zheng, Huishu Yuan, Di Huang, Dong Jiang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 OrthoFoundation是一种多模态视觉基础模型,通过自监督学习在膝关节影像上实现高泛化能力,提升骨科影像诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 81%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15487 2026-01-23 cs.AI cs.CL cs.MA 81%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏