arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-05 至 2026-03-05 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 17 篇

2603.03939 2026-03-05 cs.CV cs.AI 88%

Cross-Modal Mapping and Dual-Branch Reconstruction for 2D-3D Multimodal Industrial Anomaly Detection

跨模态映射与双分支重建用于2D-3D多模态工业异常检测

Radia Daci, Vito Renò, Cosimo Patruno, Angelo Cardellicchio, Abdelmalik Taleb-Ahmed, Marco Leo, Cosimo Distante

机构 * CNR-ISASI, Institute of Applied Sciences and Intelligent Systems / National Research Council of Italy(CNR-ISASI应用科学与智能系统研究所/意大利国家研究理事会) CNR-STIIMA, Institute of Intelligent Industrial Technologies and Systems for Advanced Manufacturing(CNR-STIIMA智能工业技术与系统先进制造研究所) Institute d'Electronique de Microelectronique et de Nanotechnologie (IEMN) / Universite Polytechnique Hauts de France(微电子与纳米技术研究所(IEMN)/法国高等法国理工学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 CMDR-IAD通过跨模态映射与双分支重建实现2D-3D多模态工业异常检测,具有轻量、模态灵活和高鲁棒性的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03437 2026-03-05 cs.CV 84%

Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning

超越准确率:评估多模态医学推理中的视觉语义

Anas Zafar, Leema Krishna Murali, Ashish Vashist

机构 * The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Cohere Labs(Cohere实验室) Eisai Inc.(艾伯维公司) Indian Institute of Science, Bangalore(班加罗尔印度科学研究院)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 该研究提出反事实评估框架,通过测量视觉依赖性得分和幻觉视觉推理率,揭示仅文本强化学习在多模态医学推理中降低视觉依赖性的问题。

Comments 12 pages, 2 figures, 2 tables, medical VQA / multimodal reasoning evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03618 2026-03-05 cs.CV 83%

CoRe-BT: A Multimodal Radiology-Pathology-Text Benchmark for Robust Brain Tumor Typing

CoRe-BT:一种多模态放射科-病理科-文本基准,用于鲁棒性脑肿瘤分类

Juampablo E. Heras Rivera, Daniel K. Low, Xavier Xiong, Jacob J. Ruzevick, Daniel D. Child, Wen-wai Yim, Mehmet Kurt, Asma Ben Abacha

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Microsoft Health AI(微软健康人工智能)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 CoRe-BT提出一个多模态基准,用于在缺失模态条件下提升脑肿瘤分类的鲁棒性,通过整合MRI、病理图像和报告,推动多模态学习与表示学习的发展。

Comments Under review, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI 81%

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 81%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16985 2026-03-05 cs.CV cs.AI cs.LG cs.RO 81%

Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation

极简多模态异常合成用于分布外检测与分割

Moru Liu, Hao Dong, Jessica Kelly, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所) EPFL(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出极简多模态异常合成方法Feature Mixing,通过理论支持提升OOD检测性能,实验表明其在多个数据集上达到最优效果,速度提升显著。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI 79%

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03590 2026-03-05 cs.MA cs.AI 79%

Social Norm Reasoning in Multimodal Language Models: An Evaluation

多模态语言模型中的社会规范推理:一项评估

Oishik Chowdhury, Anushka Debnath, Bastin Tony Roy Savarimuthu

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了多模态大语言模型在社会规范推理中的能力,发现GPT-4o在文本和图像模态中表现最佳,但所有模型在处理复杂规范时仍有困难。

Comments to be published in ICAART 2026 post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15040 2026-03-05 cs.CV cs.CL cs.LG 73%

Composition-Grounded Data Synthesis for Visual Reasoning

基于组成性的数据合成用于视觉推理

Xinyi Gu, Jiayuan Mao, Zhang-Wei Hong, Zhuoran Yu, Pengyuan Li, Dhiraj Joshi, Rogerio Feris, Zexue He

机构 * MIT(麻省理工学院) UW-Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 COGS通过分解种子问题并重新组合生成合成数据,提升MLLMs在图表和网页等人工图像领域的推理能力。

Comments ICLR2026 camera-ready version. Project page: https://cogsynthesis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07957 2026-03-05 astro-ph.IM astro-ph.HE 67%

In-Orbit GRB Identification Using LLM-based model for the CXPD CubeSat

利用基于大语言模型的模型进行轨道上伽马射线暴识别

Cunshi Wang, Zuke Feng, Difan Yi, Yuyang Li, Lirong Xie, Huanbo Feng, Yi Liu, Qian Liu, Yang Huang, Hongbang Liu, Xinyu Qi, Yangheng Zheng, Ali Luo, Guirong Xue, Jifeng Liu

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 本文提出基于大语言模型的轨道上伽马射线暴识别方法,通过模拟数据训练模型,实现高精度分类和光谱指数估计,为未来轨道上实时GRB检测提供技术基础。

Comments 16 pages, 8 figures, accepted by RAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03983 2026-03-05 cs.CV cs.AI 62%

GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery

GeoSeg: 无需训练的推理驱动遥感图像分割

Lifan Jiang, Yuhang Pei, oxi Wu, Yan Zhao, Tianrun Wu, Shulong Yu, Lihui Zhang, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University UniTTEC Co. Ltd. Wuchan Zhongda Chengtou (Ningbo) Holdings. Ltd.

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GeoSeg通过结合大规模语言模型推理与精确定位,无需训练实现遥感图像分割的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01222 2026-03-05 cs.CL cs.AI 62%

WebDS: An End-to-End Benchmark for Web-based Data Science

WebDS: 一种端到端的基于网络的数据科学基准

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexander Spangher, Shikhar Murty, Tenghao Huang, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Pinetree Research(Pinetree研究公司) University of California, Berkeley(加州大学伯克利分校) Singapore University of Technology and Design(新加坡科技设计大学) University of Southern California(南加州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 WebDS提出了一种端到端的基于网络的数据科学基准,旨在评估代理在复杂多步骤任务中的表现,揭示当前LLM在实际数据科学任务中的性能差距。

Comments 14 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06512 2026-03-05 cs.CV cs.AI 62%

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

Merlin:一种计算断层扫描视觉-语言基础模型和数据集

Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Department of Electrical Engineering(电气工程系) University of California Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Merlin是一种基于3D视觉-语言模型的医学影像分析工具,通过多阶段预训练框架,实现了对腹部CT扫描、电子健康记录和放射科报告的综合学习,提升了医学影像分析的自动化水平。

Comments Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03315 2026-03-05 cs.CL cs.AI cs.LG 62%

M-QUEST -- Meme Question-Understanding Evaluation on Semantics and Toxicity

M-QUEST -- 周期性问题理解评估在语义和毒性上

Stefano De Giorgis, Ting-Chih Chen, Filip Ilievski

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 M-QUEST提出一个语义框架和基准,用于自动提取迷因知识,评估模型在毒性理解上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04244 2026-03-05 cs.SE cs.AI cs.HC 57%

FeedAIde: Guiding App Users to Submit Rich Feedback Reports by Asking Context-Aware Follow-Up Questions

FeedAIde: 通过提问情境感知的后续问题引导应用用户提交丰富的反馈报告

Ali Ebrahimi Pourasad, Meyssam Saghiri, Walid Maalej

机构 * University of Hamburg(汉堡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 FeedAIde通过情境感知和生成式AI技术,帮助用户更高效地提交详细反馈报告,提升开发人员获取信息的价值。

Comments Accepted for publication at the 13th International Conference on Mobile Software Engineering and Systems (MOBILESoft) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04238 2026-03-05 cs.CL 57%

Retrieval or Representation? Reassessing Benchmark Gaps in Multilingual and Visually Rich RAG

检索还是表示?重新评估多语言和视觉丰富的RAG基准差距

Martin Asenov, Kenza Benkirane, Dan Goldwater, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel AI实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 该研究通过系统分析发现,文档表示质量是多语言和视觉丰富RAG基准提升的主要因素,而非检索方法改进。

Comments ICLR 2026 Workshop I Can't Believe It's Not Better: Where Large Language Models Need to Improve

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03284 2026-03-05 cs.AI 57%

ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools

ToolVQA: 一个用于多步推理VQA的外部工具数据集

Shaofeng Yin, Ting Lei, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ToolVQA是一个用于多步推理VQA的外部工具数据集,通过真实场景和复杂推理任务提升模型在现实工具使用中的泛化能力。

Comments Project page: https://fugtemypt123.github.io/ToolVQA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏