arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-27 至 2026-02-27 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2509.04403 2026-02-27 cs.CV cs.CL cs.CR 84%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22955 2026-02-27 cs.CV cs.AI 81%

MM-NeuroOnco: A Multimodal Benchmark and Instruction Dataset for MRI-Based Brain Tumor Diagnosis

MM-NeuroOnco: 一种多模态基准和指令数据集用于基于MRI的脑肿瘤诊断

Feng Guo, Jiaxiang Liu, Yang Li, Qianqian Shi, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Center for Brain-Inspired Computing Research (CBICR), Department of Precision Instrument, Tsinghua University(脑启发计算研究中心(CBICR)、精密仪器系,清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MM-NeuroOnco提出一个多模态数据集和基准,用于提升基于MRI的脑肿瘤诊断的多模态推理能力,通过生成诊断相关语义提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06008 2026-02-27 cs.CV cs.AI 81%

Detection and Measurement of Hailstones with Multimodal Large Language Models

利用多模态大语言模型检测和测量冰雹

Moritz Alker, David C. Schedl, Andreas Stöckl

机构 * Digital Media Lab University of Applied Sciences Upper Austria(数字媒体实验室 上奥地利应用科学大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 利用多模态大语言模型检测和测量冰雹,通过社交媒体图像实现快速评估

Comments 6 pages, 5 figures, accepted at The 2nd International Conference on Electrical and Computer Engineering Researches

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22843 2026-02-27 cs.CV 79%

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

打破多模态知识驱动视觉问答中的视觉捷径

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24449 2026-02-27 cs.CL 79%

When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations

当大多模态模型面对不断演变的知识:挑战与探索

Kailin Jiang, Yuntao Du, Yukai Ding, Yuchen Ren, Ning Jiang, Zhi Gao, Zilong Zheng, Lei Liu, Bin Li, Qing Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MMEVOKE基准,探讨了多模态模型在动态演变知识注入中的挑战,并提出知识增强和保留方法以提升注入性能和缓解能力退化。

Comments ICLR 2026, Project Page: https://evoke-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23286 2026-02-27 cs.CL cs.AI cs.DB cs.IR 62%

SPARTA: Scalable and Principled Benchmark of Tree-Structured Multi-hop QA over Text and Tables

SPARTA:可扩展且原则性的树状多跳问答基准

Sungho Park, Jueun Kim, Wook-Shin Han

机构 * POSTECH

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 SPARTA通过自动生成大规模表格-文本问答基准测试,揭示了跨模态推理的深层缺陷。

Comments 10 pages, 5 figures. Published as a conference paper at ICLR 2026. Project page: https://sparta-projectpage.github.io/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23363 2026-02-27 cs.CV 57%

MediX-R1: Open Ended Medical Reinforcement Learning

MediX-R1:开放端医疗强化学习

Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Omair Mohamed, Mohamed Zidan, Fahad Khan, Salman Khan, Rao Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈赫迈德·本·扎耶德人工智能大学) Jubilee Mission Medical College(jubilee mission 医学院) Research Institute(研究院) JJM Medical College(JJM 医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MediX-R1通过综合奖励信号和LLM评估,实现医疗多模态模型的开放端强化学习,提升临床推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22426 2026-02-27 cs.CV cs.LG 57%

SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read

SimpleOCR: 将可视化问题呈现以教导大语言模型阅读

Yibo Peng, Peng Xia, Ding Zhong, Kaide Zeng, Siwei Han, Yiyang Zhou, Jiaqi Liu, Ruiyi Zhang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SimpleOCR通过强制模型视觉参与,解决多模态大语言模型在图像中阅读文本的性能问题,提升模型的视觉文本提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12439 2026-02-27 cs.LG 50%

Beyond Attribution: Unified Concept-Level Explanations

超越归因:统一的概念层面解释

Junhao Liu, Haonan Yu, Xin Zhang

机构 * School of Computer Science, Peking University, Beijing 100871, China(北京大学计算机科学学院) Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学))

专题命中 多模态评测 :multimodal(abstract)

AI总结 UNCLE框架通过扩展局部模型无关方法,提供统一的概念层面解释,提升解释的忠实度和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22416 2026-02-27 cs.HC 50%

Seeing Graphs Like Humans: Benchmarking Computational Measures and MLLMs for Similarity Assessment

像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试

Seokweon Jung, Jeongmin Rhee, Seoyoung Doh, Hyeon Jeon, Ghulam Jilani Quadri, Jinwook Seo

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。

Comments 21 pages including 1 page of appendix, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏