arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-27 至 2026-04-27 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2504.06148 2026-04-27 cs.CV 83%

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架

Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) Central South University(中南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07632 2026-04-27 cs.AI cs.CL cs.CV cs.LG 83%

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

测试时匹配:在多模态模型中解锁组合推理

Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出测试时匹配算法,通过改进评估指标提升多模态模型的组合推理能力,使SigLIP-B16和GPT-4.1在Winoground等基准上取得新突破。

Comments To appear at ICLR 2026; extended results to generative multimodal models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 81%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07038 2026-04-27 cs.CV cs.CL 81%

UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents

UNIKIE-BENCH:用于视觉文档中关键信息提取的大型多模态模型基准测试

Yifan Ji, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Qian Zhang, Zhibo Yang, Junyang Lin, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出UNIKIE-BENCH基准,用于评估大型多模态模型在视觉文档关键信息提取中的性能,揭示了不同场景下模型的性能差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05231 2026-04-27 cs.RO cs.AI 79%

Kaiwu: A Multimodal Manipulation Dataset and Framework for Robot Learning and Human-Robot Interaction

Kaiwu:一种用于机器人学习和人机交互的多模态操控数据集和框架

Shuo Jiang, Haonan Li, Ruochen Ren, Yanmin Zhou, Zhipeng Wang, Bin He

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Kaiwu多模态数据集,解决复杂装配场景中缺失的真实同步多模态数据问题,通过20名受试者和30个交互对象,记录11,664个整合动作实例,支持机器人学习、精细操作、人类意图研究和人机协作。

Comments 8 pages, 5 figures, Submitted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 11, pp. 11482-11489, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22367 2026-04-27 cs.CL cs.AI 62%

CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

CNSL-bench:用于评估多模态大语言模型在中文国家手语理解能力的基准

Rui Zhao, Xuewen Zhong, Xiaoyun Zheng, Jinsong Su, Yidong Chen

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省-台湾非物质文化遗产数字化保护与智能处理重点实验室(XMU),文化和旅游部,中国) National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CNSL-bench,首个评估多模态大语言模型在中文国家手语理解能力的基准,通过权威 grounding、多模态覆盖和手部动作多样性,评估21个模型,发现当前模型在手语理解上仍显著劣于人类表现。

Comments Accepted as the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22333 2026-04-27 cs.CV cs.AI 62%

ChangeQuery: Advancing Remote Sensing Change Analysis for Natural and Human-Induced Disasters from Visual Detection to Semantic Understanding

ChangeQuery: 从视觉检测到语义理解,推动自然灾害和人为灾害的遥感变化分析

Dongwei Sun, Jing Yao, Kan Wei, Xiangyong Cao, Chen Wu, Zhenghui Zhao, Pedram Ghamisi, Jun Zhou, Jón Atli Benediktsson

机构 * School of Computer Science and Technology and the Ministry of Education Key Lab for Intelligent Networks and Network Security, Xi’an Jiaotong University(计算机科学与技术学院和教育部智能网络与网络安全重点实验室,西安交通大学) State Key Laboratory of Remote Sensing and Digital Earth, Aerospace Information Research Institute, Chinese Academy of Sciences(遥感与数字地球国家重点实验室,航空信息研究所,中国科学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克研究所) Lancaster Environment Centre, Lancaster University(兰卡斯特大学环境研究中心) Faculty of Electrical and Computer Engineering, University of Iceland(冰岛大学电气与计算机工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ChangeQuery通过多模态框架实现灾害情境感知,结合DICQ数据集和自动化标注管道,提升灾害监测的交互性和解释性,实现高精度的灾害量化与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22260 2026-04-27 cs.CV cs.AI 62%

Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset

迈向安全的移动性:由开放-ended视觉-语言数据集驱动的统一运输基础模型

Wenhui Huang, Songyan Zhang, Collister Chua, Yang Liang, Zhiqi Mao, Heng Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Land Transportation Dataset数据集和UniVLT模型,通过开放-ended视觉问答和多任务学习,提升城市交通环境下的安全推理能力,实现微观自动驾驶与宏观交通分析的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22305 2026-04-27 stat.AP 50%

Finite element model updating of building structures under seismic excitation: A parallelized latent space-based Bayesian framework

建筑结构在地震激励下的有限元模型更新:一种基于潜在空间的并行化贝叶斯框架

Taro Yaoyama, Sangwon Lee, Minoru Matsubara, Kenzo Kodera, Takeshi Ugata, Tatsuya Itoi

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种基于潜在空间的并行化贝叶斯框架,用于建筑结构在地震激励下的有限元模型更新,通过GPU加速实现高效不确定性量化和参数估计。

详情

展开后加载摘要…

URL PDF HTML 收藏