arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-16 至 2026-04-16 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2604.13648 2026-04-16 cs.SE 85%

Figma2Code: Automating Multimodal Design to Code in the Wild

Figma2Code: 将多模态设计转换为代码的自动化

Yi Gui, Jiawan Zhang, Yina Wang, Tianran Ma, Yao Wan, Shilin He, Dongping Chen, Zhou Zhao, Wenbin Jiang, Xuanhua Shi, Hai Jin, Philip S Yu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文提出Figma2Code任务,通过收集Figma文件元数据与设计图像,构建高质量数据集,评估多种多模态大语言模型,发现专有模型在视觉保真度上表现优异,但布局响应性和代码可维护性有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27064 2026-04-16 cs.CV cs.AI cs.CL 85%

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院) Abaka AI & 2077AI(Abaka AI及2077AI)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 84%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13252 2026-04-16 cs.LG cs.AI 83%

Out of Context: Reliability in Multimodal Anomaly Detection Requires Contextual Inference

脱离上下文:多模态异常检测的可靠性需要上下文推断

Kevin Wilkinghoff, Neelu Madan, Juan Miguel Valverde, Kamal Nasrollahi, Radu Tudor Ionescu, Rafal Wisniewski, Thomas B. Moeslund, Wenwu Wang, Zheng-Hua Tan

机构 * Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Technical University of Denmark(丹麦技术大学) Milestone Systems(Milestone系统) University of Bucharest(布加勒斯特大学) University of Surrey(萨里大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 多模态异常检测需通过上下文推断区分真实异常与环境变化,提出跨模态上下文推断框架以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12632 2026-04-16 eess.IV cs.CV 83%

Cyclic 2.5D Perceptual Loss for Cross-Modal 3D Medical Image Synthesis: T1w MRI to Tau PET

循环2.5D感知损失用于跨模态3D医学图像合成:T1加权MRI到tau PET

Junho Moon, Symac Kim, Haejun Chung, Ikbeom Jang

机构 * Department of Artificial Intelligence, Hanyang University, Seoul, South Korea(人工智能系,翰阳大学,首尔,韩国) Department of Electronic Engineering, Hanyang University, Seoul, South Korea(电子工程系,翰阳大学,首尔,韩国) Division of Computer Engineering, Hankuk University of Foreign Studies, Yongin, South Korea(计算机工程系,韩国外语大学, Yongin,韩国) Division of AI Data Convergence, Hankuk University of Foreign Studies, Yongin, South Korea(AI数据融合系,韩国外语大学, Yongin,韩国) Division of Language & AI, Hankuk University of Foreign Studies, Seoul, South Korea(语言与AI系,韩国外语大学,首尔,韩国)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出循环2.5D感知损失用于从T1加权MRI生成tau PET,通过交替优化不同切面提升体积一致性,并标准化SUVR以提高准确性。

Comments Published in Human Brain Mapping, available at https://doi.org/10.1002/hbm.70508

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13418 2026-04-16 cs.CL cs.AI cs.CV 82%

MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境

Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan Chen, Elias Stengel-Eskin, Tu Vu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。

Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25924 2026-04-16 cs.CV cs.AI cs.IR 81%

Good Scores, Bad Data: A Metric for Multimodal Coherence

好分数,坏数据:一种多模态一致性度量

Vasundra Srinivasan

机构 * AI Architect(人工智能架构师) Author, Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程作者(O’Reilly)) Stanford School of Engineering, Graduate Certificate (in progress)(斯坦福工程学院,研究生证书(在读))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态一致性度量(MCS),用于评估多模态融合质量,不依赖下游模型。通过四个维度(身份、空间、语义、决策)评估,MCS在1000张视觉基因组图像和150张COCO图像上验证,比任务准确率更敏感。

Comments 9 pages, 6 figures, NeurIPS 2024 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13060 2026-04-16 cs.CL cs.LG cs.MM 81%

Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage

牙科分诊基准:用于分层牙科分诊的多模态推理基准

Ziyi He, Yushi Feng, Shuangyu Yang, Yinghao Zhu, Xichen Zhang, Pak Chuen Patrick Tai, Hei Yuet Lo, Songying Wu, Weifa Yang, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) The Prince Philip Dental Hospital(菲利普王子牙科医院) Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学利滋医学学院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 本文提出Dental-TriageBench,首个专家标注的多模态牙科分诊基准,通过246个脱敏案例评估19种模型在细粒度治疗层面分诊中的表现,揭示了人类与模型间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13142 2026-04-16 cs.RO cs.CV cs.DB 79%

Multi-modal panoramic 3D outdoor datasets for place categorization

多模态全景三维户外数据集用于场所分类

Hojung Jung, Yuki Oto, Oscar M. Mozos, Yumi Iwashita, Ryo Kurazume

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程研究生院) Polytechnic University of Cartagena (UPCT)(卡塔赫纳理工学院) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学系)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出两个多模态全景三维户外数据集,用于语义场所分类,包含森林、海岸、住宅区、城市区及室内外停车场六类,通过激光扫描和同步图像获取数据,并比较了多种分类方法,取得高准确率。

Comments This is the authors' manuscript. The final published article was presented at IROS 2026, and it is available at https://doi.org/10.1109/IROS.2016.7759669

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13756 2026-04-16 cs.CL cs.CV 79%

MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging

MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架

Zhijie Bao, Fangke Chen, Licheng Bao, Chenhui Zhang, Wei Chen, Jiajie Peng, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 多模态评测 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13942 2026-04-16 cs.CV cs.AI cs.LG 62%

Frozen Forecasting: A Unified Evaluation

冻结预测:一种统一的评估

Jacob C Walker, Pedro Vélez, Luisa Polania Cabrera, Guangyao Zhou, Sayna Ebrahimi, Rishabh Kabra, Carl Doersch, Maks Ovsjanikov, João Carreira, Shiry Ginosar

机构 * Google DeepMind(谷歌DeepMind) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种统一的评估框架,用于评估冻结视觉骨干在多样化任务和抽象层次上的预测能力,通过训练潜在扩散模型直接在表示空间中预测未来特征,发现预测性能与感知质量密切相关,视频预训练模型表现优于图像预训练模型。

Comments New Title, Additional Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19088 2026-04-16 cs.CL cs.CV 62%

Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions

破解 juxtaposition 的密码:AI 模型能否理解幽默的矛盾

Zhe Hu, Tuo Liang, Jing Li, Yiren Lu, Yunlai Zhou, Yiran Qiao, Jing Ma, Yu Yin

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了AI在理解基于矛盾叙事的幽默中的挑战,通过引入YesBut基准测试,评估大型语言模型在识别和解释漫画中的表现,发现即使是最先进的模型仍无法匹敌人类水平。

Comments NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14089 2026-04-16 cs.RO cs.AI 57%

UMI-3D: Extending Universal Manipulation Interface from Vision-Limited to 3D Spatial Perception

UMI-3D:从视觉受限到3D空间感知的通用操作接口扩展

Ziming Wang

机构 * HKU(香港大学) USTC(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 UMI-3D通过集成轻量级低成本LiDAR传感器,提升数据采集的鲁棒性和可扩展性,实现3D空间感知,增强操作任务的性能与可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 57%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13456 2026-04-16 cs.LG cs.CV 57%

MyoVision: A Mobile Research Tool and NEATBoost-Attention Ensemble Framework for Real Time Chicken Breast Myopathy Detection

MyoVision:一种移动研究工具和NEATBoost-Attention集成框架用于实时鸡胸肌病检测

Chaitanya Pallerla, Siavash Mahmoudi, Dongyi Wang

机构 * Department of Biological and Agricultural Engineering, University of Arkansas(亚拉巴马大学生物与农业工程系) Department of Food Science, University of Arkansas(亚拉巴马大学食品科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MyoVision移动透光成像框架,结合NEATBoost-Attention模型实现低成本多类肌病检测,测试准确率达82.4%,优于传统方法并匹配高成本高光谱成像系统性能。

Comments Accepted at CVPR 2026 MetaFoods Workshop. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13409 2026-04-16 cs.CV 57%

CausalDisenSeg: A Causality-Guided Disentanglement Framework with Counterfactual Reasoning for Robust Brain Tumor Segmentation Under Missing Modalities

CausalDisenSeg: 一种基于因果推理的解耦框架,用于在缺失模态下的鲁棒脑肿瘤分割

Bo Liu, Yulong Zou, Jin Hong

机构 * School of Information Engineering, Nanchang University(南昌大学信息工程学院) School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CausalDisenSeg框架,通过因果引导的解耦和反事实推理,解决多模态脑肿瘤分割中因模态偏差导致的鲁棒性问题,实验显示其在严重缺失模态场景下准确性和一致性均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13635 2026-04-16 cs.CV 57%

SemAttNet: Towards Attention-based Semantic Aware Guided Depth Completion

SemAttNet:基于注意力的语义感知引导深度补全

Danish Nazir, Marcus Liwicki, Didier Stricker, Muhammad Zeshan Afzal

机构 * Department of Computer Science, University of Kaiserslautern, 67663 Kaiserslautern, Germany(凯斯莱特大学计算机科学系) Mindgrage, University of Kaiserslautern, 67663 Kaiserslautern, Germany(Mindgrage凯斯莱特大学) Department of Computer Science, Luleå University of Technology, 971 87 Luleå, Sweden(卢勒奥技术大学计算机科学系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SemAttNet,通过三分支架构结合颜色、语义和深度引导,利用注意力机制融合特征,提升深度补全精度,实验表明在KITTI基准上达到最优性能。

Comments accepted at IEEE Access

Journal ref IEEE Access, vol. 10, pp. 120781-120791, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03596 2026-04-16 stat.ME 50%

SMART-MC: Characterizing the Dynamics of Multiple Sclerosis Therapy Transitions Using a Covariate-Based Markov Model

SMART-MC:利用基于协变量的马尔可夫模型研究多发性硬化症治疗转换的动力学

Beomchang Kim, Zongqi Xia, Priyam Das

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出SMART-MC模型,通过协变量影响治疗转换概率,解决参数可识别性和稀疏转换处理问题,揭示多发性硬化症患者亚组的治疗转换差异。

详情

展开后加载摘要…

URL PDF HTML 收藏