arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-14 至 2026-05-14 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 23 篇

2605.13173 2026-05-14 cs.DB 86%

OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems

OxyEcomBench:跨电子商务生态系统的多模态基础模型基准测试

Yong Liu, Ximan Liu, Guoqing Yang, Bing Bai, Xiaoqiang Xu, Zhen Chen, Ke Zhang, Yan Li

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 本文提出OxyEcomBench,一个涵盖6300个高质量实例的多模态基准,用于评估模型在电子商务场景中的表现,通过覆盖平台运营者、商家和消费者六个能力方面和29项任务,验证模型在多模态输入下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10187 2026-05-14 cs.CV 83%

SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

SciVQR:一个多学科多模态基准用于高级科学推理评估

Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center(OPPO AI中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 SciVQR通过54个学科的多模态任务评估科学推理能力,包含专家解答的复杂推理挑战,揭示了多模态大语言模型在复杂推理和跨学科整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12703 2026-05-14 cs.CV cs.AI 81%

MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence

MMCL-Bench:多模态上下文学习从视觉规则、程序和证据

Yifan Chen, Fei Yin, Qingyan Bai, Zicheng Lin, Yujiu Yang

机构 * University of Cambridge(剑桥大学) HKUST(香港科技大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMCL-Bench提出一个多模态上下文学习基准,要求模型从视觉或混合模态教学上下文中学习规则、程序和经验模式,并应用于新实例。评估发现当前系统在多模态上下文学习上仍不稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10556 2026-05-14 cs.CV cs.LG 79%

EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving

EnergyLens: 多模态大语言模型推理服务中的可解释闭式能量模型

Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理服务中的能量优化问题,提出EnergyLens模型,通过符号回归发现结构,构建基于系统属性的闭式能量模型,实现可解释且高效的配置选择。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 79%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV 79%

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13330 2026-05-14 cs.CL 79%

FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages

FIND:迈向印度语言多模态金融推理与问答

Sarmistha Das, Vaibhav Vishal, Syed Ibrahim Ahmad, Manish Gupta, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Microsoft(微软)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出FinVQA基准和FIND框架,针对多语言印度语言金融推理挑战,通过多模态和数值推理提升金融决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12838 2026-05-14 cs.AI 79%

Multimodal Hidden Markov Models for Persistent Emotional State Tracking

多模态隐马尔可夫模型用于持久情绪状态跟踪

Anamika Ragu, Aneesh Jonelagadda

机构 * Kaliber AI, San Mateo, California, USA(Kaliber AI,美国加利福尼亚州圣马特奥)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态valence- arousal表示的轻量框架,利用sticky factorial HDP-HMM实现对话情绪的持续状态跟踪,通过LLM-as-a-Judge等指标验证其比基线Gaussian HMM更高效且可解释。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12799 2026-05-14 cs.MA cs.CY cs.MM 79%

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练

Ahmad Al-Kabbany, Esraa Kassem

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10127 2026-05-14 cs.CV 79%

Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition

Fashion130K: 一个用于服装生成的电子商务服装数据集,具有统一的多模态条件

Yu He, Ting Zhu, Yichun Liu, Lichen Ma, Xinyuan Shan, Jingling Fu, Yu Shi, Junshi Huang, Yan Li

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Fashion130K数据集和统一多模态条件框架,通过多模态提示对齐和融合变压器提升生成一致性,实验验证了UMC在视觉一致性上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13530 2026-05-14 cs.CV cs.AI 79%

Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs

迈向统一的手术场景理解:通过多模态大语言模型弥合推理与 grounding

Jincai Huang, Shihao Zou, Yuchen Guo, Jingjing Li, Wei Ji, Kai Wang, Shanshan Wang, Weixin Si

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Northwestern University(西北大学) University of Alberta(阿尔伯塔大学) Yale University(耶鲁大学) Nanfang Hospital(南华医院) Shenzhen University of Advanced Technology(深圳大学先进技术研究院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SurgMLLM框架,通过统一推理与视觉 grounding 实现手术场景理解,提升三元组识别和分割精度,实验表明其在三元组识别指标AP_IVT上提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 79%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13711 2026-05-14 cs.LG 78%

MILM: Large Language Models for Multimodal Irregular Time Series with Informative Sampling

MILM:用于多模态不规则时间序列的大型语言模型与信息采样

Hsing-Huan Chung, Shijun Li, Yoav Wald, Xing Han, Suchi Saria, Joydeep Ghosh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Technion-IIT(技术学院-以色列理工学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出MILM模型,通过两阶段策略处理多模态不规则时间序列,有效利用采样模式和观测值进行分类,提升医疗记录中住院死亡率预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02502 2026-05-14 cs.CR 78%

GuardSec: A Multi-Modal Web Platform for Real-Time Digital Fraud Detection, Entity Verification, and Connection Security Analysis in the African Context

GuardSec:面向非洲情境的多模态网络平台,用于实时数字欺诈检测、实体验证及连接安全分析

Gilda Rech Bansimba, Regis Freguin Babindamana

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 GuardSec为非洲用户设计,提供实时多模态威胁验证,无需注册或技术知识,用户可快速评估网址、电话号码等合法性,并通过My Footprint实时分析自身连接安全,同时集成Gilda提供个性化安全建议。

Comments first version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13218 2026-05-14 cs.LG 78%

Machine Learning-Driven Multimodal Spectroscopic Liquid Biopsy for Early Multicancer Detection

基于机器学习的多模态光谱学液体活检用于早期多癌种检测

Alejandro Leonardo García Navarro, Javier Cachón Ortiz, Javier González Colsa, Samuel García Díaz, Carlos Viadero Valderrama

机构 * Signal Processing Group(信号处理组) Gregorio Marañón Health Research Institute(格雷戈里奥·马兰农健康研究中心) Amber Health Solutions(艾默健康解决方案)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出结合FTIR、拉曼和EEM荧光光谱的多模态液体活检框架,利用机器学习方法实现多癌种早期检测,实验显示多模态融合在ROC-AUC和灵敏度特异度上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23018 2026-05-14 cs.CV cs.AI cs.LG 62%

AmaraSpatial-10K: A Spatially and Semantically Aligned 3D Dataset for Spatial Computing and Embodied AI

AmaraSpatial-10K:一个空间和语义对齐的3D数据集用于空间计算和具身AI

Mohammad Sadegh Salehi, Alex Perkins, Igor Maurell, Ashkan Dabbagh, Raymond Wong

机构 * Zero One Creative(Zero One创意)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AmaraSpatial-10K数据集,包含10000多个合成3D资产,优化零样本部署,通过精确锚点、PBR贴图和文本元数据提升CLIP召回率和物理稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12845 2026-05-14 cs.CV cs.AI 62%

AssemblyBench: Physics-Aware Assembly of Complex Industrial Objects

AssemblyBench: 复杂工业物体的物理感知装配

Danrui Li, Jiahao Zhang, Bernhard Egger, Moitreya Chatterjee, Suhas Lohit, Tim K. Marks, Anoop Cherian

机构 * Rutgers, The State University of New Jersey(新泽西罗格斯大学) The Australian National University(澳大利亚国立大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AssemblyBench数据集和AssemblyDyno模型,通过多模态指令和3D部件模型预测装配顺序和轨迹,优于现有方法的装配姿态估计和轨迹可行性评估。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12684 2026-05-14 cs.CV cs.AI cs.HC 62%

Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?

视觉审美基准:前沿模型能评判美吗?

Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue Huang, Hang Hua, Zhengqing Yuan, Kaiyuan Zheng, Luyao Niu, Bhaskar Ramasubramanian, Basel Alomair, Xiangliang Zhang, Misha Sra, Zichen Chen, Radha Poovendran, Zhangchen Xu

机构 * Bake AI University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Stanford University(斯坦福大学) University of Notre Dame(诺丁汉大学) Carnegie Mellon University(卡内基梅隆大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Western Washington University(西雅图华盛顿大学) King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉审美基准(VAB),通过比较选择评估审美,发现前沿模型在判断最佳和最差图像时表现逊于人类专家,表明需进一步改进。

Comments Project page: https://vab.bakelab.ai. Code: https://github.com/BakeLab/Visual-Aesthetic-Benchmark. Dataset: https://huggingface.co/datasets/BakeLab/Visual-Aesthetic-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13167 2026-05-14 cs.CL 57%

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

GeoBuildBench:一个用于从自然语言构建可执行几何构造的基准

Jinwoong Kim, Rui Yang, Huishuai Zhang

机构 * Peking University(北京大学) Wangxuan Institute of Computer Technology(王璇计算机技术研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 GeoBuildBench评估大语言模型能否将自然语言几何问题转化为可执行构造,包含489道中文教材问题,验证了多模态模型在交互构造任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13062 2026-05-14 cs.CV 57%

Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling

Edit-Compass 与 EditReward-Compass:图像编辑与奖励建模的统一基准

Xuehai Bai, Yang Shi, Yi-Fan Zhang, Xuanyu Zhu, Yuran Wang, Yifan Dai, Xinyu Liu, Yiyan Ji, Xiaoling Gu, Yuanxing Zhang

机构 * HDU(杭州大学) PKU(北京大学) Kling Team(Kling团队) CASIA(中国科学院自动化研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Edit-Compass和EditReward-Compass,通过精细多维评估框架和真实奖励建模场景,解决现有图像编辑和奖励模型评估中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06869 2026-05-14 cs.AI 57%

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

Agentick: 一个统一的连续决策制定代理基准测试

Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23013 2026-05-14 cs.CV cs.LG 57%

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

SubspaceAD:通过子空间建模实现无训练少样本异常检测

Camile Lendering, Erkut Akdag, Egor Bondarev

机构 * AIMS Group, Department of Electrical Engineering, Eindhoven University of Technology(AIMS组,电气工程系,埃因霍温理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 SubspaceAD提出一种无需训练的少样本异常检测方法,通过冻结DINOv2模型提取正常图像的补丁特征,并利用PCA建模估计正常变化的低维子空间,从而在无训练、提示微调或内存库的情况下实现最先进的性能。

Comments Accepted to CVPR 2026. Revised version with corrected AU-PRO evaluation and recomputed metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13516 2026-05-14 eess.SP 50%

Sensing-Assisted LoS/NLoS Identification in Dynamic UAV Positioning Systems

基于传感的动态无人机定位系统中LoS/NLoS识别

Huijuan Qiao, Lu Bai, Mingran Sun, Mengyuan Lu, Jiajing Chen, Xiang Cheng

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种基于传感的动态无人机定位系统中LoS/NLoS识别方法,通过构建多模态传感通信集成数据集,提出双输入特征融合网络,提升识别精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏