arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9133 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9133 篇

2605.18507 2026-05-22 cs.CV 79%

Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation

弱监督跨模态学习用于4D雷达场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

机构 * Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种弱监督的雷达场景流学习框架,利用图像和里程计进行辅助监督,通过实例感知的自监督损失和静态区域的刚性损失,实现了更高效的场景流估计。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03121 2026-05-22 cs.CR cs.AI 79%

Lost in Modality: Evaluating the Effectiveness of Text-Based Membership Inference Attacks on Large Multimodal Models

模态迷失:评估基于文本的成员推断攻击在大型多模态模型中的有效性

Ziyi Tong, Feifei Sun, Le Minh Nguyen

机构 * Japan Advanced Institute of Science and Technology - Information Science(日本科学技术先进研究院-信息科学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了基于文本的成员推断攻击(MIAs)在多模态模型中的有效性,发现其在分布内设置中表现相似,而在分布外设置中视觉输入起到正则化作用,有效掩盖了成员信号。

Comments accepted by ESANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02014 2026-05-22 cs.CV 79%

Towards Selection of Large Multimodal Models as Engines for Burned-in Protected Health Information Detection in Medical Images

向大规模多模态模型选择作为医疗图像中已烧毁保护健康信息检测引擎的方向

Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

机构 * QwenLM(通义实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了如何利用大规模多模态模型进行医疗图像中保护健康信息的检测,通过对比三种主流模型在不同流程配置下的表现,发现大规模多模态模型在OCR性能上优于传统方法,但整体检测准确性提升不显著,尤其在复杂印模模式测试中表现更优,并提出了针对特定操作约束的模型选择建议和部署策略。

Comments Accepted at EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21852 2026-05-22 cs.CV 79%

Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

癫痫半相学套件(S3):一个临床多模态数据集、基准和模型用于癫痫半相学理解

Lina Zhang, Tonmoy Monsoor, Peizheng Li, Jiarui Cui, Xinyi Peng, Chong Han, Prateik Sinha, Siyuan Dai, Jessica Nichole Pasqua, Colin M McCrimmon, Weiting Liu, Hailey Marie Miranda, Bing Hu, Xiangting Wu, Tengyou Xu, Chunhan Li, Jiaye Tian, Jiarui Tang, Detao Ma, Lingye Kong, Junnan Lyu, Jungang Li, Yan Zan, Junhua Huang, Rajarshi Mazumder, Vwani Roychowdhury

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Pittsburgh(匹兹堡大学) Fudan University(复旦大学) University of California, Riverside(加州大学河滨分校) Hong Kong University of Science(香港科学大学) Maharishi International University(玛希拉国际大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出S3数据集和基准,用于细粒度、结构化的癫痫半相学理解,通过评估多模态大语言模型在低级视觉感知、时间序列处理、叙述报告生成和癫痫诊断中的能力,揭示了现有模型在左右脑推理、时间定位、症状序列和临床忠实报告方面的系统性弱点,并展示了针对癫痫的微调和双阶段神经符号框架在癫痫与非癫痫癫痫分类中的高F1分数。

Comments Accepted to ICML 2026 as a Spotlight presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21527 2026-05-22 eess.IV cs.CV cs.LG 79%

CryoNet: A Deep Learning Framework for Multi-Modal Debris-Covered Glacier Mapping. A Case Study of the Poiqu Basin, Central Himalaya

CryoNet:一种用于多模态冰川覆盖区制图的深度学习框架。帕iqu盆地,中央喜马拉雅地区案例研究

Farzaneh Barzegar, Tobias Bolch, Norbert Kuehtreiber, Silvia L. Ullo

机构 * University of Sannio(萨恩尼奥大学) Graz University of Technology(格拉茨技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出CryoNet,一种利用多模态数据集的深度学习框架,用于区分干净冰川、覆盖冰川和冰湖,通过在喜马拉雅中央帕iqu盆地的案例研究展示了其在复杂高山环境中的有效性。

Comments 15 pages, 10 figures, 5 tables. Preprint submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS); currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21251 2026-05-21 eess.IV cs.CV 79%

Local-sensitive connectivity filter (ls-cf): A post-processing unsupervised improvement of the frangi, hessian and vesselness filters for multimodal vessel segmentation

局部敏感连通性滤波器(ls-cf):一种后处理的无监督改进方法,用于多模态血管分割的Frangi、Hessian和血管性滤波器

Erick O Rodrigues, Lucas O Rodrigues, João HP Machado, Dalcimar Casanova, Marcelo Teixeira, Jeferson T Oliva, Giovani Bernardes, Panos Liatsis

机构 * Department of Academic Informatics (DAINF), Universidade Tecnologica Federal do Parana (UTFPR)(学术信息系(DAINF),技术联邦大学帕托布拉诺分校(UTFPR)) Graduate Program of Sciences Applied to Health Products, Universidade Federal Fluminense (UFF)(健康产品应用科学研究生项目,联邦大学弗洛里塞分校(UFF)) Institute of Technological Sciences (ICT), Universidade Federal de Itajuba (UNIFEI)(技术科学研究所,联邦大学伊塔比亚分校(UNIFEI)) Department of Electrical Engineering and Computer Science, Khalifa University of Science and Technology(电气工程与计算机科学系,卡利法科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种无监督的多模态方法,改进Frangi滤波器的响应,实现自动血管分割。通过计算像素级血管连续性并引入局部容忍启发式方法来填补Frangi响应产生的血管不连续性,提出局部敏感连通性滤波器(LS-CF),在多种多模态数据集上取得了有竞争力的结果,尤其在OSIRIX视网膜血管造影数据集中,其准确率优于现有最先进方法。

Journal ref Journal of Imaging 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20967 2026-05-21 cs.CL 79%

ArPoMeme: An Annotated Arabic Multimodal Dataset for Political Ideology and Polarization

ArPoMeme:一个标注的阿拉伯多模态数据集用于政治意识形态和极化

Wajdi Zaghouani, Kais Attia, Md. Rafiul Biswas, Fadhl Eryani

机构 * Northwestern University in Qatar(卡塔尔西北大学) Independent Researcher(独立研究员) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学) University of Tübingen(图宾根大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出ArPoMeme数据集,用于分析阿拉伯政治漫画的多模态和意识形态维度,通过自定义工具实现大规模标注,揭示意识形态极化特征。

Comments Accepted at LREC 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20458 2026-05-21 cs.CV 79%

ELEMENT: Multi-Modal Retinal Vessel Segmentation Based on a Coupled Region Growing and Machine Learning Approach

ELEMENT:基于耦合区域生长和机器学习方法的多模态视网膜血管分割

Erick O. Rodrigues, Aura Conci, Panos Liatsis

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于耦合区域生长和机器学习方法的多模态视网膜血管分割框架ELEMENT,通过区域生长和机器学习提取特征并进行像素分类,提高了分割的准确性和效率,实验表明其在多个数据集上均优于现有方法。

Journal ref IEEE Journal of Biomedical and Health Informatics 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10784 2026-05-21 cs.AI 79%

TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training

TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库

Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios Savvides, Sharon Li, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Auburn University(阿肯色大学欧文分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19004 2026-05-20 cs.CV cs.LG cs.RO 79%

EgoTraj: Real-World Egocentric Human Trajectory Dataset for Multimodal Prediction

EgoTraj: 用于多模态预测的现实世界人轨迹数据集

Ahmad Yehia, Abduallah Mohamed, Tianyi Wang, Jiseop Byeon, Kun Qian, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(土木、建筑与环境工程系,德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) School of Architecture, The University of Texas at Austin(建筑学院,德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EgoTraj数据集,用于多模态预测,包含75个真实城市环境中的人导航轨迹,提供了同步的RGB视频和地面真实数据,包括6自由度头部姿态、3D眼 gaze向量和场景注释,展示了该数据集在AR感知、导航和辅助系统中的应用价值。

Comments 21 pages, 14 figures. Project page: https://github.com/yehiahmad/EgoTraj

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18130 2026-05-19 cs.CV 79%

Rad-VLSM: A Cross-Modal Framework with Semantics-Assisted Prompting for Medical Segmentation and Diagnosis

Rad-VLSM:一种结合语义辅助提示的跨模态框架用于医学分割与诊断

Fengyi Zhang, Xujie Zeng, Mohan Liu, Zengyi Wang, Yalong Jiang

机构 * Student Member, IEEE(IEEE学生会员) Member, IEEE(IEEE会员)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Rad-VLSM框架,通过语义引导的提示机制,提升医学图像分割与诊断的准确性,解决现有模型易受背景组织和无关视觉相关性干扰的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17669 2026-05-19 cs.AI 79%

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

多模态文化遗产品知图扩展与语言和视觉模型

Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi

机构 * Center for Studies and Research in Computer Science and Communication, CNAM(计算机科学与通信研究所以及CNAME)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种多模态方法,利用语言和视觉模型扩展文化遗产品知图,通过构建多模态知识图谱WJoconde并建立评估基准,提高知识图谱的扩展效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17198 2026-05-19 q-bio.NC cs.CV 79%

MIRAGE: Robust multi-modal architectures translate fMRI-to-image models from vision to mental imagery

MIRAGE:鲁棒的多模态架构将fMRI到图像模型从视觉扩展到心理意象

Reese Kneeland, Cesar Kadir Torrico Villanueva, Jordyn Ojeda, Shuhb Khanna, Jonathan Xu, Paul S. Scotti, Thomas Naselaris

机构 * University of Minnesota(明尼苏达大学) Medical AI Research Center (MedARC)(医学人工智能研究中心 (MedARC)) University of Sydney(悉尼大学) Stanford University(斯坦福大学) Alljoined Sophont Princeton Neuroscience Institute(普林斯顿神经科学研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MIRAGE方法,通过多模态文本和图像特征训练,实现从脑活动解码心理意象,展示了在NSD-Imagery基准上SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17115 2026-05-19 cs.AI 79%

F2IND-IT! -- Multimodal Fuzzy Fake Indian News Detection using Images and Text

F2IND-IT! -- 多模态模糊假新闻检测:结合图像和文本

Kushal Trivedi, Murtuza Shaikh, Khushi Singh, Jeevaraj S.

机构 * ABV - Indian Institute of Information Technology, Gwalior(ABV-印度信息技术学院,加尔瓦里)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态模糊框架,结合图像和文本进行印度媒体虚假新闻检测,通过ResNet-50提取图像特征,DistilBERT获取文本语义嵌入,ANFIS生成模糊可靠性评分,并通过轻量级注意力融合模块进行分类,实验结果显示在准确率、精确率、召回率和F1分数上均优于现有方法。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01993 2026-05-19 cs.CV 79%

Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection

培养可推广的多模态操纵检测的推理能力

Yuchen Zhang, Yaxiong Wang, Kecheng Han, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出REFORM框架,通过推理驱动的方法改进多模态操纵检测,提升泛化能力,在多个数据集上取得新高准确率。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16386 2026-05-19 cs.CV 79%

Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

对多模态大语言模型评分者的审计:临床顺序评分中的中间倾向偏差

Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Computer and Information Science and Engineering(计算机与信息科学与工程系) Department of Clinical and Health Psychology(临床与健康心理学系) Department of Biomedical Engineering(生物医学工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在临床顺序评分中的中间倾向偏差,通过基准测试发现三种前沿LLM在Clock Drawing Test评分中存在系统性压缩倾向,影响临床决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15755 2026-05-18 cs.CV 79%

Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models

基于属性的选型推理用于艺术品情感理解的多模态大语言模型

Cheng Zhang, Yuer Liu, Zhiyu Zhou, Hongxia Xie, Wen-Huang Cheng

机构 * Department of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Department of Computer Science, National Taiwan University(国立台湾大学计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于属性的选型推理方法,通过多模态大语言模型实现艺术品情感理解,通过引入属性瓶颈引导框架提升情感预测精度和解释简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15326 2026-05-18 cs.CV 79%

Multimodal Object Detection Under Sparse Forest-Canopy Occlusion

多模态目标检测在稀疏森林冠层遮挡下的应用

Nitik Jain, Mangal Kothari

机构 * Robotics & AI, Johns Hopkins University, USA(约翰霍普金斯大学机器人与人工智能系,美国) Department of Aerospace Engineering, IIT Kanpur(印度理工学院坎浦尔航空航天工程系) Senior Principal Flight Control Engineer, ADASI, EDGE Group, Abu Dhabi, UAE(阿布扎赫尔ADASI高级飞行控制系统工程师,EDGE集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态管道,结合激光雷达、可见-热成像融合和合成孔径成像技术,以提高森林冠层下人类检测的可靠性,展示了改进的YOLOv5检测器在热成像和融合图像上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10550 2026-05-15 cs.CL 79%

Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy

多领域多模态文档分类基准与多级分类法

Denghao Ma, Qing Liu, Zulong Chen, Chuanfei Xu, Jia Xu, Zhibo Yang, Wei Shao, Zhao Li

机构 * Beijing Information Science and Technology University(北京信息科学与技术大学) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Guangzhou University(广州大学) Zhejiang Lab(浙江实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL

AI总结 本文提出首个多级多领域多模态文档分类基准MMMBench,包含五级多级分类体系和12个商业领域的5990个真实多模态文档,通过系统实验识别出四个核心挑战并提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02920 2026-05-15 cs.LG cs.CV cs.SI 79%

Learning Multimodal Embeddings for Traffic Accident Prediction and Causal Estimation

学习多模态嵌入用于交通事故预测和因果估计

Ziniu Zhang, Minxuan Duan, Haris N. Koutsopoulos, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过结合道路网络数据与卫星图像,提出多模态学习方法,提升交通事故预测精度,并发现降水、高速道路和季节因素对事故率的影响。

Comments 17 pages. Appeared in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL 79%

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10556 2026-05-14 cs.CV cs.LG 79%

EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving

EnergyLens: 多模态大语言模型推理服务中的可解释闭式能量模型

Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理服务中的能量优化问题,提出EnergyLens模型,通过符号回归发现结构,构建基于系统属性的闭式能量模型,实现可解释且高效的配置选择。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 79%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV 79%

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13330 2026-05-14 cs.CL 79%

FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages

FIND:迈向印度语言多模态金融推理与问答

Sarmistha Das, Vaibhav Vishal, Syed Ibrahim Ahmad, Manish Gupta, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Microsoft(微软)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出FinVQA基准和FIND框架,针对多语言印度语言金融推理挑战,通过多模态和数值推理提升金融决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12838 2026-05-14 cs.AI 79%

Multimodal Hidden Markov Models for Persistent Emotional State Tracking

多模态隐马尔可夫模型用于持久情绪状态跟踪

Anamika Ragu, Aneesh Jonelagadda

机构 * Kaliber AI, San Mateo, California, USA(Kaliber AI,美国加利福尼亚州圣马特奥)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态valence- arousal表示的轻量框架,利用sticky factorial HDP-HMM实现对话情绪的持续状态跟踪,通过LLM-as-a-Judge等指标验证其比基线Gaussian HMM更高效且可解释。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12799 2026-05-14 cs.MA cs.CY cs.MM 79%

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练

Ahmad Al-Kabbany, Esraa Kassem

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10127 2026-05-14 cs.CV 79%

Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition

Fashion130K: 一个用于服装生成的电子商务服装数据集,具有统一的多模态条件

Yu He, Ting Zhu, Yichun Liu, Lichen Ma, Xinyuan Shan, Jingling Fu, Yu Shi, Junshi Huang, Yan Li

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Fashion130K数据集和统一多模态条件框架,通过多模态提示对齐和融合变压器提升生成一致性,实验验证了UMC在视觉一致性上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12154 2026-05-13 cs.AI 79%

MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling

MM-OptBench:一种面向多模态优化建模的求解器导向基准

Zhong Li, Qi Huang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen, Zaiwen Wen, Lincen Yang

机构 * Great Bay University(大湾大学) Leiden University(莱顿大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院) Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MM-OptBench,一个基于求解器的多模态优化建模基准,通过文本和视觉信息生成数学模型和求解器代码,评估9种多模态大语言模型在不同难度实例上的表现,结果显示任务仍远未解决。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12031 2026-05-13 cs.LG cs.CV 79%

Resilient Vision-Tabular Multimodal Learning under Modality Missingness

在模态缺失下的视觉-表格多模态学习的鲁棒性

Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Research Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统研究单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与干预系,辐射物理,生物医学工程,乌梅大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态Transformer框架,用于在普遍存在模态缺失的情况下进行视觉-表格联合学习,通过可学习的模态标记和中间融合实现鲁棒的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏