arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2603.18611 2026-03-20 cs.CL cs.CV 84%

Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Media

跨模态推理迁移用于社交媒体上可解释的人道主义分类

Thi Huyen Nguyen, Koustav Rudra, Wolfgang Nejdl

机构 * L3S Research Center \ University Hannover Hannover Germany Indian Institute of Technology Kharagpur Kharagpur India L3S Research Center\ University Hannover Hannover Germany L3S Research Center \ University Hannover Indian Institute of Technology Kharagpur L3S Research Center\ University Hannover

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种跨模态推理迁移框架,通过文本和图像联合表示提取文本和图像推理,提升人道主义分类的可解释性,实验表明在CrisisMMD数据集上宏F1提升2-35%,并在零样本模式下达到80%的准确率。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19077 2026-03-20 cs.CV 83%

Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline

多模态大规模小变化建筑物变化检测:基准与基线

Ye Wang, Wei Lu, Zhihui You, Keyan Chen, Tongfei Liu, Kaiyu Li, Hongruixuan Chen, Qingling Shu, Sibao Chen

机构 * MOE Key Lab of ICSP, Anhui Provincial Key Lab of Multimodal Cognitive Computation, IMIS Lab of Anhui Province, School of Computer Science and Technology, Anhui University, Hefei, China(教育部信息与通信领域重点实验室、安徽省多模态认知计算重点实验室、安徽省IMIS实验室、计算机科学与技术学院、安徽大学、合肥,中国) School of Public Safety and Emergency Management, Anhui University of Science and Technology, Hefei 231131, China(公共安全与应急管理学院、安徽理工大学、合肥231131,中国) College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院、南洋理工大学、新加坡639798) Shaanxi Joint Laboratory of Artificial Intelligence, Shaanxi University of Science and Technology, Xi’an 710021, China(人工智能联合实验室、陕西科技大学、西安710021,中国) School of Software Engineering, Xi’an Jiaotong University, Xi’an 710049, China(软件工程学院、西安交通大学、西安710049,中国) Graduate School of Frontier Sciences, The University of Tokyo, Chiba, 277-8561, Japan(前沿科学研究生院、东京大学、千叶,日本)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LSMD多模态数据集和MSCNet网络,通过融合RGB和NIR信息提升小变化检测精度,验证了多模态特征融合的有效性。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21475 2026-03-20 cs.AI 83%

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试

Xijia Tao, Yihua Teng, Xinxing Su, Xinyu Fu, Jihao Wu, Chaofan Tao, Ziru Liu, Haoli Bai, Rui Liu, Lingpeng Kong

机构 * The University of Hong Kong (HKU)(香港大学) Huawei Inc(华为公司)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。

Comments Project Page: https://mmsearch-plus.github.io

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00204 2026-03-20 cs.MM cs.SI 83%

MSM-BD: Multimodal Social Media Bot Detection Using Heterogeneous Information

MSM-BD:基于异构信息的多模态社交媒体机器人检测

Tingxuan Wu, Zhaorui Ma, Yanjun Cui, Ziyi Zhou, Eric Wang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出MSM-BD方法,通过异构信息融合技术提升社交媒体机器人检测精度,利用TwiBot-22数据集验证了模型有效性。

Comments Springer Nature in Studies in Computational Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00030 2026-03-20 cs.LG 82%

Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement

模态均衡至关重要:面向跨模态记忆增强的次要模态感知自适应交替方法

Xiang Shi, Rui Zhang, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文提出一种基于Shapley值的自适应交替训练框架,通过优先考虑次要模态平衡融合,引入记忆模块和跨模态映射机制,提升多模态学习性能,在四个基准数据集上取得SOTA结果。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17759 2026-03-20 cs.CL cs.AI 81%

Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor

有害或幽默:一个多模态、多语言的基准测试用于显性与隐性有害幽默

Ahmed Sharshar, Hosam Elgendy, Saad El Dine Ahmed, Yasser Rohaim, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) INSAIT

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态、多语言基准测试,用于检测和理解有害和冒犯性幽默,通过对比不同模型在英语和阿拉伯语中的表现,强调文化背景和推理能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18425 2026-03-20 cs.CL 79%

Multimodal Task Interference: A Benchmark and Analysis of History-Target Mismatch in Multimodal LLMs

多模态任务干扰:多模态大语言模型中历史-目标不匹配的基准与分析

Masayuki Kawarada, Tatsuya Ishigaki, Hiroya Takamura

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态大语言模型中任务切换导致的性能下降问题,通过六个任务的基准测试发现,从纯文本切换到图像目标会导致严重性能下降,而反向切换则影响较小,且多模态差异是主要干扰因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05751 2026-03-20 cs.CV 79%

SenseShift6D: Multimodal RGB-D Benchmarking for Robust 6D Pose Estimation across Environment and Sensor Variations

SenseShift6D:多模态RGB-D基准测试用于在环境和传感器变化下的鲁棒6D位姿估计

Yegyu Han, Taegyoon Yoon, Dayeon Woo, Sojeong Kim, Hyung-Sin Kim

机构 * Graduate School of Data Science(数据科学研究生院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SenseShift6D通过多样的光照和传感器设置,评估了6D位姿估计在真实环境中的鲁棒性,揭示了传感器和环境变化对性能的影响,推动了多模态传感器选择的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18344 2026-03-20 cs.RO cs.HC cs.LG cs.MA 78%

HRI-SA: A Multimodal Dataset for Online Assessment of Human Situational Awareness during Remote Human-Robot Teaming

HRI-SA:一种用于远程人机协同中在线人类情境意识评估的多模态数据集

Hashini Senaratne, Richard Attfield, Samith Widhanapathirana, David Howard, Cecile Paris, Dana Kulic, Leimin Tian

机构 * CSIRO Robotics(CSIRO机器人实验室) Monash Robotics(莫纳什大学机器人实验室)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出HRI-SA数据集,用于评估远程人机协同中的人类情境意识,通过眼动、瞳孔直径等多模态数据,验证了通用眼动特征在检测感知情境意识延迟中的有效性。

Comments This work is currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18032 2026-03-20 cs.LG cond-mat.mtrl-sci 78%

Multimodal Machine Learning for Soft High-k Elastomers under Data Scarcity

多模态学习用于数据稀缺下的软高k电弹性体

Brijesh FNU, Viet Thanh Duy Nguyen, Ashima Sharma, Md Harun Rashid Molla, Chengyi Xu, Truong-Son Hy

机构 * Department of Mechanical and Materials Engineering, School of Engineering, The University of Alabama at Birmingham (UAB)(机械与材料工程系,工程学院,阿拉巴马大学伯明翰分校) Department of Computer Science, College of Arts and Sciences, The University of Alabama at Birmingham (UAB)(计算机科学系,文理学院,阿拉巴马大学伯明翰分校)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出多模态学习框架,通过聚合实验数据构建高质量电弹性体数据库,利用预训练聚合表示实现少样本预测,加速发现高k电弹性体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19217 2026-03-20 cs.CV 77%

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 73%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18741 2026-03-20 cs.CY cs.SE 71%

Beyond the Code: A Multi-Modal Assessment Strategy for Fostering Professional Competencies via Introductory Programming Projects

超越代码:一种多模态评估策略,通过入门编程项目培养专业能力

Santiago Berrezueta-Guzman, Vanesa Metaj, Stefan Wagner

专题命中 多模态评测 :multi-modal(title)

AI总结 本文通过项目式学习框架开发2D迷宫跑游戏,提出四维评估模型提升编程基础和沟通能力,为现代软件工程教育提供可扩展的课程改革方案。

Comments Article submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18712 2026-03-20 cs.AI 70%

Accurate and Efficient Multi-Channel Time Series Forecasting via Sparse Attention Mechanism

通过稀疏注意力机制实现准确且高效的多通道时间序列预测

Lei Gao, Hengda Bao, Jingfei Fang, Guangzheng Wu, Weihua Zhou, Yun Zhou

机构 * Department of Machine Learning(机器学习系) SF Express(顺丰快递) Department of Management(管理系) Zhejiang University of Technology(浙江工业大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出Li-Net架构,通过稀疏Top-K Softmax注意力机制和多尺度投影框架,有效捕捉多通道时间序列的线性和非线性依赖,提升预测精度与效率。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18508 2026-03-20 cs.CV cs.AI 62%

Foundations and Architectures of Artificial Intelligence for Motor Insurance

人工智能在机动车保险中的基础与架构

Teerapong Panboonyuen

机构 * Thaivivat Insurance Public Company Limited(泰维瓦特保险公共公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文系统阐述了机动车保险中人工智能的基础与架构,结合大规模实际应用,提出统一的垂直整合AI范式,整合感知、多模态推理和生产基础设施,实现汽车风险评估和理赔流程的端到端自动化。

Comments 173 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19059 2026-03-20 cs.CV 57%

SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation

SignAgent:用于语言学基础的手语标注和数据集整理的代理LLM

Oliver Cory, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SignAgent,一种利用大语言模型进行可扩展、语言学基础的手语标注和数据集整理的新框架。通过SignAgent协调器和SignGraph,解决传统方法和手动标注的瓶颈,实现大规模语言感知数据标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 57%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04095 2026-03-20 cs.CV 57%

Multi-Scale Distillation for RGB-D Anomaly Detection on the PD-REAL Dataset

多尺度蒸馏用于PD-REAL数据集上的RGB-D异常检测

Jianjian Qin, Chao Zhang, Chunzhi Gu, Zi Wang, Jun Yu, Yijin Wei, Hui Xiao, Xin Yu

机构 * Ningbotech University(Ningbotech大学) University of Toyama(东洋大学) University of Fukui(福井大学) Niigata University(北九州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PD-REAL数据集,用于无监督3D域异常检测,通过多尺度教师-学生框架提升多模态异常检测性能,实验表明方法在检测精度上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18496 2026-03-20 cs.CV 57%

NymeriaPlus: Enriching Nymeria Dataset with Additional Annotations and Data

NymeriaPlus:通过额外标注和数据丰富Nymeria数据集

Daniel DeTone, Federica Bogo, Eric-Tuan Le, Duncan Frost, Julian Straub, Yawar Siddiqui, Yuting Ye, Jakob Engel, Richard Newcombe, Lingni Ma

机构 * Meta Reality Labs Research(Meta现实实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文通过改进人体动作标注、添加密集3D标注和多模态数据,提升Nymeria数据集的综合性能,为野外观测数据研究提供更强大的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18465 2026-03-20 cs.CV 57%

MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling

MedQ-UNI: 向通过视觉-语言建模实现医学图像质量评估与修复的统一迈进

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MedQ-UNI,一种统一的视觉-语言模型,通过先评估再修复的范式,利用医学图像质量评估指导医学图像修复,实现了跨模态和降质类型的统一处理。

详情

展开后加载摘要…

URL PDF HTML 收藏