arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-18 至 2026-03-18 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2603.15800 2026-03-18 cs.CV cs.CL cs.CR 87%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,comments);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03951 2026-03-18 cs.CV 83%

ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。

Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16261 2026-03-18 cs.CV cs.AI 81%

AW-MoE: All-Weather Mixture of Experts for Robust Multi-Modal 3D Object Detection

AW-MoE:面向所有天气条件的专家混合方法用于鲁棒多模态3D目标检测

Hongwei Lin, Xun Huang, Chenglu Wen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建城市智能感知与计算重点实验室) School of Informatics, Xiamen University(厦门大学信息学院) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AW-MoE,通过引入天气感知路由和统一双模态增强方法,提升多模态3D目标检测在恶劣天气下的鲁棒性,实验表明其在恶劣天气下的性能提升达15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18466 2026-03-18 cs.CY cs.AI cs.CV 81%

Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos

多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试

Yixuan Shen, Peng He, Honglu Liu, Jinxuan Fan, Yuyang Ji, Tingting Li, Tianlong Chen, Kaidi Xu, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系) College of Chemistry, Beijing Normal University(北京师范大学化学学院) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SciIBI视频基准,用于分析科学课堂讨论,评估多模态模型在教学推理中的表现,发现模型在区分教学实践时存在局限,需更深入的推理。

Comments 17pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC 79%

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16181 2026-03-18 cs.CV cs.CR 79%

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15939 2026-03-18 cs.LG cs.AI 79%

Data-Local Autonomous LLM-Guided Neural Architecture Search for Multiclass Multimodal Time-Series Classification

数据本地自主LLM引导的神经架构搜索用于多类多模态时间序列分类

Emil Hardarson, Luka Biedebach, Ómar Bessi Ómarsson, Teitur Hrólfsson, Anna Sigridur Islind, María Óskarsdóttir

机构 * University of Southampton(南安普顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种数据本地的LLM引导神经架构搜索框架,用于多类多模态时间序列分类,通过轻量级融合MLP和专家架构联合搜索提升模型性能,减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13693 2026-03-18 cs.CV 79%

A WDLoRA-Based Multimodal Generative Framework for Clinically Guided Corneal Confocal Microscopy Image Synthesis in Diabetic Neuropathy

基于WDLoRA的多模态生成框架用于临床指导的糖尿病性周围神经病变角膜共聚焦显微镜图像合成

Xin Zhang, Liangxiu Han, Tam Sobeih, Yue Shi, Yalin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科学与视觉科学系) Faculty of Biology, Medicine and Health, University of Manchester(曼彻斯特大学生物、医学与健康学院) Department of Medicine, Weill Cornell Medicine-Qatar(韦尔·柯尔曼医学中心-卡塔尔医学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于WDLoRA的多模态生成框架,用于生成糖尿病性周围神经病变的角膜共聚焦显微镜图像,通过结合神经分割掩膜和疾病特异性临床提示,提升图像合成的解剖学一致性与临床诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07985 2026-03-18 cs.CL 79%

Multilingual, Multimodal Pipeline for Creating Authentic and Structured Fact-Checked Claim Dataset

多语言、多模态流水线用于创建真实且结构化的事实核查数据集

Z. Melce Hüsünbeyi, Virginie Mouilleron, Leonie Uhling, Daniel Foppe, Tatjana Scheffler, Djamé Seddah

机构 * Ruhr-Universität Bochum(博尔塔尔大学波恩)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一个多语言、多模态的数据收集与处理流水线,通过整合ClaimReview feeds、抓取完整驳斥文章、标准化异构声明裁定并添加结构化元数据和对齐的视觉内容,构建了法语和德语的事实核查数据集,提升了事实核查的可解释性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15880 2026-03-18 cs.LG cs.AI 70%

Electrodermal Activity as a Unimodal Signal for Aerobic Exercise Detection in Wearable Sensors

电导活动作为可穿戴传感器中有氧运动检测的单一信号

Rena Mira Krishna, Ramya Sankar, Shadi Ghiasi

机构 * Odle Middle School(Odle中学) ImagineQ Labs(ImagineQ实验室) Cambridge Center for International(剑桥国际中心) bellevue, WA, USA(西雅图,华盛顿州,美国) Research, United Kingdom(英国研究)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 研究探讨了仅使用电导活动特征是否能可靠区分静息与持续有氧运动,采用留一被试法验证,发现EDA单独分类在主体独立评估中表现中等,相位时间动态和事件时间对分类分离有贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 62%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16581 2026-03-18 cs.AI 57%

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

V-DyKnow:面向视觉语言模型的时间敏感知识动态基准

Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出V-DyKnow基准,评估视觉语言模型对时间敏感事实知识的处理能力,分析模型响应可靠性、知识更新方法有效性及过时预测原因,揭示当前VLM在多模态时间敏感知识获取与更新中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18344 2026-03-18 cs.CV 57%

A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles

多模态数据集及一个跟踪无人飞行器的基线系统

Tianyang Xu, Jinjie Gu, Xuefeng Zhu, XiaoJun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) School of Computer Science and Electronic Engineering and the Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学计算机科学与电子工程学院及视觉、语音与信号处理中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出多模态无人飞行器跟踪数据集MM-UAV,包含RGB、红外和事件信号三种模态,通过引入偏移引导自适应对齐模块和自适应动态融合模块,提升复杂环境下的跟踪性能。

Comments V3

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00168 2026-03-18 cs.CV 57%

Revisiting RGBT Tracking Benchmarks from the Perspective of Modality Validity: A New Benchmark, Problem, and Solution

重新审视RGBT跟踪基准测试:从模态有效性角度出发:一个新的基准、问题和解决方案

Zhangyong Tang, Tianyang Xu, Zhenhua Feng, Xuefeng Zhu, Chunyang Cheng, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音与信号处理中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MV-RGBT基准测试,针对多模态场景下的跟踪问题,引入'何时融合'新问题,并提出MoETrack解决方案,展示了其在多模态跟踪中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16741 2026-03-18 cs.LG q-bio.NC q-bio.QM stat.ML 50%

Bayesian Inference of Psychometric Variables From Brain and Behavior in Implicit Association Tests

基于隐性联想测试的脑和行为数据中心理量表变量的贝叶斯推断

Christian A. Kothe, Sean Mullen, Michael V. Bronstein, Grant Hanada, Marcelo Cicconet, Aaron N. McInnes, Tim Mullen, Marc Aafjes, Scott R. Sponheim, Alik S. Widge

机构 * Intheon Department of Psychiatry and Behavioral Sciences, University of Minnesota(大学医学院精神病学与行为科学系) Minneapolis VA Medical Center(明尼苏达州梅奥医疗中心) Institute for Health Informatics, University of Minnesota(健康信息学研究所) Deliberate AI

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种稀疏分层贝叶斯模型,利用多模态数据预测新参与者与精神疾病症状相关的体验,实现了比传统D-score方法更高的预测性能。

Comments 43 pages, 7 figures, 6 tables, submitted to: Journal of Neural Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06698 2026-03-18 cs.RO 50%

Crowd-FM: Learned Optimal Selection of Conditional Flow Matching-generated Trajectories for Crowd Navigation

Crowd-FM: 基于学习的条件流匹配生成轨迹的最优选择用于人群导航

Antareep Singha, Laksh Nanwani, Mathai Mathew P., Samkit Jain, Phani Teja Singamaneni, Arun Kumar Singh, K. Madhava Krishna

机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Tartu, Estonia(爱沙尼亚塔尔图大学) Inria, Université de Lorraine, France(法国里尔大学Inria研究院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出Crowd-FM方法,通过条件流匹配学习碰撞自由的轨迹生成策略,提升机器人在人群中的安全性和人似性。

Comments Accepted at IEEE ICRA 2026. Authors Antareep Singha and Laksh Nanwani have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏