arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9111 篇

2603.25946 2026-03-30 cs.CV cs.AI cs.LG 81%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25613 2026-03-27 cs.CV cs.AI 81%

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

多模态大语言模型中的人口公平性:面部验证中性别和种族偏见的基准测试

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel

机构 * Idiap Research Institute(Idiap 研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文评估了九种开源多模态大语言模型在面部验证协议中的表现,揭示了不同种族和性别群体间的偏见差异,发现专用面部模型在性能和公平性上均优于通用模型。

Comments Accepted in CVPR 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23510 2026-03-26 cs.CL cs.AI 81%

Visuospatial Perspective Taking in Multimodal Language Models

多模态语言模型中的视觉空间视角转换

Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

机构 * University of Cambridge(剑桥大学) Department of Psychology(心理学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估多模态语言模型在视觉空间视角转换任务中的表现,发现其在需抑制自身视角以采用他人视角的层面2视角转换中存在显著缺陷,揭示了当前模型在协作场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI 81%

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19274 2026-03-23 cs.CL cs.AI 81%

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

CURE:临床理解和检索评估的多模态基准

Yannian Gu, Zhongzhen Huang, Linjie Mu, Xizhuo Zhang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, China(商汤研究院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17759 2026-03-20 cs.CL cs.AI 81%

Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor

有害或幽默:一个多模态、多语言的基准测试用于显性与隐性有害幽默

Ahmed Sharshar, Hosam Elgendy, Saad El Dine Ahmed, Yasser Rohaim, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) INSAIT

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态、多语言基准测试,用于检测和理解有害和冒犯性幽默,通过对比不同模型在英语和阿拉伯语中的表现,强调文化背景和推理能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16974 2026-03-19 cs.CV cs.AI 81%

Are a Thousand Words Better Than a Single Picture? Beyond Images -- A Framework for Multi-Modal Knowledge Graph Dataset Enrichment

千言胜过一幅图?超越图像——一个多模态知识图谱数据集增强框架

Pengyu Zhang, Klim Zaporojets, Jie Liu, Jia-Hong Huang, Paul Groth

机构 * University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学,荷兰阿姆斯特丹) Aarhus University, Aarhus, Denmark(哥本哈根大学,丹麦阿arhus) Amazon AGI, Seattle, USA(亚马逊人工智能实验室,美国西雅图)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Beyond Images框架,通过多阶段流程增强多模态知识图谱数据集,利用文本描述和大语言模型融合多源信息,提升图谱完成性能,实验显示在多个数据集上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16261 2026-03-18 cs.CV cs.AI 81%

AW-MoE: All-Weather Mixture of Experts for Robust Multi-Modal 3D Object Detection

AW-MoE:面向所有天气条件的专家混合方法用于鲁棒多模态3D目标检测

Hongwei Lin, Xun Huang, Chenglu Wen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建城市智能感知与计算重点实验室) School of Informatics, Xiamen University(厦门大学信息学院) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AW-MoE,通过引入天气感知路由和统一双模态增强方法,提升多模态3D目标检测在恶劣天气下的鲁棒性,实验表明其在恶劣天气下的性能提升达15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18466 2026-03-18 cs.CY cs.AI cs.CV 81%

Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos

多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试

Yixuan Shen, Peng He, Honglu Liu, Jinxuan Fan, Yuyang Ji, Tingting Li, Tianlong Chen, Kaidi Xu, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系) College of Chemistry, Beijing Normal University(北京师范大学化学学院) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SciIBI视频基准,用于分析科学课堂讨论,评估多模态模型在教学推理中的表现,发现模型在区分教学实践时存在局限,需更深入的推理。

Comments 17pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05264 2026-03-17 cs.CV cs.AI 81%

Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation

迈向3D人体姿态估计中多模态学习的平衡

Mengshi Qi, Jiaxuan Peng, Xianlin Zhang, Huadong Ma

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种平衡多模态学习方法,利用RGB、LiDAR、毫米波和WiFi数据,通过Shapley值算法评估模态贡献并解决模态不平衡问题,提升复杂环境下3D姿态估计性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14559 2026-03-17 cs.CV cs.AI cs.IR 81%

A comprehensive multimodal dataset and benchmark for ulcerative colitis scoring in endoscopy

一种全面的多模态数据集和基准用于内镜溃疡性结肠炎评分

Noha Ghatwary, Jiangbei Yue, Ahmed Elgendy, Hanna Nagdy, Ahmed Galal, Hayam Fathy, Hussein El-Amin, Venkataraman Subramanian, Noor Mohammed, Gilberto Ochoa-Ruiz, Sharib Ali

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个包含专家标注的MES和UCEIS评分及临床描述的多中心多分辨率数据集,结合双评分指标和专家生成的图像描述,为开发具有临床意义的多模态算法提供新机遇。

Comments 11

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13886 2026-03-17 cs.CV cs.AI 81%

Multi-Modal Character Localization and Extraction for Chinese Text Recognition

多模态字符定位与提取用于中文文本识别

Qilong Li, Chongsheng Zhang

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LER方法,通过解耦字符并考虑中文复杂结构,提升中英文文本识别性能,实验表明在大规模中文和英文基准上均取得显著成果。

Comments On January 08th, 2026, this paper has been accepted by the IEEE Transactions on Multimedia journal. To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13590 2026-03-17 cs.CV cs.AI 81%

Opportunistic Cardiac Health Assessment: Estimating Phenotypes from Localizer MRI through Multi-Modal Representations

机会性心脏健康评估:通过多模态表示从局部定位MRI估计表型

Busra Nur Zeybek, Özgün Turgut, Yundi Zhang, Jiazhen Pan, Robert Graf, Sophie Starck, Daniel Rueckert, Sevgi Gokce Kafali

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与健康中的研究所,慕尼黑技术大学(TUM)和TUM大学医院) Department of Diagnostic and Interventional Neuroradiology, School of Medicine, TUM University Hospital(诊断与介入神经放射科,医学院,TUM大学医院) Department of Computing, Imperial College London(计算学院,伦敦帝国学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出C-TRIP框架,通过融合局部定位MRI、ECG和表格数据,利用低成本信息预测心脏表型,提升心脏健康评估的可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13427 2026-03-17 cs.CV cs.AI 81%

MIBench: Evaluating LMMs on Multimodal Interaction

MIBench: 评估大多模态模型在多模态交互中的能力

Yu Miao, Zequn Yang, Yake Wei, Ziheng Chen, Haotian Ni, Haodong Duan, Kai Chen, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学人工智能学院,北京,中国) Beijing Key Laboratory of Research on Large Models(大型模型研究关键实验室) Beihang University, Beijing, China(北京航空航天大学,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MIBench通过多模态交互三元组评估大模型在多模态任务中的能力,发现模型在多模态交互上存在局限性,易受文本干扰,且在基础协同能力上表现不足。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10722 2026-03-17 cs.CV cs.AI 81%

UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark

无人机交通场景理解:一种嵌入监管的多模态网络和一个统一的基准

Yu Zhang, Zhicheng Zhao, Ze Luo, Chenglong Li, Jin Tang

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing 100190, China(中国科学院计算机网络信息中心,北京100190,中国) University of Chinese Academy of Sciences, Beijing 100190, China(中国科学院大学,北京100190,中国) Anhui Provincial Key Laboratory of Multi-modal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥230601,中国) Information Materials and Intelligent Sensing Laboratory of Anhui Province, Anhui University, Hefei 230601, China(安徽省信息材料与智能感知实验室,安徽大学,合肥230601,中国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MTCNet多模态交通认知网络,通过原型引导知识嵌入模块和质量感知光谱补偿模块,提升无人机交通场景理解的鲁棒性,并构建首个大规模光学-热红外基准Traffic-VQA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18507 2026-03-16 cs.CV cs.AI 81%

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

多场景视角下的多模态持续学习与MLLMs

Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNIFIER框架,通过视觉表征扩展和视觉一致性约束解决多场景下的持续学习问题,提升跨场景视觉问答和F1分数。

Comments 22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05271 2026-03-12 cs.CV cs.AI 81%

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2:迈向代理多模态模型

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。

Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI 81%

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09155 2026-03-11 cs.CL cs.AI 81%

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz Abdolrahim

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。

Comments Accepted at Digital Discovery (Royal Society of Chemistry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11202 2026-03-10 cs.CV cs.AI cs.LG 81%

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

一种鲁棒的不完整多模态低秩适应方法用于情感识别

Xinkui Zhao, Jinsong Shu, Yangyang Wu, Guanjie Cheng, Zihe Liu, Naibo Wang, Shuiguang Deng, Zhongle Xie, Jianwei Yin

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MCULoRA方法,通过解耦模态组合的共享信息和动态调整参数微调,提升不完整多模态学习模型的训练效率和下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04763 2026-03-06 cs.CV cs.AI cs.LG 81%

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

评估GPT-5作为多模态临床推理者的有效性:领域评论

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文评估GPT-5在多模态临床推理中的表现,发现其在文本推理和部分视觉问答任务中优于GPT-4o,但在神经放射学和乳腺摄影等专业领域仍显不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI 81%

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 81%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16985 2026-03-05 cs.CV cs.AI cs.LG cs.RO 81%

Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation

极简多模态异常合成用于分布外检测与分割

Moru Liu, Hao Dong, Jessica Kelly, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所) EPFL(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出极简多模态异常合成方法Feature Mixing,通过理论支持提升OOD检测性能,实验表明其在多个数据集上达到最优效果,速度提升显著。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03241 2026-03-04 cs.CV cs.AI 81%

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13139 2026-03-04 cs.CV cs.CL 81%

Multimodal Integration of Human-Like Attention in Visual Question Answering

多模态人类样注意机制在视觉问答中的整合

Ekta Sood, Fabian Kögel, Philipp Müller, Dominike Thomas, Mihai Bace, Andreas Bulling

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MULAN通过整合文本和图像显著性模型的注意预测,提升了VQA模型的性能,同时减少参数数量,达到新的准确率水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13116 2026-03-04 cs.CV cs.CL 81%

VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering

VQA-MHUG:一个用于研究视觉问答中多模态神经注意机制的注视数据集

Ekta Sood, Fabian Kögel, Florian Strohm, Prajit Dhar, Andreas Bulling

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 VQA-MHUG数据集用于研究视觉问答中多模态神经注意机制,发现文本注意与模型性能的相关性是提升VQA性能的关键因素。

Comments CoNLL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02200 2026-03-03 cs.CV cs.AI cs.LG 81%

Adaptive Confidence Regularization for Multimodal Failure Detection

多模态故障检测的自适应置信度正则化

Moru Liu, Hao Dong, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应置信度正则化方法,通过检测多模态预测中的置信度退化,提升故障识别的可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00041 2026-03-03 cs.CV cs.AI 81%

Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness

文化在框架中:C$^3$B作为基于漫画的多模态文化意识基准

Yuchen Song, Andong Chen, Wenxin Zhu, Kehai Chen, Xuefeng Bai, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 C$^3$B是一个基于漫画的多模态文化意识基准,旨在评估和提升多语言、多任务和多文化环境下MLLMs的文化理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00115 2026-03-03 physics.soc-ph cs.AI cs.CV 81%

Multimodal Modular Chain of Thoughts in Energy Performance Certificate Assessment

多模态模块化思维链在能源性能证书评估中的应用

Zhen Peng, Peter J. Bentley

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于多模态模块化思维链的低成本EPC预评估方法,通过结构化提示实现对EPC评分的序数结构捕捉,实验表明其在数据稀缺环境下具有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏