arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9087 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9087 篇

2608.05634 2026-08-07 cs.MM 新提交 83%

MEC-Patch: Visible-Infrared Cross-Modal Adversarial Attack Driven by Intrinsic Material Emissivity Laws

MEC-Patch:基于本征材料发射率定律的可见-红外跨模态对抗攻击

Zhixiang Huang, Xinbo Nie, Wenxuan Wang, Lu Yang, Xin Li, Xuelin Qian, Peng Wang

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.MM

AI总结 本文提出基于斯特藩-玻尔兹曼定律的MEC-Patch跨模态对抗攻击框架,结合NSGA-II与DAR策略,可欺骗多模态检测器并提升环境鲁棒性,为多模态感知系统安全评估提供新思路。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 83%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25806 2026-08-04 cs.CV 版本更新 83%

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

聚焦女性安全分析:多模态数据集能否增强VAD模型?

Sangeeta ., Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11924 2026-08-04 cs.CV cs.LG 交叉投稿 83%

Enriched text-guided variational multimodal knowledge distillation network (VMD) for automated diagnosis of plaque vulnerability in 3D carotid artery MRI

用于3D颈动脉MRI斑块易损性自动诊断的增强文本引导变分多模态知识蒸馏网络(VMD)

Bo Cao, Fan Yu, Mengmeng Feng, SenHao Zhang, Xin Meng, Yue Zhang, Zhen Qian, Jie Lu

机构 * department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(放射医学与核医学科,宣武医院,首都医科大学) Beijing Key Laboratory of Magnetic Resonance Imaging and Brain Informatics(北京磁共振成像与脑信息学重点实验室) Beijing United Imaging Research Institute of Intelligent Imaging(北京智能成像联合研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对3D颈动脉MRI斑块易损性自动诊断难题,提出VMD网络,利用跨模态先验知识提升未标注图像诊断准确率,经内部数据集实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04281 2026-07-31 cs.AI 版本更新 83%

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断

Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

机构 * University of Liverpool(利物浦大学) Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) Department of Eye and Vision Sciences(眼科与视觉科学系) Computer Science Department(计算机科学系) Cardiovascular & Metabolic Medicine(心血管与代谢医学) Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。

Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 83%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24739 2026-07-23 cs.CV 版本更新 83%

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准

Huu Tien Nguyen, Dac Thai Nguyen, The Minh Duc Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Huy Hieu Pham, Johan Barthelemy, Minh Quan Tran, Thanh Tam Nguyen, Quoc Viet Hung Nguyen, Quynh Anh Chau, Hong Son Mai, Thanh Trung Nguyen, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) Nagoya University, Japan(名古屋大学,日本) AIST, Japan(日本国家先进工业技术研究院) VinUniversity, Vietnam(文园大学,越南) NVIDIA, USA(NVIDIA,美国) Griffith University, Australia(格里菲斯大学,澳大利亚) Hanoi Medical University, Vietnam(河内医学院,越南) Military Central Hospital, Vietnam(越南108中央军医院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08879 2026-07-21 cs.CL 版本更新 83%

GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification

GRASP:基于双阶段优化的 grounded CoT 推理用于多模态讽刺目标识别

Faxian Wan, Xiaocui Yang, Yifan Cao, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 GRASP通过整合视觉定位与显式Co-T推理,解决多模态讽刺目标识别中的细粒度定位问题,提出MSTI-MAX数据集和双阶段联合优化策略,实验表明其在多模态讽刺目标识别中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新 83%

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 83%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 83%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08798 2026-07-13 cs.GR cs.CV 新提交 83%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 83%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17801 2026-07-07 cs.RO cs.CV 版本更新 83%

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31349 2026-07-01 eess.SP cs.AI 新提交 83%

PGUDA: Pressure-Guided Unsupervised Domain Adaptation with Cross-Modal Knowledge Distillation for sEMG-Based Gesture Recognition

PGUDA: 基于压力引导的无监督域适应与跨模态知识蒸馏用于sEMG手势识别

Yurui Liu, Xiao-Cong Zhong, Qisong Wang, Xuefu Wang, Dan Liu, Jinwei Sun

机构 * School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出PGUDA框架,利用压力信号的鲁棒性通过跨模态知识蒸馏引导sEMG特征对齐,在跨主体和跨会话任务中平均准确率58.08%,仅需5%标注数据即可达到全监督性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14286 2026-07-01 cs.CV 版本更新 83%

NeuralBoneReg: An Instance-Specific Label-Free Point Cloud-Based Method for Multi-Modal Bone Surface Registration

NeuralBoneReg:一种用于多模态骨表面注册的实例特定无标签点云方法

Luohong Wu, Matthias Seibold, Nicola A. Cavalcanti, Yunke Ao, Roman Flepp, Aidana Massalimova, Lilian Calvet, Philipp Fürnstahl

机构 * Research in Orthopedic Computer Science, Balgrist University Hospital, University of Zurich(骨科计算机科学研究所,巴尔格里斯大学医院,苏黎世大学) AI Center, ETH Zurich(人工智能中心,苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出NeuralBoneReg,一种自监督的基于点云的骨表面注册框架,通过隐式神经无符号距离场和MLP注册模块实现多模态数据间的鲁棒对齐,在多个数据集上达到或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新 83%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30027 2026-06-30 cs.CV 83%

Cross-Modal Iteration Distillation for Robust IHD Screening: The IDNet Framework and A New Benchmark

跨模态迭代蒸馏用于稳健的IHD筛查:IDNet框架与一个新基准

Yongchang Gao, Junjie Pang, Shuaiyu Yang, Yusheng Yang, Xichao Jia, Shaojie Li, Hongfei Zhang, Jia Mu

机构 * University of Chinese Academy of Sciences(中国科学院大学) MGI Tech Co., Ltd.(MGI科技有限公司) Shenzhen University(深圳大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出IDNet框架,通过跨模态蒸馏聚合器(CDA)融合左右眼眼底图像和稀疏临床变量,并构建UK Biobank基准,在IHD筛查中优于多种基线方法。

Comments Accepted to the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 83%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26654 2026-06-26 cs.CL cs.HC cs.IR 新提交 83%

SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context

SocialPersona: 基于多模态社交媒体上下文的个性化画像与回复基准测试

Qinkai Zhang, Yanyan Zhao, Xin Lu, Yulin Hu, Pengtao Han, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 提出SocialPersona基准,评估多模态大语言模型从社交媒体时间线推断用户偏好并用于对话的能力,实验表明模型在细粒度与近期偏好上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12716 2026-06-26 cs.CL 新提交 83%

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

AI审稿人是否看到全貌?攻击与防御多模态同行评审

Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。

Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 83%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16601 2026-06-16 cs.CV 新提交 83%

DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models

DifferAD-R1: 基于差异引导的多模态大语言模型工业异常定位

Dingrong Wang, Xian Tao, Zhen Qu, Hengliang Luo, Xinyi Gong, Fei Shen, Zhengtao Zhang, Guiguang Ding

机构 * Institute of Automation, Chinese Academy of Sciences (CAS)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASI Vision Technology Co., Ltd.(中科慧远视觉技术有限公司) Shandong Laboratory of Aluminum Advanced Manufacturing in Binzhou (SLAAMB), Binzhou Institute of Technology, Weiqiao-UCAS Science and Technology Park(山东省滨州市铝先进制造实验室(SLAAMB),滨州技术学院,魏桥国科科技园) Space Information Research Institute, Hangzhou Dianzi University(杭州电子科技大学空间信息研究院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 多模态评测 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出DifferAD-R1框架,通过差异引导双图像范式将异常定位转化为一次性差异定位问题,并设计双一致性定位奖励和难度感知策略,在AD-DualDiff数据集上优于现有方法。

Comments Submitted to IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14780 2026-06-16 cs.CV cs.LG 新提交 83%

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

YTClickbait21K:面向YouTube点击诱饵检测的多模态人工标注数据集,覆盖多样频道与内容类别

Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

机构 * Department of Computer Science and Engineering, Rajshahi University of Engineering & Technology(拉贾沙希工程与技术大学计算机科学与工程系) Department of Electrical Engineering, Qatar University(卡塔尔大学电气工程系) Department of Civil and Environmental Engineering, Qatar University(卡塔尔大学土木与环境工程系) SenseNet Inc.(SenseNet公司)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 为应对视频平台点击诱饵检测缺乏大规模高质量多模态数据的问题,构建了包含21,238个视频、来自29国40频道、覆盖新闻/娱乐/教育/游戏等类别的人工标注数据集YTClickbait21K,通过三人独立标注与多数投票确保质量,为多模态语义理解和自动内容审核提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14740 2026-06-16 cs.CV 新提交 83%

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

GridVQA-X: 评估多模态可解释性方法的框架

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru, Chirag Agarwal

机构 * IIIT Hyderabad(印度海得拉巴国际信息技术学院) University of Virginia(弗吉尼亚大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出GridVQA-X诊断框架,通过合成数据生成数学保证的解释,并训练纯推理与捷径依赖的配对模型,揭示现有可解释性方法无法区分真实跨模态推理与浅层捷径。

Comments 23 pages, 15 Figures, Accepted for poster presentation at CVPR 2026 TRUE-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10194 2026-06-10 cs.LG cs.AI 新提交 83%

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

MMClima:多模态气候科学数据与评估框架

Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad, Ufaq Khan, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Missouri(密苏里大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出MMClima,一个包含10万+专家验证问答对的多模态气候问答框架,覆盖文本、视频和图表,用于评估多模态语言模型在气候科学中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05913 2026-06-10 cs.CV 版本更新 83%

A fine-grained attention and geometric correspondence model for musculoskeletal risk classification in athletes using multimodal visual and skeletal features

基于多模态视觉和骨骼特征的运动员肌肉骨骼风险分类的细粒度注意力与几何对应模型

Md. Abdur Rahman, Mohaimenul Azam Khan Raiaan, Tamanna Shermin, Md Rafiqul Islam, Mukhtar Hussain, Sami Azam

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际联合大学) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, Dhaka(应用人工智能与智能系统实验室,达卡)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ViSK-GAT多模态框架,融合图像和骨骼坐标特征,通过细粒度注意力模块和几何对应模块实现运动员肌肉骨骼风险八级分类,关键指标超93%。

Comments Published in Computers and Electrical Engineering

Journal ref Computers and Electrical Engineering, Vol. 138, 111281, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07872 2026-06-09 cs.CV 新提交 83%

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03646 2026-06-03 cs.CV 83%

A Benchmark for Semi-supervised Multi-modal Crowd Counting

半监督多模态人群计数基准

Haoliang Meng, Xiaopeng Hong, Yabin Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文构建了首个半监督多模态人群计数基准,通过制定标准化协议和评估多种基线方法,为该任务奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00349 2026-06-01 cs.AI 83%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏