Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations
评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性
Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili
机构
*
University of Tehran(德黑兰大学)
;
Tehran University of Medical Sciences(德黑兰医科大学)
;
Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))
VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task
VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象
Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen
机构
*
Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Zhongguancun Academy(中关村学院)
6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models
6根手指,1个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点
Leon Mayer, Piotr Kalinowski, Caroline Ebersbach, Marcel Knopp, Tim Rädsch, Evangelia Christodoulou, Annika Reinke, Fiona R. Kolbinger, Lena Maier-Hein
机构
*
German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门)
;
Medical Faculty, Heidelberg University(海德堡大学医学院)
;
Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院)
;
HIDSS4Health - Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg(HIDSS4Health - 哈勃-马克斯信息与数据科学健康学院,卡尔斯鲁厄/海德堡)
;
Helmholtz Imaging, German Cancer Research Center (DKFZ)(哈勃-马克斯成像,德国癌症研究中心(DKFZ))
;
Engineering Faculty, Heidelberg University(海德堡大学工程学院)
;
School of Computation, Information and Technology, TUM(技术大学(TUM)计算、信息与技术学院)
;
Weldon School of Biomedical Engineering, Purdue University(普渡大学韦尔登生物医学工程学院)
;
Department of Visceral, Thoracic and Vascular Surgery, University Hospital and Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology(visceral、胸腔和血管外科部门,技术大学(TUD)德累斯顿大学医院和医学院)
;
National Center for Tumor Diseases (NCT), NCT Heidelberg, a partnership between DKFZ and University Hospital Heidelberg(肿瘤疾病国家中心(NCT),海德堡NCT,DKFZ与海德堡大学医院之间的合作)
;
Heidelberg University Hospital, Surgical Clinic, Surgical AI Research Group(海德堡大学医院,外科诊所,外科人工智能研究组)
;
Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(Mohamed Bin Zayed人工智能大学(MBZUAI),阿布扎赫,阿拉伯联合酋长国)
机构
*
University of Science and Technology of China(中国科学技术大学)
;
National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
Zhejiang University(浙江大学)
;
Ant Group(蚂蚁集团)
机构
*
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)
;
Nanyang Technological University, Singapore(新加坡南洋理工大学)
;
University College London(伦敦大学学院)
;
Guangzhou University(广州大学)
;
Wuhan University(武汉大学)
;
Nanjing University(南京大学)
Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models
Med-StepBench:一种用于评估医学视觉-语言模型幻觉的分层推理框架
Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari, Tuan Dung Nguyen, Mai Hong Son, Mai Huy Thong, Quang Huy Nguyen, Thanh Trung Nguyen, Reza Farahbakhsh, Noel Crespi, Phi Le Nguyen
机构
*
AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,越南科学与技术大学)
;
SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris, France(SAMOVAR,法国电信南巴黎学院,巴黎理工学院)
;
Military Central Hospital, Vietnam(越南108军中心医院)
Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration
增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复
Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi
机构
*
Department of Electronics
;
Information \ 'an Jiaotong University Xi'an China
;
School of Information
;
Communications Engineering \ 'an Jiaotong University Xi'an China
;
School of Mathematics
;
Statistics \ 'an Jiaotong University Xi'an China
;
Information \ 'an Jiaotong University
;
Communications Engineering \ 'an Jiaotong University
;
Statistics \ 'an Jiaotong University
专题命中
幻觉与鲁棒性
:VLM(title,abstract);vision language model(abstract);分类 cs.AI
机构
*
Peking University(北京大学)
;
Math Magic(数学魔术)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室)
;
Dalian University of Technology(大连理工大学)
专题命中
幻觉与鲁棒性
:vision-language model(title);VLM(abstract);multimodal large language model(abstract);分类 cs.CV
LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience
NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving
NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架
Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay
机构
*
Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学)
;
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中
幻觉与鲁棒性
:vision language model(title,abstract);VLM(abstract);分类 cs.CV