NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving
NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架
Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay
机构
*
Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学)
;
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中
幻觉与鲁棒性
:vision language model(title,abstract);VLM(abstract);分类 cs.CV
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
LMOD+: 一个全面的多模态数据集和基准,用于开发和评估眼科中的多模态大语言模型
Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen
机构
*
School of Medicine, Yale University(耶鲁大学医学院)
;
School of Computing, Australian National University(澳大利亚国立大学计算机学院)
;
School of Engineering, Imperial College London(伦敦帝国理工学院工程学院)
;
School of Computing, University of Georgia(佐治亚大学计算机学院)
;
Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨秀隆医学学院)
;
National Eye Institute, National Institutes of Health(美国国立卫生研究院眼科研究所)
;
National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆)
;
School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算机技术学院)
专题命中
幻觉与鲁棒性
:multimodal large language model(title,abstract);分类 cs.CV
机构
*
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Microsoft AI Superintelligence(微软人工智能超智实验室)
;
Lambda, Inc(Lambda公司)
专题命中
幻觉与鲁棒性
:vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
FINER: MLLMs Hallucinate under Fine-grained Negative Queries
FINER:MLLMs在细粒度负查询下产生幻觉
Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz
机构
*
Technical University of Munich(慕尼黑技术大学)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心)
;
Google(谷歌)
;
LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.CV、cs.AI
SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models
SCAM:多模态基础模型的现实世界字形鲁棒性评估
Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe
机构
*
BLISS e.V.(BLISS协会)
;
Berliner Hochschule für Technik (BHT)(柏林技术大学)
;
Technische Universität Berlin(柏林技术大学)
;
KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院)
;
Merantix Momentum(Merantix Momentum公司)
;
Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)