Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification
通过证据不确定性量化检测大视觉-语言模型的误行
Tao Huang, Rui Wang, Xiaofei Liu, Yi Qin, Li Duan, Liping Jing
机构
*
State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室)
;
Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)
;
School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
;
School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院)
;
Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)
Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
Dyslexify: 一种针对CLIP中印刷攻击的机制性防御
Lorenz Hufe, Constantin Venhoff, Erblina Purelku, Maximilian Dreyer, Sebastian Lapuschkin, Wojciech Samek
机构
*
Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所)
;
University of Oxford(牛津大学)
;
Technological University Dublin(都柏林技术大学)
;
Technische Universität Berlin(柏林技术大学)
CommentsarXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics
MediX-R1: Open Ended Medical Reinforcement Learning
MediX-R1:开放端医疗强化学习
Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Omair Mohamed, Mohamed Zidan, Fahad Khan, Salman Khan, Rao Anwer, Hisham Cholakkal
机构
*
Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈赫迈德·本·扎耶德人工智能大学)
;
Jubilee Mission Medical College(jubilee mission 医学院)
;
Research Institute(研究院)
;
JJM Medical College(JJM 医学院)
专题命中
VLM训练与架构
:VLM(abstract);multimodal large language model(abstract);分类 cs.CV
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知
Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen
机构
*
University of Macau(澳门大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Jiaotong University(上海交通大学)
;
Hefei University of Technology(合肥工业大学)
;
National University of Singapore(新加坡国立大学)
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
并非所有注意力都是必需的:面向多模态大语言模型的参数和计算高效迁移学习
Qiong Wu, Weihao Ye, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室)
;
Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences and University of Chinese Academy of Sciences, Beijing, China(深圳先进技术研究院,中国科学院和中国科学院大学,北京,中国)
;
Department of Pathology, Sun Yat-sen University Cancer Center, State Key Laboratory of Oncology in South China, Guangzhou, China(中山大学肿瘤中心病理科,南方肿瘤临床研究中心,广州,中国)
;
Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学,香港特别行政区,中国)
;
Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China(电子工程系,香港中文大学,香港特别行政区,中国)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳,中国)
专题命中
其他VLM
:visual language model(abstract);分类 cs.CV
机构
*
College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院)
;
Fudan University(复旦大学)
;
Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司)
;
University of Science and Technology Beijing(北京科技大学)
;
ByteDance(字节跳动)
;
School of Computer Science and Technology(计算机科学与技术学院)
;
Xi’an Jiaotong University(西安交通大学)