SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models
SAB-LVLM: 面向大型视觉-语言模型的重要性感知二值化
Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu, Zhi Han
机构
*
State Key Laboratory of Robotics and Intelligent Systems(机器人学国家重点实验室)
;
Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Shanghai Jiao Tong University(上海交通大学)
SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis
SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练
Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du
机构
*
School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国)
;
Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国)
;
Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国)
;
National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国)
;
Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP
ReasonCLIP-58M: CLIP的视觉基础常识推理监督
Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah
机构
*
Khalifa University(卡利法大学)
;
University of Western Australia(西澳大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Melbourne(墨尔本大学)
;
University of Central Florida(佛罗里达中央大学)
Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction
通过代理特定偏差校正提高视觉-语言预训练模型上的对抗迁移性
Lijia Yu, Jiuxin Cao, Yuchen Qiang, Changhao Chen, Yifei Huang, Bo Liu
机构
*
School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院)
;
Purple Mountain Laboratories(紫金山实验室)
;
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
机构
*
College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)
机构
*
China University of Petroleum (Beijing)(中国石油大学(北京))
;
Hainan Institute of China University of Petroleum (Beijing)(中国石油大学(北京)海南学院)
;
South China Normal University(华南师范大学)
Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models
Circle-RoPE: 用于大视觉-语言模型的锥形解耦旋转位置嵌入
Chengcheng Wang, Jianyuan Guo, Hongguang Li, Yuchuan Tian, Ying Nie, Chang Xu, Kai Han
机构
*
Huawei Noah's Ark Lab.(华为诺亚实验室)
;
City University of Hong Kong.(香港城市大学)
;
University of Sydney.(悉尼大学)
;
State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学人工智能国家重点实验室,智能科学与技术学院)
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
打破大视觉-语言模型低比特量化中的模态异质性
Yi Zhong, Haotong Qin, Xindong Zhang, Lei Zhang, Guolei Sun
机构
*
VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院VCIP)
;
D-ITET, ETH Zürich(苏黎世联邦理工学院D-ITET)
;
OPPO Research Institute(OPPO研究院)
;
Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系)
ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition
ICED: 通过可解释的概念分解实现概念级机器去学习
Shen Lin, Jing Lin, Junhao Dong, Piotr Koniusz, Li Xu
机构
*
Fujian Normal University(福建师范大学)
;
Nanyang Technological University(南洋理工大学)
;
University of New South Wales(新南威尔士大学)
;
Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)
机构
*
Tsinghua University(清华大学)
;
Tsinghua University, Tencent(清华大学腾讯)
;
Tencent(腾讯)
;
University of Science and Technology Beijing(北京科技大学)
;
University of Macau(澳门大学)
From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models
机构
*
Department of Informatics, University of Salerno(萨勒诺大学信息学院)
;
Department of Information Security and Communication Technology (IIK), Norwegian University of Science and Technology(挪威科技大学信息安全部)
机构
*
College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡)
;
Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL))
;
Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
WikiSeeker: 重新思考视觉语言模型在基于知识的视觉问答中的作用
Yingjian Zhu, Xinming Wang, Kun Ding, Ying Wang, Bin Fan, Shiming Xiang
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室 (MAIS))