机构
*
State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Aerospace Information Research Institute(航天信息研究所)
;
Chinese Academy of Sciences(中国科学院)
;
School of Geographical Sciences(地理科学学院)
;
Hunan Normal University(湖南师范大学)
SCMM: Calibrating Cross-modal Representations for Text-Based Person Search
SCMM:基于文本的人脸搜索的跨模态表示校准
Jing Liu, Donglai Wei, Yang Liu, Sipeng Zhang, Tong Yang, Wei Zhou, Weiping Ding, Victor C. M. Leung
机构
*
College of Future Information Technology, Fudan University(复旦大学未来信息技术学院)
;
Department of Electrical and Computer Engineering, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系)
;
College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)
;
MEGVII Technology(MEGVII技术)
;
School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)
;
School of AI and CS, Nantong University(南通大学人工智能与计算机科学学院)
;
Academy of Artificial Intelligence, SMBU(SMBU人工智能学院)
;
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
Zhenhao Guo, Rachit Saluja, Tianyuan Yao, Quan Liu, Junchao Zhu, Haibo Wang, Daniel Reisenbüchler, Yuankai Huo, Benjamin Liechty, David J. Pisapia, Kenji Ikemura, Steven Salvatoree, Surya Seshane, Mert R. Sabuncu, Yihe Yang, Ruining Deng
机构
*
New York University(纽约大学)
;
Cornell Tech(康奈尔科技)
;
Vanderbilt University(范德比大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Regensburg(莱茵河畔大学)
;
Weill Cornell Medicine(韦尔·科恩医学中心)
;
Northwell Health(北well健康)
GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, Hongzhen Wang, Wenjing Yang, Bo Du, Jing Zhang
机构
*
College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院)
;
Beijing University of Posts and Telecommunications, China(北京邮电大学)
;
School of Computer Science, Wuhan University, China(武汉大学计算机学院)
;
Zhongguancun Academy, China(中关村学院)
;
Tsinghua University, China(清华大学)
;
Beihang University, China(北航大学)
专题命中
图文多模态
:multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV
Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning
Zhifang Zhang, Shuo He, Haobo Wang, Bingquan Shen, Lei Feng
机构
*
Southeast University(东南大学)
;
University of Queensland(昆士兰大学)
;
Nanyang Technological University(南洋理工大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
DistilCLIP-EEG: Enhancing Epileptic Seizure Detection Through Multi-modal Learning and Knowledge Distillation
Zexin Wang, Lin Shi, Haoyu Wu, Junru Luo, Xiangzeng Kong, Jun Qi
机构
*
Aliyun School of Big Data, Changzhou University(阿里云大数据学院,长洲大学)
;
Department of Computing, Xi’an JiaoTong-Liverpool University(计算系,西安交通大学-利物浦大学)
;
Department of Computer Science, University of Liverpool(计算机科学系,利物浦大学)
;
Center for Artificial Intelligence in Agriculture, Fujian Agriculture and Forestry University(农业人工智能中心,福建农林大学)
机构
*
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
;
School of Electronic and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院)
;
College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
Tan-Hanh Pham, Chris Ngo
机构
*
Harvard Medical School, Harvard University(哈佛医学院、哈佛大学)
;
Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提尼乌拉A.马丁努斯生物医学成像中心、麻省总医院)
;
Knovel Engineering Lab, Singapore(Knovel工程实验室、新加坡)
机构
*
Tsinghua University(清华大学)
;
Pengcheng Laboratory(鹏城实验室)
;
Guangming Laboratory(光明实验室)
;
Ant Group(蚂蚁集团)
;
Columbia University(哥伦比亚大学)
;
Southern University of Science and Technology(南方科技大学)
MM-Retinal: Knowledge-Enhanced Foundational Pretraining with Fundus Image-Text Expertise
Ruiqi Wu, Chenran Zhang, Jianle Zhang, Yi Zhou, Tao Zhou, Huazhu Fu
机构
*
School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)
;
Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(教育部新一代人工智能技术及其交叉应用重点实验室)
;
Nanjing University of Science and Technology, Nanjing, China(南京理工大学)
;
Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局)