机构
*
School of Information Science and Technology, Northwest University(西北大学信息科学与技术学院)
;
Laboratory of Intelligent Information Processing, Institute of Computing Technology(中国科学院计算技术研究所智能信息处理重点实验室)
RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
RSICCLLM:用于遥感图像变化描述的多模态大语言模型
Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu
机构
*
State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国)
;
Great Bay University, Dongguan, China(东莞Great Bay大学,中国)
;
Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国)
;
Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)
专题命中
VLM训练与架构
:multimodal large language model(title);vision-language model(abstract);分类 cs.CV
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室)
;
Hong Kong Polytechnic University(香港理工大学)
;
The University of Southern Queensland(南昆士兰大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV
Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models
Timage: 一种用于微调视觉语言模型的文本嵌入图像生成范式
Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han
机构
*
Fudan University(复旦大学)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
;
Tencent Jarvis Lab(腾讯贾维斯实验室)
;
Southern University of Science and Technology(南方科技大学)
专题命中
VLM训练与架构
:vision-language model(title);multimodal large language model(abstract);分类 cs.CV
DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval
DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索
Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik
机构
*
Sejong University(世宗大学)
;
Korea Advanced Institute of Science and Technology(韩国科学技术院)
;
Ulsan National Institute of Science and Technology(乌山国立科学研究院)
Attention Alignment Between Humans and Vision-Language Models
人类与视觉语言模型之间的注意力对齐
Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano
机构
*
Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所)
;
Department of Psychology, Princeton University(普林斯顿大学心理学系)
;
Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
;
Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心)
;
Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP
ReasonCLIP-58M: CLIP的视觉基础常识推理监督
Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah
机构
*
Khalifa University(卡利法大学)
;
University of Western Australia(西澳大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Melbourne(墨尔本大学)
;
University of Central Florida(佛罗里达中央大学)
专题命中
VLM训练与架构
:LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI