机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Westlake University(西湖大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
CommentsAccepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/
Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索
Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis
机构
*
Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)
;
Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所)
;
University of Konstanz(康斯坦茨大学)
CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation
CCRC:面向图像变化描述与分割的变化感知描述与推理链
Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu
机构
*
College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国)
;
Guangxi Minzu University, China(广西民族大学,中国)
;
National University of Defense Technology, China(国防科学技术大学,中国)
专题命中
视觉定位与Grounding
:MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators
V-Reflection:将多模态大语言模型从被动观察者转变为主动提问者
Jiazhou Zhou, Yucheng Chen, Hongyang Li, Qing Jiang, Hu Zhou, Ying-Cong Chen, Lei Zhang
机构
*
AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)
;
International Digital Economy Academy(国际数字经济学院)
;
MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University, and Centre of AI in Medicine(医学视觉人工智能实验室,南洋理工大学Lee Kong Chian医学院,以及人工智能在医学中的中心)
;
South China University of Technology(华南理工大学)
;
Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)
专题命中
视觉定位与Grounding
:MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI