机构
*
School of Informatics, Xiamen University(厦门大学信息学院)
;
School of Computer Science, Nanjing University(南京大学计算机科学学院)
;
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
;
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)
Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings
基于概念的噪声负样本抑制用于零样本分类和胸片发现的 grounding
Chenyu Lian, Hong-Yu Zhou, Chun-Ka Wong, Jing Qin
机构
*
The Center for Smart Health, School of Nursing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能健康中心,护理学院,中国香港)
;
Research Institute for Smart Ageing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能老龄化研究 institute,中国香港)
;
School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University, Beijing, China(清华大学生物医学工程学院,清华大学,北京,中国)
;
Queen Mary Hospital, LKS Faculty of Medicine, The University of Hong Kong, Hong Kong, China(香港大学李嘉诚医学院Queen Mary医院,中国香港)
Language-Conditioned Visual Grounding with CLIP Multilingual
基于CLIP多语言的语言条件视觉 grounding
J. de Curtò, Mauro Liz, I. de Zarzà
机构
*
1 Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, Barcelona, Spain
;
3 Department of Electrical
;
Computer Engineering, Boston University, Boston, MA 02215, USA
;
4 Human centered AI, Data \& Software, LUXEMBOURG Institute of Science
IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models
IoUPD:用于多模态大语言模型视觉定位的IoU感知特权蒸馏
Xiuyuan Zhu, Ke Lu, Hao Wu, Siwen Jiao, Zijin Du, Dongming Zhang, Jian Xue
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
State Key Laboratory of Communication Content Cognition(通信内容认知技术国家重点实验室)
;
Peng Cheng Laboratory(鹏城实验室)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV
Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs
机构
*
The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)
;
Eisai Inc.(卫材株式会社)
;
IISc, Bangalore(印度科学研究所班加罗尔分校)
;
Cohere Labs Community(Cohere实验室社区)
专题命中
视觉定位与Grounding
:vision language model(title,abstract);grounding(title,abstract);分类 cs.CV
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
GraphThinker: 通过事件图思维强化时间感知的视频推理
Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li
机构
*
Queen Mary University of London(伦敦玛丽女王大学)
;
Samsung AI Centre Cambridge(剑桥三星人工智能中心)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Nanyang Technological University(南洋理工大学)
专题命中
视觉定位与Grounding
:grounding(summary_cn,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
University of Amsterdam(阿姆斯特丹大学)
;
University of Bristol(布里斯托大学)
;
Amazon AGI(亚马逊人工智慧)
;
College of Business and Economics(商学院和经济学学院)
;
University of Johannesburg(约翰内斯堡大学)
专题命中
视觉定位与Grounding
:grounding(summary_cn,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准
Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li
机构
*
Hinton STAI Institute(Hinton STAI研究所)
;
Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部))
;
School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院)
;
Zhejiang University(浙江大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Information Engineering University(信息工程大学)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
Yanyuan Chen, Dexuan Xu, Yu Huang, Songkun Zhan, Hanpin Wang, Dongxue Chen, Xueping Wang, Meikang Qiu, Hang Li
机构
*
School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学)
;
School of Computer Science, Peking University(计算机学院,北京大学)
;
National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学)
;
Peking University Sixth Hospital(北京大学第六医院)
;
Augusta University(奥古斯塔大学)
;
Peking University First Hospital(北京大学第一医院)
专题命中
视觉定位与Grounding
:vision language model(title,abstract);grounding(title,abstract);分类 cs.CV
A Survey on Video Temporal Grounding with Multimodal Large Language Model
Jianlong Wu, Wei Liu, Ye Liu, Meng Liu, Liqiang Nie, Zhouchen Lin, Chang Wen Chen
机构
*
School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
;
School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院)
;
School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)
;
Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV