FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology
Faizan Farooq Khan, Yousef Radwan, Eslam Abdelrahman, Abdulwahab Felemban, Aymen Mir, Nico K. Michiels, Andrew J. Temple, Michael L. Berumen, Mohamed Elhoseiny
机构
*
King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院)
;
Red Sea Research Center, KAUST(红海研究中心,KAUST)
;
Tübingen University(图宾根大学)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV
VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation
Ziang Ye, Yang Zhang, Wentao Shi, Xiaoyu You, Fuli Feng, Tat-Seng Chua
机构
*
University of Science and Technology of China(中国科学技术大学)
;
National University of Singapore(新加坡国立大学)
;
East China University of Science and Technology(东华大学)
Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey
Chenyang Liu, Jiafan Zhang, Keyan Chen, Man Wang, Zhengxia Zou, Zhenwei Shi
机构
*
Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航空航天智能科学与技术系,航天学院,北航)
;
Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education, China(航天器设计优化与动态仿真技术重点实验室,教育部,中国)
;
College of Computer Science, Inner Mongolia University(计算机科学学院,内蒙古大学)
;
Shen Yuan Honors College of Beihang University(盛元荣誉学院,北航)
机构
*
Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou), China(香港理工大学(广州)人工智能研究所)
;
Mononai AI, Sweden(蒙诺人工智能)
;
College of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院)
;
School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院)
;
Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)
;
School of Automation, Southeast University(东南大学自动化学院)
;
College of Science and Engineering, James Cook University(詹姆斯库克大学科学与工程学院)
;
School of Transportation, Southeast University(东南大学交通运输学院)
机构
*
National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(多媒体软件国家工程研究中心,计算机科学学院,武汉大学)
;
School of Computing, National University of Singapore(计算学院,新加坡国立大学)
;
School of Computer Science, Peking University(计算机科学学院,北京大学)
;
State Key Laboratory for Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)
机构
*
Department of Biomedical Engineering(生物医学工程系)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Department of Machine Learning(机器学习系)
;
Department of Radiation Oncology(放射肿瘤科)
;
Emory University School of Medicine(埃默里大学医学院)
;
University of Southern California(南加州大学)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
Xiaoxu Xu, Yitian Yuan, Qiudan Zhang, Wenhui Wu, Zequn Jie, Lin Ma, Xu Wang
机构
*
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
Meituan Inc.(美团公司)
;
College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院)
;
Guangdong Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室)
Propose and Rectify: A Forensics-Driven MLLM Framework for Image Manipulation Localization
Keyang Zhang, Chenqi Kong, Hui Liu, Bo Ding, Xinghao Jiang, Haoliang Li
机构
*
Department of Electrical Engineering, City University of Hong Kong(香港城市大学电子工程系)
;
Rapid-Rich Object Search (ROSE) Lab, School of Electrical and Electronic Engineering, Nanyang Technology University(南洋理工大学电子与电气工程学院快速丰富对象搜索(ROSE)实验室)
;
Shanghai Jiao Tong University(上海交通大学)
专题命中
视觉定位与Grounding
:MLLM(title);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding
Jian Hu, Zixu Cheng, Shaogang Gong, Isabel Guan, Jianye Hao, Jun Wang, Kun Shao
机构
*
Queen Mary University of London(伦敦女王学院)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
University College London(伦敦大学学院)
Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding
Jun Li, Che Liu, Wenjia Bai, Mingxuan Liu, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel
机构
*
Technical University of Munich(慕尼黑技术大学)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
Imperial College London(伦敦帝国学院)
;
University of Trento(特伦托大学)
;
Helmholtz AI and Helmholtz Munich(海德堡人工智能与海德堡慕尼黑)
;
King’s College London(伦敦国王学院)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
Yi Nian, Shenzhe Zhu, Yuehan Qin, Li Li, Ziyi Wang, Chaowei Xiao, Yue Zhao
机构
*
University of Southern California(南加州大学)
;
University of Toronto(多伦多大学)
;
University of Maryland(马里兰大学)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中
视觉定位与Grounding
:vision-language model(title);VLM(abstract);multimodal large language model(abstract);分类 cs.AI
Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study
Leon Mayer, Tim Rädsch, Dominik Michael, Lucas Luttner, Amine Yamlahi, Evangelia Christodoulou, Patrick Godau, Marcel Knopp, Annika Reinke, Fiona Kolbinger, Lena Maier-Hein
机构
*
organization= German Cancer Research Center (DKFZ) Heidelberg, Div. Intelligent Medical Systems , country= Germany
;
organization= National Center for Tumor Diseases (NCT), NCT Heidelberg , country= Germany
;
Data Science School for Health , country= Germany
;
organization= Medical Faculty, Heidelberg University , country= Germany
;
organization= Faculty of Mathematics
;
Computer Science, Heidelberg University , country= Germany
;
organization= Weldon School of Biomedical Engineering, Purdue University , city= West Lafayette , state= IN , country= USA
;
organization= Regenstrief Center for Healthcare Engineering (RCHE), Purdue University , city= West Lafayette , state= IN , country= USA
;
organization= Department of Biostatistics
;
Health Data Science, Richard M. Fairbanks School of Public Health, Indiana University School of Medicine , city= Indianapolis , state= IN , country= USA
;
organization= Department of Surgery, Indiana University School of Medicine , city= Indianapolis , state= IN , country= USA
;
organization= Department of Visceral, Thoracic
;
Vascular Surgery, University Hospital
;
Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology , city= Dresden , country= Germany
专题命中
视觉定位与Grounding
:vision-language model(title);vision language model(abstract);visual language model(abstract);分类 cs.CV
机构
*
School of Computing and Artificial Intelligence,Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)
;
South China University of Technology(华南理工大学)
;
Institute for infocomm research, A*STAR(信息通信研究所,A*STAR)
专题命中
视觉定位与Grounding
:vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
机构
*
Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine, Hangzhou, Zhejiang, China(放射科、浙江大学医学院附属第一医院、浙江大学医学院)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV