机构
*
College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)
;
College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院)
;
School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
专题命中
视觉定位与Grounding
:MLLM(title,summary_cn);multimodal large language model(abstract);分类 cs.CV
CommentsInitial controlled diagnostic study on 23 natural drawing sets and three VLMs; broader model, building, repeated-inference, and human coverage is planned for a subsequent version
RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding
RadPRISM:用于概念解耦图像表示与视觉定位的模式分层放射学报告监督方法
Fabian Drexel, Marlene Fritzsche, Era Stambollxhiu, Miriam Kumpf, Lena Schmitzer, Lea Schumann, Jannik Kahmann, Friedrich Puttkammer, Johannes Moll, Jannik Lübberstedt, Zeineb Ben Chaaben, Anirudh Narayanan, Cosmin I. Bercea, Sebastian Ziegelmayer, Marcus R. Makowski, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem
机构
*
Technical University of Munich (TUM)(慕尼黑工业大学(TUM))
;
TUM University Hospital(慕尼黑工业大学医院)
;
Technical University of Munich, School of Medicine and Health(慕尼黑工业大学医学与健康学院)
;
Klinikum rechts der Isar(右伊萨尔医院)
;
Charité – Universitätsmedizin Berlin(柏林夏里特医学院)
;
Freie Universität Berlin(柏林自由大学)
;
Humboldt Universität zu Berlin(柏林洪堡大学)
;
Imperial College London(伦敦帝国理工学院)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))
;
University Hospital Essen (AöR)(埃森大学医院(AöR))
;
Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所(IKIM))
;
Institute of Interventional and Diagnostic Radiology and Neuroradiology(介入与诊断放射学及神经放射学研究所)
;
National Center for Tumor Diseases West(西部肿瘤疾病国家中心)
机构
*
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)
;
School of Electrical Engineering and Automation, Fuzhou University(福州大学电气工程与自动化学院)
;
ByteDance(字节跳动)
FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection
FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析
Yaning Zhang, Jiao Wu, Zan Gao, Linlin Shen
机构
*
Shenzhen University(深圳大学)
;
Shandong Artificial Intelligence Institute(山东省人工智能研究院)
;
Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
;
Tianjin University of Technology(天津理工大学)