ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images
机构 * Media Evaluation Lab, ByteDance Inc.(字节跳动公司媒体评估实验室)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Media Evaluation Lab, ByteDance Inc.(字节跳动公司媒体评估实验室)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * IRMV Lab, the Department of Automation, Shanghai Jiao Tong University(IRMV实验室,自动化系,上海交通大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Extended journal version of arXiv:2506.03662
机构 * Guizhou University(贵州大学) ; Northeastern University(东北大学) ; UC Santa Cruz(加州大学圣克ruz分校)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
Comments For associated code and dataset, see https://github.com/neu-vi/XFacta
机构 * Computer Aided Medical Procedures (CAMP)(计算机辅助医疗程序) ; TU Munich, Germany(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; The First Affiliated Hospital of Sun Yat-Sen University(中山大学附属第一医院)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Code is available at https://github.com/xavier-yu114/Zoom-Refine
机构 * TNO(荷兰技术院) ; Intelligent Imaging(智能成像)
专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV
机构 * Laboratory of IEMN, Univ. Polytechnique Hauts-de-France(IEMN实验室,法国高等技术法国大学) ; KU 6G Research Center, Khalifa University(KU 6G研究中心,哈利法大学) ; Sorbonne Center for Artificial Intelligence, Sorbonne University(人工智能研究中心,索邦大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * University of Washington(华盛顿大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Seoul National University(首尔国立大学)
专题命中 视觉定位与Grounding :LLaVA(abstract);grounding(abstract);分类 cs.AI
机构 * King Abdullah University of Science and Technology(卡斯特大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * DeepGlint ; University of Technology Sydney(悉尼科技大学) ; Huawei London Research Center(华为伦敦研究中心) ; Imperial College London(伦敦帝国理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted as a highlight paper at ICCV 2025
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Rice University(Rice大学) ; Carnegie Mellon University(卡内基梅隆大学) ; AIFARMS ; Center for Digital Agriculture at UIUC(伊利诺伊大学厄巴纳-香槟分校数字农业中心)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Project Website: https://agmmu.github.io/ Huggingface: https://huggingface.co/datasets/AgMMU/AgMMU_v1/
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Sensetime
专题命中 视觉定位与Grounding :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Journal ref TPAMI 2025
机构 * AI Research(360人工智能研究院)
专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Accepted at ICCV 2025
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) ; ZTE(ZTE 公司)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 11 pages, 7 figures. This paper is accepted by ICCV 2025
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Institute of Laser Technology(上海激光技术研究所) ; Eye Hospital, Wenzhou Medical University(温州医学院眼医院) ; Monash University(墨尔本大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fuzhou University(福州大学) ; Fudan University(复旦大学) ; Imperial College London(伦敦帝国理工学院) ; Stanford University(斯坦福大学)
专题命中 视觉定位与Grounding :VLM(abstract);visual language model(abstract);分类 cs.CV
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments technical report
机构 * INESC-ID(INESC-ID研究所) ; Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院,里斯本大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 7 pages
机构 * Huazhong University of Science and Technology(华中科技大学) ; UC Santa Cruz(加州大学圣克ruz分校) ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
专题命中 视觉定位与Grounding :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Comments The dataset is publicly available at https://yunfeixie233.github.io/MedTrinity-25M/. Accepted to ICLR 2025
机构 * Northern Caribbean University(北加勒比大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * Autonomous University of Nuevo León(新莱昂自治大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) ; Shenzhen Research Institute, CUHK, Shenzhen, China(深圳研究学院) ; Technical University of Munich, Munich, Germany(慕尼黑技术大学) ; University of Strasbourg & IHU Strasbourg, Strasbourg, France(斯特拉斯堡大学及斯特拉斯堡IHU) ; University College London, London, United Kingdom(伦敦大学学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments MICCAI 2025. Project Page: MICCAI-2025-SurgTPGS/" target="_blank" rel="noopener">https://lastbasket.github.io/MICCAI-2025-SurgTPGS/
机构 * National Institute of Informatics(日本国立信息学研究所) ; The University of Tokyo(东京大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * Wuhan University(武汉大学) ; Insta360 ; Peking University(北京大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.AI
机构 * CSIRO’s Data61(澳大利亚CSIRO数据61研究所)
专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
Comments 6 pages, 3 figures, and 2 tables. paper is under review
机构 * Department of Computer Science and Engineering (CS&E), University of Minnesota(计算机科学与工程系(CS&E),明尼苏达大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Department of Electrical and Computer Engineering, University of Windsor(电气与计算机工程系,温莎大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * BUAA(北京航空航天大学) ; NUS(国立大学新加坡) ; Meituan(美团)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV