Aesthetic Image Captioning with Saliency Enhanced MLLMs
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Link to publicly available codes is added
机构 * Academy for Engineering and Technology, Fudan University(工程与技术学院,复旦大学) ; Fudan University(复旦大学) ; Zhongshan Hospital, Fudan University(复旦大学中山医院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments This work has been submitted to the IEEE TMI for possible publication
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Adobe Research(Adobe研究) ; The University of New South Wales(新南威尔士大学) ; CSIRO’s Data61(澳大利亚联邦科学与工业研究组织的数据61)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
Comments 9 pages
机构 * Computer Science Department Faculty of Sciences, Rabat(科学学院计算机科学系,拉巴特) ; Computer Science Department FLSH(计算机科学系FLSH)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Microsoft(微软) ; The HongKong Polytechnical University(香港理工大学)
专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
Comments CVPR2024, Code and Demo link:https://github.com/CircleRadon/Osprey
机构 * Beihang University(北航大学) ; National University of Singapore(国立新加坡大学) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * Flowers AI & CogSci Lab, Inria, France(Flowers AI与认知科学实验室,Inria,法国) ; MIT, USA(麻省理工学院,美国)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI
机构 * École de Technologie Supérieure (ÉTS)(École de Technologie Supérieure) ; Université Catholique de Louvain (UCLouvain)(Université Catholique de Louvain) ; Université de Mons (UMons)(Université de Mons)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * ByteDance Inc.(字节跳动公司)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments project url: https://one-reward.github.io
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments CV4A11y@ICCV 2025
机构 * Indian Institute of Technology Jodhpur(印度理工学院朱道普尔)
专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
机构 * HyperVerge
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * College of Engineering, Purdue University(普渡大学工程学院)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
机构 * AI Chip Center for Emerging Smart Systems(新兴智能系统人工智能芯片中心) ; The Hong Kong University of Science(香港科学大学) ; Zhejiang University College of Computer Science(浙江大学计算机科学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Basic Algorithm Center, PCG, Tencent(腾讯基础算法中心、PCG、腾讯)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Nanyang Technological University(南洋理工大学) ; Columbia University(哥伦比亚大学) ; Damo Academy, Alibaba Group(阿里集团大模型学院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments ICCV2023
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; Tongji University(同济大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted to TPAMI
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; China Mobile Research Institute(中国移动研究院) ; Shanghai AI Lab(上海AI实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICCV 2025; Code released at https://github.com/MCG-NJU/p-MoD
机构 * ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 18 pages, 12 figures
机构 * School of Medicine, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)医学院) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Wave and Machine Intelligence Department, Technology Innovation Institute(技术创新研究院波浪与机器智能部门) ; University of the Chinese Academy of Sciences(中国科学院大学) ; McGill University(麦吉尔大学)
专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV
Comments 10 pages
机构 * University of Maryland(马里兰大学) ; Meta
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments ICCV 2025
机构 * EEEI, University of the Philippines(电子工程学院,菲律宾大学) ; AI Graduate Program, University of the Philippines(人工智能研究生项目,菲律宾大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments 14 pages, accepted in ICCV 2025 Workshop on RetailVision
机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; Institute of Automation, CAS(中国科学院自动化研究所)
专题命中 VLM训练与架构 :VLM(abstract);multimodal large language model(abstract);分类 cs.CV
Comments ICCV 2025. Project released at: https://mashijie1028.github.io/GenHancer/
机构 * Florida Institute of Technology(佛罗里达理工学院) ; Microsoft Research(微软研究院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
Comments Accepted to ICCV 2025, MARS2 Workshop. Total 14 pages, 12 figures and 3 tables
机构 * Samsung AI Center(三星AI中心) ; Mountain View University of California, Santa Barbara(山景城加州大学圣巴巴拉分校)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments International Conference on Computer Vision (ICCV) 2025
机构 * Purdue University(普渡大学) ; Amazon(亚马逊)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV