Tree of Attributes Prompt Learning for Vision-Language Models
机构 * Harvard University(哈佛大学) ; Mass General Brigham(麻省总医院) ; Microsoft(微软公司)
专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Harvard University(哈佛大学) ; Mass General Brigham(麻省总医院) ; Microsoft(微软公司)
专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)
Comments 11 pages, 8 figures
专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)
专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments accepted by WACV2025
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project webpage: https://laubravo.github.io/apu_website/
专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)
Comments 23 pages
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at ICLR 2024 (Spotlight)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments accepted at TMLR, Camera Ready Version
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted and to be published in IEEE Congress on Evolutionary Computation (CEC) 2024. Copyright 2024 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses
Journal ref IEEE Congress on Evolutionary Computation (CEC), 2024, 1-8
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted in Fifth IEEE Workshop on Artificial Intelligence for HealthCare, IEEE 25th International Conference on Information Reuse and Integration for Data Science
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments The paper is accepted at ICML 2024
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments EMNLP 2023. Add the Exact Match/Accuracy results of Reliability and T-Generality
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR2024; Codes are available at \url{https://github.com/YBZh/DMN}
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments TMLR 2024; Project Website: https://adymaharana.github.io/cococon/
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2024 (project page: https://ecoflap.github.io/)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments International Journal of Computer Vision (IJCV), 2022. Update: Adds results on the DOSCO (DOmain Shift in COntext) benchmark
PUMA: 基于层剪枝的语言模型,用于具有模态自适应学习的高效统一多模态检索
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 其他VLM :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出PUMA,通过层剪枝自蒸馏减少MLLM参数,并设计模态自适应对比学习损失(MAC-Loss)提升检索效率,在降低资源消耗的同时保持性能。
视觉-语言模型是脆弱的多语言关联器
机构 * Manipal University Jaipur(斋浦尔马尼帕尔大学) ; University of North Carolina Charlotte(北卡罗来纳大学夏洛特分校) ; University of Salford(索尔福德大学) ; University of Manchester(曼彻斯特大学) ; Indian Statistical Institute Kolkata(印度统计研究所加尔各答分所)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视觉-语言模型的多语言关联稳定性问题,构建M²BIND基准,发现其跨语系/文字时会出现绑定崩溃,关系密切语言则表现较好,表明多语言部署的VLMs关联质量存疑。
Comments Preprint (under review). Project Page: https://ritabrata04.github.io/m2bind/
胸部X光医学视觉语言模型审计:估算跨机构参考一致性
机构 * University College Dublin(都柏林大学学院) ; School of Computer Science, University College Dublin(都柏林大学学院计算机科学学院) ; The Third Affiliated Hospital of Southern Medical University(南方医科大学第三附属医院) ; Dublin City University(都柏林城市大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 该研究通过评估三个生成式视觉语言模型在胸部X光数据上的表现,估算跨机构参考一致性,发现无法推荐默认估算器,且参考一致性需按站点和接口重新评估。
Comments 10 pages, 3 figures, 3 tables
几何在发挥作用吗?对双曲视觉-语言模型层次性的工作点审计
机构 * MADI
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本研究针对双曲视觉-语言模型是否利用其几何特性的问题,提出多组诊断指标审计三类主流模型,发现其实际未激活双曲径向/锥机制,层次性表现与几何特性无关。
Comments 48 pages, 5 figures, Under review at TMLR
SAB-LVLM: 面向大型视觉-语言模型的重要性感知二值化
机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人学国家重点实验室) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 提出SAB-LVLM方法,通过构建空间重要性图与模态引导整合策略,实现跨层跨模态权重重要性感知的二值化,在约1比特压缩下优于现有二值化方法。
The Professor: 面向视觉语言模型的多教师无监督提示蒸馏
机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 提出多教师提示蒸馏方法TheProfessor,融合领域微调教师和零样本教师,在四个数据集上平均HM提升1.77点,尤其对域偏移数据集效果显著。
JMed48k:用于视觉语言模型评估的多专业日本医疗执照基准
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Kyoto University(京都大学) ; The University of Tokyo(东京大学) ; Hohai University(淮海大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Toronto(多伦多大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出JMed48k,一个包含48,862道试题和20,142张图像的多专业日本医疗执照基准,通过评估21个模型并引入配对图像移除审计,发现专有和开源模型显著受益于图像,而医学专用模型对视觉证据利用有限。
SenseBench: 一个用于遥感低级视觉感知与描述的大型视觉-语言模型基准
机构 * Wuhan University(武汉大学) ; Shanghai Artificial Intelligent Laboratory(上海人工智能实验室)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出SenseBench,首个专为遥感低级视觉感知与描述设计的基准,通过物理基础的分层分类体系,评估29种先进VLMs在遥感降质识别中的性能,揭示领域先验偏差、多退化崩溃、流畅性幻觉及感知-描述反转效应。