Context-Dependent Affordance Computation in Vision-Language Models
视觉-语言模型中基于情境的可及性计算
机构 * Dissensus AI ; King’s College London(伦敦国王学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究揭示视觉-语言模型中可及性计算的高度情境依赖性,通过大规模实验显示超过90%的词汇描述受情境影响,提出动态本体投影方法替代静态世界建模。
Comments 33 pages, 13 tables, 3 figures. Code available at: https://github.com/studiofarzulla/semantic-vision