In-Context Collapse in Vision-Language Models and How to Mitigate it?
视觉语言模型中的上下文坍缩及其缓解方法
机构 * Amazon Generative AI Innovation Center(亚马逊生成式AI创新中心)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文发现视觉语言模型存在随演示增多的上下文坍缩问题,通过因果定位将其归因于视觉-语言整合通路,提出CircA干预方法可有效缓解该问题并实现抗坍缩能力迁移。