Vision-Language Models are Fragile Multilingual Associators
视觉-语言模型是脆弱的多语言关联器
机构 * Manipal University Jaipur(斋浦尔马尼帕尔大学) ; University of North Carolina Charlotte(北卡罗来纳大学夏洛特分校) ; University of Salford(索尔福德大学) ; University of Manchester(曼彻斯特大学) ; Indian Statistical Institute Kolkata(印度统计研究所加尔各答分所)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视觉-语言模型的多语言关联稳定性问题,构建M²BIND基准,发现其跨语系/文字时会出现绑定崩溃,关系密切语言则表现较好,表明多语言部署的VLMs关联质量存疑。
Comments Preprint (under review). Project Page: https://ritabrata04.github.io/m2bind/