Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages
多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计
机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.LG;VLM(comments)
AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。
Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning