AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs
AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准
机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) ; Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) ; West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) ; Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。
Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068