Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement
面向多模态大语言模型自我改进的故障感知图像自增强
专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.AI
AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。