CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework
CaVe-VLM-CoT:一种可解释的视觉-语言模型框架
机构 * Vector Institute(向量研究所)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 提出CaVe-VLM-CoT框架,通过五阶段闭环流水线(提取器、检索器、求解器、引用注入器、验证器)实现证据推理,并引入CaVeScore复合指标评估检索质量、引用忠实度和跨模态基础,在ScienceQA和MMMU上取得性能提升。