CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework
CaVe-VLM-CoT:一种可解释的视觉-语言模型框架
机构 * Vector Institute(向量研究所)
专题命中 测试时计算 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)
AI总结 提出CaVe-VLM-CoT框架,通过五阶段闭环流水线(提取器、检索器、求解器、引用注入器、验证器)实现证据推理,并引入CaVeScore复合指标评估检索质量、引用忠实度和跨模态基础,在ScienceQA和MMMU上取得性能提升。