Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding
模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架
机构 * East China Normal University(华东师范大学) ; ByteDance(字节跳动)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。
Comments Accepted by CVPR 2026