See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL
先看后答:基于充分性驱动的强化学习实现视觉证据预对齐
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学) ; China Telecom(中国电信)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。