Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence
先见后议:用视觉证据对齐多智能体共识
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Shandong University(山东大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。