VIG-RL: Learning to Search and Insert for Verified Image Grounding
VIG-RL:学习搜索与插入以实现可验证的图像定位
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)
AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。