Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进
机构 * S-Lab(S实验室) ; Nanyang Technological University(南洋理工大学) ; Tencent Hunyuan(腾讯文言) ; Tsinghua University(清华大学)
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。
Comments arXiv admin note: text overlap with arXiv:2411.14432