OneThinker: All-in-one Reasoning Model for Image and Video
OneThinker:面向图像和视频的统一推理模型
机构 * MMLab, CUHK(CUHK多媒体实验室) ; Meituan Home(美团家)
AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。
Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker