Vision as Unified Multimodal Generation
视觉作为统一的多模态生成
机构 * SenseTime Research(商汤科技研究院) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。
Comments 48 pages,22 figures