HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers
HYDRA-X: 具有整体视觉分词器的原生统一多模态模型
机构 * Nanjing University(南京大学) ; CASIA(中国科学院自动化研究所) ; Tencent Hunyuan(腾讯混元) ; Zhongguancun Academy(中关村学院) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 提出HYDRA-X,首个在单一ViT中统一图像和视频分词的原生统一多模态模型,通过因果时间注意力和分层时间压缩实现高效重建,并利用轻量化解压缩器注入语义,显著提升编辑一致性和收敛速度。