UniSpace: Unified Visual Representation and Scalable Multimodal Modeling
UniSpace:统一视觉表示与可扩展多模态建模
机构 * Meituan(美团)
AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。
大厂专区
UniSpace:统一视觉表示与可扩展多模态建模
机构 * Meituan(美团)
AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。
VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩
机构 * Zhejiang University(浙江大学) ; Meituan(美团)
AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。
长SKILL合规性检测作为逻辑推理:基于闭包的检测与尺度引导的在线策略蒸馏
机构 * Meituan(美团)
AI总结 针对长SKILL合规性检测的成本与精度矛盾,提出SkillCDG框架,结合两级检索与依赖闭包实现检测,在多数据集上优于基线,还发现尺度趋势以优化小模型性能。