VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling
VLZip:用于交错长上下文建模的统一视觉与文本压缩方法
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。