Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression
相同语义,不同路径:面向视觉-文本压缩的自改进对齐
机构 * Southeast University(东南大学) ; Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。
Comments Accepted to ACM Multimedia 2026 (Oral)