UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
UniVLR: 统一文本与视觉的视觉潜在推理用于多模态大语言模型
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Zhongguancun Academy(中关村学院)
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 UniVLR提出一种统一的视觉潜在推理框架,将文本推理和辅助视觉证据视为共享的视觉工作空间,通过压缩统一表示提升多模态大语言模型的视觉推理效率。