LaViDa: A Large Diffusion Language Model for Multimodal Understanding
LaViDa:用于多模态理解的大型扩散语言模型
机构 * UCLA(加州大学洛杉矶分校) ; Panasonic AI Research(松下人工智能研究) ; Adobe Research(Adobe研究) ; Salesforce Research(Salesforce研究)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。
Comments 26 pages, 8 figures