VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
VLM-3R:融合指令对齐3D重建的视觉-语言模型
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; XMU(厦门大学) ; TAMU(德克萨斯大学阿灵顿分校) ; UCR(加州大学河滨分校) ; UNC(北卡罗来纳大学教堂山分校) ; Meta ; UCLA(加州大学洛杉矶分校)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。
Comments Project Page: https://vlm-3r.github.io/