Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
通过交错多模态推理的视觉-反图形代理
机构 * University of California, Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Impossible, Inc.(Impossible公司)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。
Comments Project page: https://fugtemypt123.github.io/VIGA-website/