VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction
VGGT-Edit:基于残差场预测的前馈原生3D场景编辑
机构 * Peking University(北京大学) ; Tencent(腾讯) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Lab(上海人工智能实验室) ; NTU Singapore(新加坡国立大学) ; Zhongguancun Academy(中关村学院) ; Beijing Key Lab of Data Intel. & Security (PKU)(北京数据智能与安全实验室(北京大学))
AI总结 本文提出VGGT-Edit,一种基于文本条件的前馈原生3D场景编辑框架,通过引入深度同步文本注入和残差变换头,实现高质量的3D场景编辑,同时构建DeltaScene数据集以提升编辑效果和推理速度。