3D Neural Field Generation using Triplane Diffusion
专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR
Comments Project page: https://jryanshue.com/nfd
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR
Comments Project page: https://jryanshue.com/nfd
专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR
Comments 15 pages,12 figures, 2 tables, International Journal of Computer Graphics & Animation (IJCGA) Vol.1, No.2, June 2011
Journal ref International Journal of Computer Graphics & Animation (IJCGA) Vol.1, No.2, June 2011
机构 * Tencent(腾讯)
专题命中 3D生成 :point cloud(abstract);分类 cs.CV;3D generation(comments)
Comments Technical Report; 3D Generation
PixSDS:潜在SDS为何会产生带噪像素
机构 * EPFL(洛桑联邦理工学院)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 针对潜在SDS生成3D时的像素漂移问题,提出轻量级VAE一致性梯度修复方法PixSDS,减少结构化伪影并保留语义内容。
在生活语境中看世界:统一的室内-室外城市世界生成
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 HoloWorld是首个统一室内-室外生成的3D城市世界框架,通过跨尺度语境实现对应,在城市外部生成上优于SOTA,且保持室内外对应与跨街区连续性。
Comments 9 pages, 4 figures
ETHead:从语音生成富有表现力的3D面部动画与头部运动
专题命中 3D生成 :3D generation(abstract);分类 cs.GR
AI总结 本文提出ETHead方法,通过自蒸馏框架与情感调制概率掩码机制,从语音生成与情感匹配的3D面部及头部运动,性能优于现有最优方法,其编码器可迁移增强其他动画框架。
ROAD:用于3D形状生成的判别式语义的互目标对齐
机构 * Huazhong University of Science and Technology(华中科技大学) ; Megvii(旷视科技) ; Zhejiang University(浙江大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。
PoseMaster: 一个统一的3D原生框架用于风格化姿态生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。
Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster
用于几何基础3D基础模型的潜在黎曼流匹配
机构 * TU Wien(维也纳工业大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ; Imperial College London(伦敦帝国理工学院)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 研究如何弥合几何基础模型与3D场景生成模型的范式差异,通过在VGGT潜在空间进行黎曼流匹配,利用其3D先验,不依赖明确下游表示,在多个数据集上取得良好性能,确立该方法为3D生成的可行范式。
Scene-SAM3D:无需微调的多视图场景资产生成
机构 * The University of Queensland(昆士兰大学) ; East China Normal University(华东师范大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 研究针对现实场景中3D生成难题,提出无需训练的Scene-SAM3D框架,通过选互补视图、潜在速度融合及高斯优化,实现多视图场景资产生成,实验证明其在减少场景级CD和降低计算成本上有显著成效。
Comments 18 pages, 9 figures
对称性至关重要:审计和对称化3D生成模型
机构 * University of Chile(智利大学)
专题命中 3D生成 :point cloud(abstract);分类 cs.CV
AI总结 本文研究了无条件点云生成中对称性的保持问题,通过审计多个3D生成模型的对称性并计算基于Chamfer距离的归一化对称性分数,发现现有模型在对称性意识评估协议下存在持续的对称性差距。通过分析训练数据和引入对称性意识干预,作者提出了在半对象数据集上训练生成模型并在采样时进行反射重建的方法,从而提高几何一致性和视觉合理性。
Comments 12 pages, 8 figures, 4 tables
Hallo4D:用于一致时空生成的多模态幻觉缓解
机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghaitech University(上海科技大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。
Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成
机构 * KE Holdings Inc.(KE控股公司) ; Beijing, China(中国北京)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。
Comments The first two authors contributed equally. The fourth author is the corresponding author
ELSA3D:用于统一3D理解与生成的弹性语义锚定
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 研究统一3D基础模型文本-3D交互隐式问题,提出ELSA3D模型,通过弹性语义锚定联合构建语言和几何推理,用尺度感知八叉树令牌化器和锚定令牌表示几何,轻量级路由器使计算和推理弹性化,性能领先且减少计算量和延迟。
InSpace:从单张360°图像生成具有结构感知的3D室内场景
机构 * KAIST(韩国科学技术院) ; NAVER LABS(NAVER实验室) ; Chung-Ang University(中央大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 针对单图像到3D生成扩展到室内场景有挑战的问题,提出InSpace框架,利用360°图像,经估计部分场景几何、生成粗结构、产生详细布局和资产几何三阶段,还建数据集,实验表明其性能强。
Comments ECCV 2026
通过修补UV空间高斯建模的一次前馈360度可动画化头像
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)
专题命中 3D生成 :3D reconstruction(abstract);分类 cs.CV
AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。
Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/
Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产
机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) ; Microsoft Research(微软研究院) ; Zhejiang University(浙江大学) ; HKUST(香港科技大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。
Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/
Home3D 1.0:面向室内设计的高保真图像到三维资产生成系统
机构 * Alibaba Group / Taobao(阿里巴巴集团/淘宝)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出Home3D 1.0模块化系统,从单张参考图像生成高质量3D资产,包含几何重建、纹理预测、材质生成和部件分解四个模块,适用于室内设计和电子商务。
Comments 18 pages, 10 figures, 2 tables; technical report
GENA3D:通过桥接2D先验和3D一致性的生成式非完整3D建模
机构 * Dartmouth College(达特茅斯学院)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出GENA3D框架,结合2D生成先验与3D几何推理,在部分遮挡下生成完整且几何一致的3D物体,优于现有方法。
Comments Paper accepted by ECCV 2026. Project page: https://colezwhy.github.io/gena3d/
CP4D: 组合式物理感知4D场景生成
机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) ; Eastern Institute of Technology(东部技术研究所) ; Tsinghua University(清华大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出CP4D范式,通过静态环境与物理动态对象组合,结合物理模拟器与视频扩散模型生成轨迹,实现高保真、物理一致的4D场景。
PARSE: 部件感知的关系空间建模
机构 * ShanghaiTech University(上海科技大学) ; Deemos Technology(德莫斯科技)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出PARSE框架,通过部件级部件中心装配图(PAG)和空间配置求解器,实现几何约束下的无碰撞物理有效场景组装,并构建PARSE-10K数据集,提升3D场景布局推理和生成的真实感。
Comments Project Page: https://otanaaa.github.io/PARSE-project-page/
LAMP: 数据高效的线性仿射权重空间模型用于参数控制的3D形状生成与外推
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出LAMP框架,通过过拟合共享初始化的符号距离函数解码器并对齐权重空间,以少量样本实现参数约束下的可控3D生成与外推,并引入线性失配安全度量确保可靠性。
迈向交互式视频世界建模:前沿、挑战、基准与未来趋势
机构 * Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系) ; Peking University(北京大学) ; University of Twente(埃因霍温理工大学) ; Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室) ; ETH Zurich(苏黎世联邦理工学院) ; Microsoft(微软公司) ; University of Oxford(牛津大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 本文系统综述了交互式世界建模的研究趋势、技术挑战、评估基准,并提出了未来方向,重点在于动作条件可控性、长程交互与记忆以及实时响应性。
Comments Under review. The GitHub repository is publicly available at: https://github.com/liujiuming123/Awesome-Interactive-World-Model
Fishbone: 从一个3D资产到百万可控编辑
机构 * UCLA(加州大学洛杉矶分校) ; USC(南加州大学) ; UC Berkeley(加州大学伯克利分校) ; TRI(技术研究院) ; Stanford(斯坦福大学) ; Utah(犹他大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出一种统一的脊-肋表示方法Fishbone,支持通用网格的可控参数化变形、降阶动力学和动画,并构建了Fishbone-136K数据集,应用于可控3D生成、机器人学习数据增强等任务。
Comments 20 pages, 19 figures
VDE: 通过速度分解与估计实现无训练加速整流流模型
机构 * South China University of Technology(华南理工大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 提出速度分解与估计(VDE)方法,通过将模型速度分解为平行和正交分量并利用其时间可预测性和方向稳定性进行输入自适应估计,无需训练即可加速整流流模型,在图像和视频生成任务中实现显著加速且视觉质量损失极小。
Comments Accepted by CVPR 2026
EVA01: 通过混合变换器实现统一的原生3D理解和生成
机构 * SeeleAI Team(SeeleAI团队)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。
Comments 28 pages, 10 figures, 6 tables. Technical report
MeshReGen: 一种统一的3D几何再生框架
机构 * KAIST Meta Reality Labs(韩国科学技术院元宇宙实验室)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 MeshReGen通过基于VecSet的条件机制,实现从2D图像和初始3D形状再生3D对象,支持增强、重建和编辑等任务,无需额外标注即可在多个任务中实现可控的3D生成。
Comments Project page: https://geonyeong-park.github.io/meshregen/ 32 pages, 18 figures, 6 tables. Includes Appendix
CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成
机构 * Zhejiang University, China(浙江大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。
Comments ICML 2026
结构化3D潜在空间出人意料地强大:通过2D扩散模型释放可泛化的风格
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 本文提出DiLAST方法,利用预训练的2D扩散模型生成通用风格先验,通过扩散引导对齐渲染视角与目标风格,优化结构化3D潜在表示,实现对Out-of-distribution风格的有效生成。
Uni-Classifier: 利用视频扩散先验进行通用引导分类器
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。
Comments Accepted by ICME 2026