arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 447 信号源:cs.CV, cs.GR, cs.RO

1. 3D生成 447 篇

2211.16677 2022-12-01 cs.CV cs.AI cs.GR 62%

3D Neural Field Generation using Triplane Diffusion

J. Ryan Shue, Eric Ryan Chan, Ryan Po, Zachary Ankner, Jiajun Wu, Gordon Wetzstein

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

Comments Project page: https://jryanshue.com/nfd

详情

展开后加载摘要…

URL PDF HTML 收藏
1107.3680 2011-07-20 cs.GR cs.CV 62%

3-Phase Recognition Approach to Pseudo 3D Building Generation from 2D Floor Plan

Raj Kishen Moloo, Muhammad Ajmal Sheik Dawood, Abu Salmaan Auleear

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

Comments 15 pages,12 figures, 2 tables, International Journal of Computer Graphics & Animation (IJCGA) Vol.1, No.2, June 2011

Journal ref International Journal of Computer Graphics & Animation (IJCGA) Vol.1, No.2, June 2011

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21245 2025-09-26 cs.CV cs.AI 61%

Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets

Team Hunyuan3D, :, Bowen Zhang, Chunchao Guo, Haolin Liu, Hongyu Yan, Huiwen Shi, Jingwei Huang, Junlin Yu, Kunhong Li, Linus, Penghao Wang, Qingxiang Lin, Sicong Liu, Xianghui Yang, Yixuan Tang, Yunfei Zhao, Zeqiang Lai, Zhihao Liang, Zibo Zhao

机构 * Tencent(腾讯)

专题命中 3D生成 :point cloud(abstract);分类 cs.CV;3D generation(comments)

Comments Technical Report; 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12997 2026-08-14 cs.CV 新提交 57%

PixSDS: Why Latent SDS Makes Noisy Pixels

PixSDS:潜在SDS为何会产生带噪像素

Vsevolod Skorokhodov

机构 * EPFL(洛桑联邦理工学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 针对潜在SDS生成3D时的像素漂移问题,提出轻量级VAE一致性梯度修复方法PixSDS,减少结构化伪影并保留语义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05879 2026-08-07 cs.CV 新提交 57%

To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation

在生活语境中看世界:统一的室内-室外城市世界生成

Xiaobin Huang, Zilong Huang, Yang Luo, Hongchao Fan, Yiping Chen, Ting Han

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 HoloWorld是首个统一室内-室外生成的3D城市世界框架,通过跨尺度语境实现对应,在城市外部生成上优于SOTA,且保持室内外对应与跨街区连续性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01605 2026-08-04 cs.GR 新提交 57%

ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech

ETHead:从语音生成富有表现力的3D面部动画与头部运动

Jiu-Cheng Xie, Jiwang Zheng, Yongkang Xia, Jian Xiong, Chi-Man Pun, Hao Gao, Feng Xu

专题命中 3D生成 :3D generation(abstract);分类 cs.GR

AI总结 本文提出ETHead方法,通过自蒸馏框架与情感调制概率掩码机制,从语音生成与情感匹配的3D面部及头部运动,性能优于现有最优方法,其编码器可迁移增强其他动画框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 57%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21076 2026-07-31 cs.CV 版本更新 57%

PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

PoseMaster: 一个统一的3D原生框架用于风格化姿态生成

Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文脉)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。

Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19120 2026-07-22 cs.CV 新提交 57%

Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

用于几何基础3D基础模型的潜在黎曼流匹配

Lisa Weijler, Irene Ballester, Guofeng Mei, Tolga Birdal, Pedro Hermosilla

机构 * TU Wien(维也纳工业大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Imperial College London(伦敦帝国理工学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究如何弥合几何基础模型与3D场景生成模型的范式差异,通过在VGGT潜在空间进行黎曼流匹配,利用其3D先验,不依赖明确下游表示,在多个数据集上取得良好性能,确立该方法为3D生成的可行范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16805 2026-07-21 cs.CV 新提交 57%

Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning

Scene-SAM3D:无需微调的多视图场景资产生成

Yuqi Zhang, Yadan Luo, Xiangyu Sun, Fengyi Zhang, Zi Huang, Xin Tan

机构 * The University of Queensland(昆士兰大学) East China Normal University(华东师范大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究针对现实场景中3D生成难题,提出无需训练的Scene-SAM3D框架,通过选互补视图、潜在速度融合及高斯优化,实现多视图场景资产生成,实验证明其在减少场景级CD和降低计算成本上有显著成效。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18953 2026-07-21 cs.CV 版本更新 57%

Symmetry Matters: Auditing and Symmetrizing 3D Generative Models

对称性至关重要:审计和对称化3D生成模型

Nicolas Caytuiro, Ivan Sipiran

机构 * University of Chile(智利大学)

专题命中 3D生成 :point cloud(abstract);分类 cs.CV

AI总结 本文研究了无条件点云生成中对称性的保持问题,通过审计多个3D生成模型的对称性并计算基于Chamfer距离的归一化对称性分数,发现现有模型在对称性意识评估协议下存在持续的对称性差距。通过分析训练数据和引入对称性意识干预,作者提出了在半对象数据集上训练生成模型并在采样时进行反射重建的方法,从而提高几何一致性和视觉合理性。

Comments 12 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 57%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06565 2026-07-08 cs.CV cs.AI cs.LG 新提交 57%

ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation

ELSA3D:用于统一3D理解与生成的弹性语义锚定

Tianjiao Yu, Xinzhuo Li, Yifan Shen, Onkar Susladkar, Yuanzhe Liu, Xiaona Zhou, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究统一3D基础模型文本-3D交互隐式问题,提出ELSA3D模型,通过弹性语义锚定联合构建语言和几何推理,用尺度感知八叉树令牌化器和锚定令牌表示几何,轻量级路由器使计算和推理弹性化,性能领先且减少计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03990 2026-07-07 cs.CV 新提交 57%

InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image

InSpace:从单张360°图像生成具有结构感知的3D室内场景

Gwanhyeong Koo, Hyunsu Kim, Youngji Kim, Taejae Lee, Siwoo Lim, Sunjae Yoon, Suyong Yeon, Chang D. Yoo

机构 * KAIST(韩国科学技术院) NAVER LABS(NAVER实验室) Chung-Ang University(中央大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 针对单图像到3D生成扩展到室内场景有挑战的问题,提出InSpace框架,利用360°图像,经估计部分场景几何、生成粗结构、产生详细布局和资产几何三阶段,还建数据集,实验表明其性能强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12770 2026-07-03 cs.CV 版本更新 57%

One-Shot Feed-Forward 360$^{\circ}$ Animatable Avatar via Inpainted UV-Space Gaussian Modeling

通过修补UV空间高斯建模的一次前馈360度可动画化头像

Shuling Zhao, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)

专题命中 3D生成 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。

Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01222 2026-07-02 cs.CV 新提交 57%

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27923 2026-06-29 cs.CV cs.AI 新提交 57%

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Home3D 1.0:面向室内设计的高保真图像到三维资产生成系统

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, Yindong Kong, Jing Li, Qi Wu, Feng Zhang, Jianan Jiang, Ruigao Yang

机构 * Alibaba Group / Taobao(阿里巴巴集团/淘宝)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出Home3D 1.0模块化系统,从单张参考图像生成高质量3D资产,包含几何重建、纹理预测、材质生成和部件分解四个模块,适用于室内设计和电子商务。

Comments 18 pages, 10 figures, 2 tables; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21945 2026-06-24 cs.CV 版本更新 57%

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D:通过桥接2D先验和3D一致性的生成式非完整3D建模

Junwei Zhou, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出GENA3D框架,结合2D生成先验与3D几何推理,在部分遮挡下生成完整且几何一致的3D物体,优于现有方法。

Comments Paper accepted by ECCV 2026. Project page: https://colezwhy.github.io/gena3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09187 2026-06-09 cs.CV 新提交 57%

CP4D: Compositional Physics-aware 4D Scene Generation

CP4D: 组合式物理感知4D场景生成

Hanxin Zhu, Cong Wang, Tianyu He, Long Chen, Xin Jin, Chen Gao, Zhibo Chen

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Zhongguancun Academy(中关村学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) Eastern Institute of Technology(东部技术研究所) Tsinghua University(清华大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出CP4D范式,通过静态环境与物理动态对象组合,结合物理模拟器与视频扩散模型生成轨迹,实现高保真、物理一致的4D场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07704 2026-06-08 cs.CV 版本更新 57%

PARSE: Part-Aware Relational Spatial Modeling

PARSE: 部件感知的关系空间建模

Yinuo Bai, Peijun Xu, Kuixiang Shao, Yuyang Jiao, Jingxuan Zhang, Kaixin Yao, Jiayuan Gu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出PARSE框架,通过部件级部件中心装配图(PAG)和空间配置求解器,实现几何约束下的无碰撞物理有效场景组装,并构建PARSE-10K数据集,提升3D场景布局推理和生成的真实感。

Comments Project Page: https://otanaaa.github.io/PARSE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22491 2026-06-03 cs.LG cs.CE cs.CV 57%

LAMP: Data-Efficient Linear Affine Weight-Space Models for Parameter-Controlled 3D Shape Generation and Extrapolation

LAMP: 数据高效的线性仿射权重空间模型用于参数控制的3D形状生成与外推

Ghadi Nehme, Yanxia Zhang, Dule Shu, Matt Klenk, Faez Ahmed

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出LAMP框架,通过过拟合共享初始化的符号距离函数解码器并对齐权重空间,以少量样本实现参数约束下的可控3D生成与外推,并引入线性失配安全度量确保可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01164 2026-06-02 cs.CV 57%

Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends

迈向交互式视频世界建模:前沿、挑战、基准与未来趋势

Jiuming Liu, Chaojun Ni, Mengmeng Liu, Chensheng Peng, Fangjinhua Wang, Sitian Shen, Marc Pollefeys, Masayoshi Tomizuka, Ayush Tewari, Per Ola Kristensson

机构 * Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系) Peking University(北京大学) University of Twente(埃因霍温理工大学) Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文系统综述了交互式世界建模的研究趋势、技术挑战、评估基准,并提出了未来方向,重点在于动作条件可控性、长程交互与记忆以及实时响应性。

Comments Under review. The GitHub repository is publicly available at: https://github.com/liujiuming123/Awesome-Interactive-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24805 2026-05-26 cs.CV 57%

Fishbone: From One 3D Asset to a Million Controllable Edits

Fishbone: 从一个3D资产到百万可控编辑

Yumeng He, Xiaoying Wang, Peihao Li, Yanjia Huang, Joe Masterjohn, Jiajun Wu, Leonidas Guibas, Yin Yang, Ying Jiang, Chenfanfu Jiang

机构 * UCLA(加州大学洛杉矶分校) USC(南加州大学) UC Berkeley(加州大学伯克利分校) TRI(技术研究院) Stanford(斯坦福大学) Utah(犹他大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出一种统一的脊-肋表示方法Fishbone,支持通用网格的可控参数化变形、降阶动力学和动画,并构建了Fishbone-136K数据集,应用于可控3D生成、机器人学习数据增强等任务。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23381 2026-05-25 cs.CV 57%

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

VDE: 通过速度分解与估计实现无训练加速整流流模型

Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

机构 * South China University of Technology(华南理工大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出速度分解与估计(VDE)方法,通过将模型速度分解为平行和正交分量并利用其时间可预测性和方向稳定性进行输入自适应估计,无需训练即可加速整流流模型,在图像和视频生成任务中实现显著加速且视觉质量损失极小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16745 2026-05-19 cs.CV 57%

EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

EVA01: 通过混合变换器实现统一的原生3D理解和生成

Zongyuan Yang, Mingjing Yi, Wanli Ma, Chenzhuo Fan, Bocheng Li, Baolin Liu, Yuke Lou, Yingde Song, Yongping Xiong, Zhengdong Guo, Shimu Wang

机构 * SeeleAI Team(SeeleAI团队)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。

Comments 28 pages, 10 figures, 6 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28134 2026-05-19 cs.CV 57%

MeshReGen: A Unified 3D Geometry Regeneration Framework

MeshReGen: 一种统一的3D几何再生框架

Geon Yeong Park, Roman Shapovalov, Rakesh Ranjan, Jong Chul Ye, Andrea Vedaldi, Thu Nguyen-Phuoc

机构 * KAIST Meta Reality Labs(韩国科学技术院元宇宙实验室)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 MeshReGen通过基于VecSet的条件机制,实现从2D图像和初始3D形状再生3D对象,支持增强、重建和编辑等任务,无需额外标注即可在多个任务中实现可控的3D生成。

Comments Project page: https://geonyeong-park.github.io/meshregen/ 32 pages, 18 figures, 6 tables. Includes Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21798 2026-05-18 cs.CV 57%

CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models

CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成

Junming Huang, Chi Wang, Letian Li, Guangkai Xu, Donglin Huang, Hao Chen, Qiang Dai, Weiwei Xu

机构 * Zhejiang University, China(浙江大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04412 2026-05-08 cs.CV 57%

Structured 3D Latents Are Surprisingly Powerful: Unleashing Generalizable Style with 2D Diffusion

结构化3D潜在空间出人意料地强大:通过2D扩散模型释放可泛化的风格

Yiran Qiao, Yiren Lu, Yunlai Zhou, Disheng Liu, Linlin Hou, Rui Yang, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出DiLAST方法,利用预训练的2D扩散模型生成通用风格先验,通过扩散引导对齐渲染视角与目标风格,优化结构化3D潜在表示,实现对Out-of-distribution风格的有效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV 57%

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏