arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2502.17516 2025-02-26 cs.LG cs.AI 67%

A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models

Zihao Lin, Samyadeep Basu, Mohammad Beigi, Varun Manjunatha, Ryan A. Rossi, Zichao Wang, Yufan Zhou, Sriram Balasubramanian, Arman Zarei, Keivan Rezaei, Ying Shen, Barry Menglong Yao, Zhiyang Xu, Qin Liu, Yuxiang Zhang, Yan Sun, Shilong Liu, Li Shen, Hongxuan Li, Soheil Feizi, Lifu Huang

专题命中 可控生成 :text-to-image(abstract);generative vision(abstract)

Comments 30 pages, 4 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09594 2025-02-04 cs.AI 67%

Moonshine: Distilling Game Content Generators into Steerable Generative Models

Yuhe Nie, Michael Middleton, Tim Merino, Nidhushan Kanagaraja, Ashutosh Kumar, Zhan Zhuang, Julian Togelius

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10941 2025-01-03 cs.CL cs.AI cs.LG 67%

Text2Data: Low-Resource Data Generation with Textual Control

Shiyu Wang, Yihao Feng, Tian Lan, Ning Yu, Yu Bai, Ran Xu, Huan Wang, Caiming Xiong, Silvio Savarese

专题命中 可控生成 :diffusion(abstract);image editing(abstract)

Comments Thirty-Ninth AAAI Conference on Artificial Intelligence (AAAI-25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03499 2024-12-23 cs.CV cs.AI cs.GR cs.MM 67%

Re:Draw -- Context Aware Translation as a Controllable Method for Artistic Production

Joao Liborio Cardoso, Francesco Banterle, Paolo Cignoni, Michael Wimmer

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14212 2024-12-03 cs.CL 67%

Explicitly Representing Syntax Improves Sentence-to-layout Prediction of Unexpected Situations

Wolf Nuyts, Ruben Cartuyvels, Marie-Francine Moens

专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract)

Comments Published in TACL

Journal ref Transactions of the Association for Computational Linguistics 12 (2024): 264-282

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.10933 2018-10-26 cs.CG cs.CV cs.GR 66%

Practical Shape Analysis and Segmentation Methods for Point Cloud Models

Reed M. Williams, Horea T. Ilieş

专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV、cs.GR

Comments 21 pages, 20 figures. To appear in The Journal of Computer Aided Geometric Design's Special Issue on Heat Diffusion Equation and Optimal Transport in Geometry Processing and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 62%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04737 2026-08-06 cs.CV cs.GR 新提交 62%

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

基于稀疏直接飞行时间传感器的密集度量深度补全

Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

机构 * KAIST(韩国科学技术院) USTC(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16611 2026-08-05 cs.GR cs.CV 版本更新 62%

Style-Aware Gloss Control for Generative Non-Photorealistic Rendering

风格感知的光泽控制用于生成非照片实感渲染

Santiago Jimenez-Navarro, Belen Masia, Ana Serrano

机构 * University of Zaragoza -- I3A(萨拉戈萨大学--I3A)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种风格感知的光泽控制方法,通过训练生成模型来解耦光泽与艺术风格,实现对非照片实感图像的精细控制。

Comments Published in Computers & Graphics journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18309 2026-08-04 cs.GR cs.CV cs.SD eess.AS 62%

GCDance: Genre-Controlled Music-Driven 3D Full Body Dance Generation

GCDance:基于音乐的风格控制3D全身舞蹈生成

Xinran Liu, Xu Dong, Shenbin Qian, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * School of Computer Science and Electronic Engineering, University of Surrey(萨里大学计算机科学与电子工程学院) Department of Music and Media, University of Surrey(萨里大学音乐与媒体系) Department of Informatics, University of Oslo(奥斯陆大学信息学系) Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出GCDance框架,通过音乐和文本条件生成风格化的3D舞蹈,利用文本控制机制和音乐基础模型提升生成质量,实验验证其优于现有方法。

Journal ref IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22808 2026-07-28 cs.CV cs.AI cs.GR eess.IV 新提交 62%

Hybrid Semantic and Spectral Ensemble for Robust Synthetic Image Source Attribution

用于稳健合成图像源归属的混合语义与频谱集成

Md. Ajwad Hossain

机构 * Chittagong University of Engineering and Technology(吉大港工程技术大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像模型发展带来的合成图像源归属问题,提出融合语义深度学习与数学取证特征提取的双分支集成框架,经实验验证准确率高且计算高效,突出数学取证在实际部署中的优势。

Comments Peer-reviewed and accepted to the DLMMDD Challenge Workshop at the 35th International Conference on Artificial Neural Networks (ICANN 2026). 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12206 2026-07-15 cs.CV cs.GR 新提交 62%

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

RegHead:通过前馈配准生成非拟人头部混合形状

Jiahao Luo, Hao Zhang, Jianqi Chen, Yijie He, Jiaxu Zou, Michael Vasilkovsky, Sergei Korolev, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, James Davis, Jian Wang

机构 * UCSC(加州大学圣克鲁兹分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) Snap Inc.(Snap公司)

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 针对非拟人头部头像构建语义混合形状集成本高的问题,提出含大规模数据集、特定运动表示及快速前馈配准模型的RegHead框架,实验表明其生成表情网格保真度高、速度快,还能实现实时重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 62%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24021 2026-06-24 cs.CV cs.GR 新提交 62%

Token-to-Token Alignment of Text Embeddings for Semantic Blending

Token-to-Token对齐的文本嵌入用于语义融合

Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) BRIA AI

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出Token-to-Token对齐框架,通过结构对齐和嵌入对齐建立提示词间语义对应,使线性插值实现平滑语义过渡,用于图像融合和连续编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21766 2026-05-22 cs.CV cs.GR 62%

BodyReLux: Temporally Consistent Full-Body Video Relighting

BodyReLux: 时序一致的全身人体视频重照明

Li Ma, Mingming He, Xueming Yu, David M. George, Ahmet Levent Taşel, Paul Debevec, Julien Philip

机构 * Eyeline Labs(Eyeline实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出BodyReLux,一种基于视频扩散的框架,用于在时序一致的方式下重照明全身人体表演。该方法利用混合数据集训练,结合传统静态单光源捕捉和新型动态表演捕捉技术,通过引入新的光照条件表示方法和数据增强管道,实现了高质量、鲁棒且时序一致的视频重照明。

Comments Siggraph 2026 Journal Track. Project page: https://eyeline-labs.github.io/bodyrelux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17623 2026-05-22 cs.CV cs.GR 62%

ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes

ViPS: 为自动绑定网格的视频感知姿态空间

Honglin Chen, Karran Pandey, Rundi Wu, Matheus Gadelha, Yannick Hold-Geoffroy, Ayush Tewari, Niloy J. Mitra, Changxi Zheng, Paul Guerrero

机构 * Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Adobe Research(Adobe研究) University of Cambridge(剑桥大学) University College London(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出ViPS,一种通过视频扩散模型提取运动先验来发现自动绑定网格有效姿态分布的前馈框架,实现了对多样形状变化、逆向运动学和动画的关键帧生成的支持。

Comments Project page: https://honglin-c.github.io/vips/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18735 2026-05-19 cs.CV cs.GR cs.LG 62%

PIXLRelight: Controllable Relighting via Intrinsic Conditioning

PIXLRelight: 通过内在条件实现可控的图像重照明

Miguel Farinha, Ronald Clark

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 PIXLRelight通过内在条件将物理基础渲染与学习图像合成相结合,实现对单图像重照明的可控性,其核心方法是利用真实照片或PBR渲染得到的内在条件进行训练和推理,从而在保证图像细节的同时实现高质量的重照明效果。

Comments Project page: https://mlfarinha.github.io/pixl-relight/. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16355 2026-05-19 cs.GR cs.CV 62%

Generative 3D Gaussians with Learned Density Control

具有学习密度控制的生成3D高斯

Runjie Yan, Yan-Pei Cao, Peng Wang, Ding Liang, Yuan-Chen Guo

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Density-Sampled Gaussians (DeG),通过学习概率密度函数实现3D表示的自适应密度控制,结合渲染监督优化空间密度和高斯属性,提升单图到3D生成的质量。

Comments 19 pages, 16 figures, SIGGRAPH Conference Papers '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08824 2026-05-12 cs.GR cs.CV 62%

HairGPT: Strand-as-Language Autoregressive Modeling for Realistic 3D Hairstyle Synthesis

HairGPT: 基于发丝的语言自回归建模用于逼真3D发型合成

Haimin Luo, Min Ouyang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) ShanghaiTech University and Deemos Technology Co., Ltd.(上海科技大学和Deemos技术有限公司) Deemos Technology Co., Ltd.(Deemos技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 HairGPT通过发丝为中心的框架,将发型合成转化为双解耦的自回归序列建模问题,实现结构和语义的解耦,支持复杂发型合成与风格化领域适应。

Comments Accepted to SIGGRAPH 2026 (Journal Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15310 2026-04-20 cs.CV cs.GR 62%

TokenLight: Precise Lighting Control in Images using Attribute Tokens

TokenLight: 利用属性标记实现图像中的精确光照控制

Sumit Chaturvedi, Yannick Hold-Geoffroy, Mengwei Ren, Jingyuan Liu, He Zhang, Yiqun Mei, Julie Dorsey, Zhixin Shu

机构 * Yale University(耶鲁大学) Adobe

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种图像再照明方法,通过属性标记编码多种光照属性,实现精确连续控制,并在合成和真实图像上验证了其性能。

Comments 32 pages, CVPR 2026, Project Page: https://vrroom.github.io/tokenlight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 62%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG 62%

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02190 2026-03-31 cs.CV cs.AI cs.GR cs.HC cs.LG 62%

Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

Sketch2Colab: 通过可控流蒸馏实现基于草图的多人体动画

Divyanshu Daiya, Aniket Bera

机构 * IDEAS Lab, Department of Computer Science, Purdue University(普渡大学计算机科学系IDEAS实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Sketch2Colab通过可控流蒸馏将故事板风格的2D草图转化为连贯的3D多人体运动,实现对代理、关节、时序和接触的精细控制,实验显示其在约束遵循和感知质量上优于基线方法。

Comments Accepted to CVPR 2026 Main Conference (11 pages, 8 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15130 2026-03-24 cs.GR cs.AI cs.CV 62%

Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

通过零样本相机控制驯服视频模型以实现3D和4D生成

Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出WorldForge框架,通过推理时的三重组件实现零样本3D/4D生成,解决视频扩散模型在空间任务中的控制不足问题,提升视觉真实性与轨迹一致性。

Comments Accepted to CVPR 2026. Project Webpage: https://worldforge-agi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15546 2026-03-17 cs.CV cs.GR cs.RO 62%

Kimodo: Scaling Controllable Human Motion Generation

Kimodo:可控制的人体运动生成

Davis Rempe, Mathis Petrovich, Ye Yuan, Haotian Zhang, Xue Bin Peng, Yifeng Jiang, Tingwu Wang, Umar Iqbal, David Minor, Michael de Ruyter, Jiefeng Li, Chen Tessler, Edy Lim, Eugene Jeong, Sam Wu, Ehsan Hassani, Michael Huang, Jin-Bey Yu, Chaeyeon Chung, Lina Song, Olivier Dionne, Jan Kautz, Simon Yuen, Sanja Fidler

机构 * NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Kimodo模型,通过大规模动作捕捉数据训练,实现高质量可控的人体运动生成,结合文本输入和多种运动约束条件,提升生成质量和泛化能力。

Comments Project page: https://research.nvidia.com/labs/sil/projects/kimodo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12146 2026-03-13 cs.CV cs.AI cs.LG cs.MM 62%

FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance

FlashMotion: 通过轨迹引导的少步可控视频生成

Quanhao Li, Zhen Xing, Rui Wang, Haidong Cao, Qi Dai, Daoguo Dong, Zuxuan Wu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 FlashMotion通过轨迹引导和蒸馏方法实现了少步可控视频生成,提升了视频质量和轨迹准确性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00638 2026-03-12 cs.CV cs.GR 62%

Sketch-Guided Stylized Landscape Cinemagraph Synthesis

草图引导的风格化景观cinemagraph合成

Hao Jin, Hengyuan Chang, Xiaoxuan Xie, Zhengyang Wang, Xusheng Du, Shaojun Hu, Haoran Xie

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Sketch2Cinemagraph通过草图引导生成风格化景观cinemagraph,结合文本提示和运动草图控制,实现连续时间流动的高质量合成。

Comments 16 pages, 18 figures, accepted in Computer and Graphics

Journal ref Computers & Graphics,Volume 135,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08028 2026-03-10 cs.CV cs.MM 62%

Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades

通过文本到骨骼级联实现可控的复杂人类运动视频生成

Ashkan Taghipour, Morteza Ghahremani, Zinuo Li, Hamid Laga, Farid Boussaid, Mohammed Bennamoun

机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) Munich Center for Machine Learning (MCML) and Technical University of Munich (TUM)(慕尼黑机器学习中心(MCML)和技术大学慕尼黑(TUM)) School of Information Technology, Murdoch University(信息科技学院,墨尔本大学) Department of Electrical, Electronics and Computer Engineering, The University of Western Australia(电子、电子与计算机工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出通过文本到骨骼级联框架生成可控复杂人类运动视频,解决文本条件模糊和姿态控制成本高的问题,引入合成数据集并展示模型在多个指标上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10061 2026-03-03 cs.GR cs.CV 62%

EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human Animation

EchoMimicV2: 向更具冲击力、简化和半身的人体动画迈进

Rang Meng, Xingyu Zhang, Yuming Li, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 EchoMimicV2通过简化条件和引入新的Audio-Pose动态和谐化策略,实现了具有冲击力的半身人体动画,并提出了新的评估基准。

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏