arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70051 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2603.06679 2026-04-01 cs.AI cs.CV cs.GR 81%

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20353 2026-03-30 cs.LG cs.AI cs.CV cs.MM cs.PF 81%

FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation

通过可学习线性近似加速扩散变换器的FastCache

Dong Liu, Yanxuan Yu, Jiayi Zhang, Yifan Li, Ben Lengerich, Ying Nian Wu

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出FastCache,通过隐藏状态层面的缓存与压缩框架,利用模型内部表示中的冗余性加速扩散变换器推理,结合可学习线性近似方法,有效降低计算开销并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14187 2026-03-26 cs.GR cs.CV 81%

Establishing Stochastic Object Models from Noisy Data via Ambient Measurement-Integrated Diffusion

通过环境测量整合扩散建立随机物体模型

Xiaoning Lei, Jianwei Sun, Wenhao Cai, Xichen Xu, Yanshu Wang, Hu Gao

机构 * Contemporary Amperex Technology Co.Limited(当代爱普科技术有限公司) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出AMID方法,通过整合环境测量噪声与扩散轨迹,建立清洁的随机物体模型,提升医学影像生成质量和任务基于的图像质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21978 2026-03-24 cs.CV cs.GR 81%

GeoFusion-CAD: Structure-Aware Diffusion with Geometric State Space for Parametric 3D Design

GeoFusion-CAD:基于几何状态空间的结构感知扩散模型用于参数化3D设计

Xiaolei Zhou, Chuangjie Fang, Jie Wu, Jingyi Yang, Boyi Lin, Jianwei Zheng

机构 * Zhejiang University of Technology(之江大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北航)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出GeoFusion-CAD,一种端到端扩散框架,通过几何状态空间建模实现长序列参数化3D设计生成,解决了传统方法在复杂几何拓扑依赖下的扩展性问题。

Comments Accepted to CVPR 2026 (Findings). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16093 2026-03-18 cs.SD cs.AI cs.CV cs.MM 81%

Diffusion Models for Joint Audio-Video Generation

用于联合音频视频生成的扩散模型

Alejandro Paredes La Torre

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08801 2026-03-17 cs.CV cs.AI cs.MM 81%

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

Lumos-1:从统一模型视角看基于离散扩散的自回归视频生成

Hangjie Yuan, Weihua Chen, Jun Cen, Hu Yu, Jingyun Liang, Shuning Chang, Zhihui Lin, Tao Feng, Pengwei Liu, Jiazheng Xing, Hao Luo, Jiasheng Tang, Fan Wang, Yi Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 Lumos-1提出一种基于LLM的统一模型,通过改进的MM-RoPE和离散扩散机制,在高效生成视频方面超越现有模型,适用于多种视频评估基准。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08023 2026-03-10 cs.CV cs.AI cs.GR cs.SD 81%

Not Like Transformers: Drop the Beat Representation for Dance Generation with Mamba-Based Diffusion Model

不同于Transformer:用基于Mamba的扩散模型生成舞蹈,摒弃节奏表示

Sangjune Park, Inhyeok Choi, Donghyeon Soon, Youngwoo Jeon, Kyungdon Joo

机构 * Ulsan National Institute of Science and Technology, South Korea(乌山国立科学技术研究院,韩国) Daegu Gyeongbuk Institute of Science and Technology, South Korea(大邱庆北科学技术研究院,韩国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出基于Mamba的扩散模型,用于生成舞蹈,通过替代Transformer并引入基于高斯的节奏表示,有效生成合理舞蹈动作,保持从短到长舞蹈的一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09646 2026-03-04 eess.IV cs.CV cs.GR cs.LG 81%

RealOSR: Latent Guidance Boosts Diffusion-based Real-world Omnidirectional Image Super-Resolutions

RealOSR: 潜在引导提升基于扩散模型的现实世界全方位图像超分辨率

Xuhan Sheng, Runyi Li, Bin Chen, Weiqi Li, Xu Jiang, Jian Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 RealOSR通过高效潜在引导提升基于扩散模型的现实世界全方位图像超分辨率,实现视觉质量和推断速度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08011 2026-03-03 cs.CV cs.AI cs.LG cs.MM 81%

TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models

TP-Blend:基于文本提示注意力配对的精确物体-风格混合扩散模型

Xin Jin, Yichuan Zhong, Yapeng Tian

机构 * GenPi Inc.(GenPi公司) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 TP-Blend通过双提示注意力配对实现精确物体-风格混合,提升扩散模型的编辑质量和效率。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00492 2026-03-03 cs.CV cs.AI cs.GR cs.LG 81%

ArtiFixer: Enhancing and Extending 3D Reconstruction with Auto-Regressive Diffusion Models

ArtiFixer:利用自回归扩散模型增强和扩展3D重建

Riccardo de Lutio, Tobias Fischer, Yen-Yu Chang, Yuxuan Zhang, Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen, Katarina Tothova, Zan Gojcic, Haithem Turki

机构 * NVIDIA NVIDIA Santa Clara USA(NVIDIA) NVIDIA Zurich Switzerland(NVIDIA) Cornell University(康奈尔大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 ArtiFixer通过自回归扩散模型提升3D重建质量,解决现有方法在未观测区域的外推问题。

Comments Video results: https://artifixer2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06056 2026-02-09 cs.MM cs.AI cs.CL cs.CV 81%

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

分析扩散模型和自回归视觉语言模型在多模态嵌入空间中的表现

Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学) Yale University(耶鲁大学) NYU Shanghai(纽约大学上海分校) Alibaba-NTU Singapore Joint Research Institute(阿里-国立新加坡大学联合研究机构) University of the Chinese Academy of Sciences(中国科学院大学) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文研究了多模态扩散模型在多模态嵌入任务中的表现,发现其在分类、VQA和检索任务中均逊于自回归VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04814 2026-02-05 cs.CV cs.GR 81%

X2HDR: HDR Image Generation in a Perceptually Uniform Space

X2HDR:在感知均匀空间中实现HDR图像生成

Ronghuan Wu, Wanchao Su, Kede Ma, Jing Liao, Rafał K. Mantiuk

机构 * City University of Hong Kong(香港城市大学) Monash University(墨尔本大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 X2HDR通过感知均匀编码实现HDR图像生成,利用预训练模型适应HDR生成,提升图像保真度和动态范围。

Comments Project page: https://x2hdr.github.io/, Code: https://github.com/X2HDR/X2HDR

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08930 2026-01-28 cs.CV cs.GR 81%

Structured Pattern Expansion with Diffusion Models

基于扩散模型的结构模式扩展

Marzia Riso, Giuseppe Vecchio, Fabio Pellacini

机构 * Sapienza University of Rome(罗马大学) Independent Researcher(独立研究者) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种基于扩散模型的结构模式扩展方法,通过微调和噪声滚动技术提升模式生成质量,实现对用户输入的直接控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02334 2026-01-27 cs.IT cs.CV cs.MM eess.SP math.IT 81%

Communicate Less, Synthesize the Rest: Latency-aware Intent-based Generative Semantic Multicasting with Diffusion Models

少传多合成:基于意图的生成语义多播与扩散模型

Xinkai Liu, Mahdi Boloursaz Mashhadi, Li Qiao, Yi Ma, Rahim Tafazolli, Mehdi Bennis

机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),萨里大学) School of Information and Electronics, Beijing Institute of Technology(信息电子学院,北京理工大学) Centre for Wireless Communications, University of Oulu(无线通信中心,奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种基于意图的生成语义多播方法,利用预训练扩散模型减少传输延迟,同时保持高质量信号合成。

Comments Accepted at IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15872 2026-01-23 cs.SD cs.CV cs.LG cs.MM eess.AS 81%

PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation

PF-D2M:一种无姿态扩散模型用于通用舞蹈-音乐生成

Jaekwon Im, Natalia Polouliakh, Taketo Akama

机构 * Graduate School of Culture Technology, KAIST, South Korea(韩国科学技术院文化科技研究生院) Sony Computer Science Laboratories, Tokyo, Japan(东京索尼计算机科学实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 PF-D2M通过结合视觉特征和渐进训练策略,实现了通用舞蹈-音乐生成,提升了多舞者和非人类舞者场景下的同步性和音乐质量。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23494 2026-01-23 cs.CV cs.GR 81%

Yesnt: Are Diffusion Relighting Models Ready for Capture Stage Compositing? A Hybrid Alternative to Bridge the Gap

Yesnt:扩散重照明模型是否准备好用于捕获阶段合成?一种混合方法用于弥合差距

Elisabeth Jüttner, Janelle Pfeifer, Leona Krath, Stefan Korfhage, Hannah Dröge, Matthias B. Hullin, Markus Plack

机构 * University of Bonn(波恩大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种混合重照明框架,结合扩散先验与物理约束,实现更稳定的视频重照明效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04827 2026-01-22 cs.CV cs.GR 81%

PanoDreamer: Optimization-Based Single Image to 360 3D Scene With Diffusion

PanoDreamer: 基于优化的单张图像到360度3D场景

Avinash Paliwal, Xilong Zhou, Andrii Tsarov, Nima Khademi Kalantari

机构 * Texas A\&M University(德克萨斯A&M大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Leia Inc.(Leia公司)

专题命中 扩散模型 :diffusion(title);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 PanoDreamer通过优化方法实现单图像到360度3D场景的重建,提出两种优化任务和交替最小化策略以提升一致性和质量。

Comments SIGGRAPH Asia 2025, Project page: https://people.engr.tamu.edu/nimak/Papers/PanoDreamer, Code: https://github.com/avinashpaliwal/PanoDreamer

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14565 2026-01-21 cs.GR cs.CV 81%

ReflectanceFusion: Diffusion-based text to SVBRDF Generation

反射融合:基于扩散的文本到SVBRDF生成

Bowen Xue, Giuseppe Claudio Guarnera, Shuang Zhao, Zahra Montazeri

机构 * University of Manchester, UK(曼彻斯特大学) University of York, UK(约克大学) University of California, Irvine, USA(加州大学伊尔弗分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 ReflectanceFusion通过双模块神经方法生成高保真SVBRDF地图,结合预训练扩散模型和ReflectanceUNet实现文本到材料的高精度生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12257 2026-01-21 cs.CV cs.AI cs.CG cs.GR 81%

Soft Shadow Diffusion (SSD): Physics-inspired Learning for 3D Computational Periscopy

软阴影扩散(SSD):面向3D计算望远镜的物理启发学习

Fadlullah Raji, John Murray-Bruce

机构 * University of South Florida(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 SSD通过物理启发的学习方法,实现了从普通NLOS照片中对隐藏场景的3D重建,具有良好的鲁棒性和泛化能力。

Journal ref European Conference on Computer Vision (ECCV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10373 2026-01-16 cs.CV cs.AI cs.MM 81%

Towards Efficient Low-rate Image Compression with Frequency-aware Diffusion Prior Refinement

面向高效低比特率图像压缩的频率感知扩散先验细化

Yichong Xia, Yimin Zhou, Jinpeng Wang, Bin Chen

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出DiffCR框架,通过频率感知跳过估计和频率解耦注意力模块,实现高效低比特率图像压缩,显著提升压缩效率和图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06465 2026-01-13 eess.IV cs.CV cs.MM 81%

R$^3$D: Regional-guided Residual Radar Diffusion

R$^3$D: 基于区域引导的残差雷达扩散

Hao Li, Xinqi Liu, Yaoqing Jin

机构 * University of Arizona(亚利桑那大学) University of Hong Kong(香港大学) University of Stuttgart(斯图加特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 R3D通过区域引导残差雷达扩散框架,整合残差建模与sigma自适应引导,提升雷达点云质量,优于现有方法。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11013 2026-01-09 cs.CV cs.MM 81%

Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion

面向鲁棒且可控的文本到运动的掩码自回归扩散

Zongye Zhang, Bohan Kong, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute(杭州创新院) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 MoMADiff通过结合掩码建模与扩散过程,实现鲁棒且可控的文本到运动生成,优于现有方法。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10704 2025-12-30 cs.CV cs.MM 81%

Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework

自回归视频扩散模型的误差分析:一个统一的框架

Jing Wang, Fengzhuo Zhang, Xiaoli Li, Vincent Y. F. Tan, Tianyu Pang, Chao Du, Aixin Sun, Zhuoran Yang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Sea AI Lab(海思人工智能实验室) Yale University(耶鲁大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Meta-ARVDM框架,通过分析自回归视频扩散模型的历史遗忘与时间退化现象,揭示其理论机制并提出新的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15270 2025-12-18 eess.IV cs.CV cs.MM 81%

Generative Preprocessing for Image Compression with Pre-trained Diffusion Models

生成式预处理用于基于预训练扩散模型的图像压缩

Mengxi Guo, Shijie Zhao, Junlin Li, Li Zhang

机构 * Bytedance Inc.(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出利用预训练扩散模型进行图像压缩预处理,通过两阶段框架提升压缩效率与视觉质量。

Comments Accepted as a PAPER and for publication in the DCC 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04050 2025-12-18 cs.GR cs.CV 81%

TerraFusion: Joint Generation of Terrain Geometry and Texture Using Latent Diffusion Models

TerraFusion:利用潜在扩散模型联合生成地形几何与纹理

Kazuki Higo, Toshiki Kanai, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出利用潜在扩散模型联合生成地形高度图和纹理,通过无监督训练和手绘草图控制实现真实感地形生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13690 2025-12-16 cs.CV cs.AI cs.GR cs.LG 81%

DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders

DiffusionBrowser: 通过多分支解码器实现交互式扩散预览

Susung Hong, Chongjian Ge, Zhifei Zhang, Jui-Hsien Wang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 DiffusionBrowser通过多分支解码器实现交互式视频生成预览,提升生成效率与可控性。

Comments Project page: https://susunghong.github.io/DiffusionBrowser

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18665 2025-12-12 cs.CV cs.GR 81%

SpotLight: Shadow-Guided Object Relighting via Diffusion

SpotLight: 通过扩散模型实现阴影引导的物体光照

Frédéric Fortier-Chouinard, Zitian Zhang, Louis-Etienne Messier, Mathieu Garon, Anand Bhattad, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Depix Technologies(Depix技术公司) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 SpotLight通过提供粗略阴影提示,无需训练即可实现精确可控的物体光照,优于现有扩散模型在光照和阴影处理上的表现。

Comments Project page: https://lvsn.github.io/spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12332 2025-12-10 cs.SD cs.AI cs.CV cs.MM eess.AS 81%

VoiceCloak: A Multi-Dimensional Defense Framework against Unauthorized Diffusion-based Voice Cloning

VoiceCloak:一种针对未经授权的基于扩散的语音克隆的多维防御框架

Qianyue Hu, Junyan Wu, Wei Lu, Xiangyang Luo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 VoiceCloak通过多维防御机制有效对抗未经授权的基于扩散的语音克隆,通过扰动参考音频和破坏条件引导过程来混淆说话者身份并降低语音质量。

Comments 15 pages, 6 figures, 13 tables; Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04499 2025-12-05 cs.CV cs.GR 81%

Back to Basics: Motion Representation Matters for Human Motion Generation Using Diffusion Model

回归基础:扩散模型在人类运动生成中的运动表示至关重要

Yuduo Jin, Brandon Haworth

机构 * University of Victoria(维多利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文探讨了运动表示和损失函数对扩散模型生成人类运动的影响,通过实验评估不同运动表示和配置的效果,以提升运动扩散模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03566 2025-12-04 cs.CV cs.MM 81%

GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models

通过文本引导的扩散模型生成拟人化物体:GAOT

Hao Sun, Lei Fan, Donglin Di, Shaohui Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 GAOT通过文本引导的扩散模型和超图学习,实现从文本提示到拟人化物体的生成,取得优于现有方法的性能。

Comments Accepted by ACM MM Asia2026

详情

展开后加载摘要…

URL PDF HTML 收藏