arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-10 至 2026-03-10 共收录 146 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2403.06400 2026-03-10 cs.CV 89%

DivCon: Divide and Conquer for Complex Numerical and Spatial Reasoning in Text-to-Image Generation

DivCon:用于文本到图像生成中复杂数值和空间推理的分而治之

Yuhao Jia, Wenhan Tan

机构 * Individual Researcher(独立研究者)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 DivCon通过分而治之的方法提升文本到图像生成中复杂数值和空间推理的能力,通过分解任务提高布局生成和图像合成的精度与质量。

Comments Accepted to ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications 413 ECAI 2025 pp 4081-4088

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06993 2026-03-10 cs.CV 83%

AdaGen: Learning Adaptive Policy for Image Synthesis

AdaGen: 为图像合成学习自适应策略

Zanlin Ni, Yulin Wang, Yeguo Hua, Renping Zhou, Jiayi Guo, Jun Song, Bo Zheng, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 AdaGen通过学习自适应策略提升图像合成性能,采用强化学习优化调度过程,实现更高效的生成效果和可控的保真度-多样性权衡。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Journal version of arXiv:2409.00342 (ECCV 2024). Code is available at: https://github.com/LeapLabTHU/AdaGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06666 2026-03-10 cs.CV 83%

SJD-PV: Speculative Jacobi Decoding with Phrase Verification for Autoregressive Image Generation

SJD-PV: 基于短语验证的推测雅可比解码用于自回归图像生成

Zhehao Yu, Baoquan Zhang, Bingqi Shan, Xinhao Liu, Dongliang Zhou, Guotao Liang, Guangming Ye, Yunming Ye

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 SJD-PV通过短语级推测验证提升自回归图像生成的解码效率,减少函数评估次数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07936 2026-03-10 cs.CV 74%

Text to Automata Diagrams: Comparing TikZ Code Generation with Direct Image Synthesis

文本到自动机图:比较TikZ代码生成与直接图像合成

Ethan Young, Zichun Wang, Aiden Taylor, Chance Jewell, Julian Myers, Satya Sri Rajiteswari Nimmagadda, Anthony White, Aniruddha Maiti, Ananya Jana

机构 * Marshall University(马歇尔大学) West Virginia State University(西弗吉尼亚州立大学)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本研究比较了通过视觉-语言模型生成TikZ代码与直接图像合成在生成自动机图描述中的效果,发现人工修正能显著提高生成准确性。

Comments Accepted to ASEE North Central Section 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07839 2026-03-10 cs.CV 70%

Training-free Temporal Object Tracking in Surgical Videos

无需训练的手术视频时间物体跟踪

Subhadeep Koley, Abdolrahim Kadkhodamohammadi, Santiago Barbarisi, Danail Stoyanov, Imanol Luengo

机构 * Medtronic plc.(梅奥诊所)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需训练的扩散模型用于手术视频中时间物体跟踪,通过提取特征和跨帧交互实现高精度定位与跟踪。

Comments Accepted in IPCAI 2025

Journal ref Int J CARS 20, 1067-1075 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07401 2026-03-10 cs.CV 57%

VIVECaption: A Split Approach to Caption Quality Improvement

VIVECaption:一种改进标题质量的分步方法

Varun Ananth, Baqiao Liu, Haoran Cai

机构 * Adobe Inc.(Adobe公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07119 2026-03-10 cs.CV 57%

TIQA: Human-Aligned Text Quality Assessment in Generated Images

TIQA: 生成图像中的人工对齐文本质量评估

Kirill Koltsov, Aleksandr Gushchin, Dmitriy Vatolin, Anastasia Antsiferova

机构 * Lomonosov Moscow State University(洛蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能领域研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 TIQA通过ANTIQA方法提升生成图像中文本质量评估的准确性,有效提高文本生成任务的过滤与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 50%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 文生图 :text-to-image(abstract)

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2603.08059 2026-03-10 cs.CV cs.AI 83%

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

ImageEdit-R1: 通过强化学习提升多智能体图像编辑

Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui

机构 * National University of Singapore(新加坡国立大学) Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 ImageEdit-R1通过强化学习实现多智能体图像编辑,提升复杂指令下的编辑效果与上下文感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08589 2026-03-10 cs.CV 79%

CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing

CARE-Edit:基于条件的专家路由用于上下文图像编辑

Yucheng Wang, Zedong Wang, Yuetong Wu, Yue Ma, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 CARE-Edit通过条件感知的专家路由提升上下文图像编辑的性能和稳定性

Comments Accepted by CVPR 2026. Project page: https://care-edit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07148 2026-03-10 cs.LG 50%

Agentic Planning with Reasoning for Image Styling via Offline RL

基于推理的图像风格化代理规划 via 离线强化学习

Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui, Franck Dernoncourt, Arko Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(abstract)

AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。

Comments 85 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 105 篇

2503.00897 2026-03-10 cs.LG cs.AI cs.CV 86%

A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning

一种简单而有效的文本到图像扩散微调强化学习方法

Shashank Gupta, Chaitanya Ahuja, Tsung-Yu Lin, Sreya Dutta Roy, Harrie Oosterhuis, Maarten de Rijke, Satya Narayan Shukla

机构 * University of Amsterdam(阿姆斯特丹大学) Meta Radboud University(拉德堡德大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文提出LOOP方法,结合REINFORCE的方差减少技术和PPO的鲁棒性,提升扩散模型在黑盒目标上的样本效率和性能。

Comments Published at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08271 2026-03-10 cs.CV 83%

Prototype-Guided Concept Erasure in Diffusion Models

扩散模型中的原型引导概念擦除

Yuze Cai, Jiahao Lu, Hongxiang Shi, Yichao Zhou, Hong Lu

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过原型引导的方法在扩散模型中实现更可靠的概念擦除,尤其针对广义概念如性与暴力,提升图像生成的安全性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24758 2026-03-10 cs.CV 83%

ExGS: Extreme 3D Gaussian Compression with Diffusion Priors

ExGS:基于扩散先验的极端3D高斯压缩

Jiaqi Chen, Xinhao Ji, Yuanyuan Gao, Hao Li, Yuning Gong, Yifei Liu, Dan Xu, Zhihang Zhong, Dingwen Zhang, Xiao Sun

机构 * Northwestern Polytechnical University(北western工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 ExGS通过结合UGC和GaussPainter,利用扩散先验实现高效且高质量的极端3DGS压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07815 2026-03-10 cs.CV cs.AI 83%

HybridStitch: Pixel and Timestep Level Model Stitching for Diffusion Acceleration

HybridStitch: 像素和时间步级模型拼接用于扩散加速

Desen Sun, Jason Hon, Jintao Zhang, Sihang Liu

机构 * University of Waterloo(多伦多大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 HybridStitch通过结合大模型和小模型,实现T2I生成的高效加速,提升Stable Diffusion 3的生成速度1.83倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07700 2026-03-10 cs.CV cs.AI 83%

TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward

TDM-R1: 通过非可微奖励强化少步扩散模型

Yihong Luo, Tianyang Hu, Weijian Luo, Jing Tang

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 TDM-R1通过非可微奖励强化少步扩散模型,提升文本到图像生成性能

Comments https://luo-yihong.github.io/TDM-R1-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15128 2026-03-10 eess.IV cs.CV 83%

MAP-based Problem-Agnostic diffusion model for Inverse Problems

基于最大后验概率的逆问题问题无关扩散模型

Pingping Tao, Haixia Liu, Jing Su

机构 * organization= Library, Shandong University , addressline= No. 180 West Culture Road , city= Weihai , postcode= 264209 , state= Shandong , country= China organization= School of Mathematics Statistics \& Hubei Key Laboratory of Engineering Modeling Scientific Computing \& Institute of Interdisciplinary Research for Mathematics Applied Science, Huazhong University of Science organization= Department of Basic Sciences, Dalian University of Science

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种基于最大后验概率的逆问题扩散模型,通过引入高斯型先验和引导项估计,提升图像处理任务中的内容保留效果。

Comments 26 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15199 2026-03-10 cs.CV cs.AI cs.LG 83%

Input-Adaptive Generative Dynamics in Diffusion Models

扩散模型中的输入自适应生成动态

Yucheng Xing, Xiaodong Liu, Xin Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本研究提出了一种输入自适应的扩散模型生成方法,通过调整生成动态以适应不同输入需求,从而提升生成质量和效率。

Comments 14 pages, 6 figures. Updated version with revised title

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08023 2026-03-10 cs.CV cs.AI cs.GR cs.SD 81%

Not Like Transformers: Drop the Beat Representation for Dance Generation with Mamba-Based Diffusion Model

不同于Transformer:用基于Mamba的扩散模型生成舞蹈,摒弃节奏表示

Sangjune Park, Inhyeok Choi, Donghyeon Soon, Youngwoo Jeon, Kyungdon Joo

机构 * Ulsan National Institute of Science and Technology, South Korea(乌山国立科学技术研究院,韩国) Daegu Gyeongbuk Institute of Science and Technology, South Korea(大邱庆北科学技术研究院,韩国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出基于Mamba的扩散模型,用于生成舞蹈,通过替代Transformer并引入基于高斯的节奏表示,有效生成合理舞蹈动作,保持从短到长舞蹈的一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08709 2026-03-10 cs.CV cs.AI 80%

Scale Space Diffusion

尺度空间扩散

Soumik Mukhopadhyay, Prateksha Udhayanan, Abhinav Shrivastava

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出尺度空间扩散模型,通过融合尺度空间理论与扩散过程,改进图像生成与去噪效果。

Comments Project website: https://prateksha.github.io/projects/scale-space-diffusion/ . The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08364 2026-03-10 cs.CV 79%

Diffusion-Based Data Augmentation for Image Recognition: A Systematic Analysis and Evaluation

基于扩散的数据增强用于图像识别:系统分析与评估

Zekun Li, Yinghuan Shi, Yang Gao, Dong Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniDiffDA框架,系统分析DiffDA方法的三个核心组件,通过全面评估揭示不同策略的优劣,提供可复现的代码和配置以促进研究。

Journal ref Int J Comput Vis 134, 126 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02919 2026-03-10 cs.CV cs.AI cs.LG 79%

Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers

可解释的运动注意力图:在视频扩散变换器中进行时空定位概念

Youngjun Jun, Seil Kang, Woojung Han, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种可解释的运动注意力图方法,通过时空定位运动概念,提升视频扩散变换器的可解释性与定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14980 2026-03-10 cs.RO cs.AI cs.CV 79%

M4Diffuser: Multi-View Diffusion Policy with Manipulability-Aware Control for Robust Mobile Manipulation

M4Diffuser:多视角扩散策略与具有操纵性意识的控制的多自由度扩散策略用于鲁棒移动操纵

Ju Dong, Lei Zhang, Liding Zhang, Yao Ling, Yu Fu, Kaixin Bai, Zoltán-Csaba Márton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院技术多模态系统部门) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 M4Diffuser通过多视角扩散策略与操纵性意识控制器实现鲁棒移动操纵,提升任务成功率与环境适应性。

Comments Project page: https://sites.google.com/view/m4diffuser, 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08135 2026-03-10 cs.CV 79%

VesselFusion: Diffusion Models for Vessel Centerline Extraction from 3D CT Images

VesselFusion:基于扩散模型的3D CT图像血管中心线提取

Soichi Mita, Shumpei Takezaki, Ryoma Bise

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VesselFusion通过扩散模型实现3D CT图像中血管中心线的提取,采用粗到细表示和投票聚合方法,提升提取精度和结果自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08020 2026-03-10 cs.CV 79%

VSDiffusion: Taming Ill-Posed Shadow Generation via Visibility-Constrained Diffusion

VSDiffusion:通过可见性约束扩散镇定模糊的阴影生成

Jing Li, Jing Zhang

机构 * East China University of Science and Technology(东华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VSDiffusion通过可见性约束扩散框架,结合多尺度结构指导和软先验图,有效生成逼真阴影,提升复杂场景下的几何一致性。

Comments 12 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07889 2026-03-10 cs.CV 79%

Structure and Progress Aware Diffusion for Medical Image Segmentation

结构与进展感知扩散用于医学图像分割

Siyuan Song, Guyue Hu, Chenglong Li, Dengdi Sun, Zhe Jin, Jin Tang

机构 * School of Artificial Intelligence(人工智能学院) School of Computer Science and Technology(计算机科学与技术学院) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SPAD方法,结合语义集中扩散和边界集中扩散,通过进展感知调度器实现医学图像分割的粗到细的扩散过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07865 2026-03-10 cs.SD cs.CV eess.AS 79%

SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving

SoundWeaver: 语义预热启动用于文本到音频扩散服务

Ayush Barik, Sofia Stoica, Nikhil Sarda, Arnav Kethana, Abhinav Khanduja, Muchen Xu, Fan Lai

机构 * University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) Assured Intelligence, USA(Assured Intelligence)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SoundWeaver通过语义预热启动技术,提升文本到音频扩散服务的效率,减少延迟并保持音频质量。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07759 2026-03-10 cs.CV cs.AI 79%

DECADE: A Temporally-Consistent Unsupervised Diffusion Model for Enhanced Rb-82 Dynamic Cardiac PET Image Denoising

DECADE:一种用于增强Rb-82动态心脏PET图像去噪的时序一致无监督扩散模型

Yinchi Zhou, Liang Guo, Huidong Xie, Yuexi Du, Ashley Wang, Menghua Xia, Tian Yu, Ramesh Fazzone-Chettiar, Christopher Weyman, Bruce Spottiswoode, Vladimir Panin, Kuangyu Shi, Edward J. Miller, Attila Feher, Albert J. Sinusas, Nicha C. Dvornek, Chi Liu

机构 * Yale University(耶鲁大学) Yale School of Medicine(耶鲁医学院) Siemens Medical Solutions USA, Inc.(西门子医疗解决方案美国公司) Inselspital, Bern University Hospital(伯尔尼大学医院Inselspital) University of Bern(伯尔尼大学) Department of Biomedical Engineering(生物医学工程系) Department of Radiology and Biomedical Imaging(放射科和生物医学成像系) Department of Medicine (Cardiology)(医学系(心脏病学))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DECADE是一种用于增强Rb-82动态心脏PET图像去噪的无监督扩散模型,通过引入时间一致性提升去噪效果,实现高质量动态和参数图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07697 2026-03-10 cs.CV 79%

Learning Context-Adaptive Motion Priors for Masked Motion Diffusion Models with Efficient Kinematic Attention Aggregation

学习上下文自适应的运动先验以实现遮蔽运动扩散模型的高效运动学注意力聚合

Junkun Jiang, Jie Chen, Ho Yin Au, Jingyu Xiang

机构 * Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MMDM通过高效运动学注意力聚合机制,学习上下文自适应的运动先验,实现遮蔽运动数据的高效重建与生成。

Comments Accepted by IEEE Transactions on Multimedia. Supplementary material is included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07430 2026-03-10 cs.CV 79%

Disentangled Textual Priors for Diffusion-based Image Super-Resolution

解耦文本先验用于基于扩散的图像超分辨率

Lei Jiang, Xin Liu, Xinze Tong, Zhiliang Li, Jie Liu, Jie Tang, Gangshan Wu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DTPSR通过解耦文本先验提升基于扩散的图像超分辨率性能,引入空间层次和频率语义两个维度,实现高感知质量和强泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏