arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1274 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1274 篇

2510.03434 2026-08-03 cs.GR cs.DC cs.LG 版本更新 85%

Paris: A Decentralized Trained Open-Weight Diffusion Model

巴黎:一种去中心化训练的开放权重扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * Bagel Labs(Bagel实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.GR

AI总结 Paris是一种通过去中心化训练实现高质量文本到图像生成的开放权重扩散模型,无需专用GPU集群,使用更少的数据和计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24800 2026-07-30 cs.CV 版本更新 85%

Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration

Calibri: 通过参数高效校准增强扩散变换器

Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, Konstantin Sobolev

机构 * MSU(莫斯科国立大学) FusionBrain Lab, AXXX(FusionBrain实验室,AXXX)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过深入分析去噪过程,提出Calibri方法,通过引入单个学习缩放参数提升DiT性能,优化校准以提高生成质量,减少推理步骤并保持高质量输出。

Comments Project page: https://v-gen-ai.github.io/Calibri-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07773 2026-07-13 cs.CV 版本更新 85%

Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?

自我超越:外部特征引导是否对于加速扩散变换器训练是必不可少的?

Lingchen Sun, Rongyuan Wu, Zhengqiang Zhang, Ruibin Li, Yujing Sun, Shuaizheng Liu, Lei Zhang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SelfTranscendence方法,通过内部特征监督实现快速收敛,无需外部特征引导,在图像生成任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 85%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 扩散模型 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09740 2026-07-07 cs.CV cs.AI 版本更新 85%

ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models

ELBO-T2IAlign:一种基于通用ELBO的方法,用于校准扩散模型中的像素级文本-图像对齐

Qin Zhou, Zhiyang Zhang, Jinglong Wang, Xiaobin Li, Jing Zhang, Qian Yu, Lu Sheng, Dong Xu

机构 * School of Software, Beihang University(北航软件学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究利用零样本指称图像分割评估扩散模型像素级图像与文本对齐,分析训练数据偏差导致的不对齐问题,提出ELBO-T2IAlign方法校准像素-文本对齐,无需额外标注等,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23426 2026-07-03 cs.CV 版本更新 85%

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

直接扩散分数偏好优化:通过逐步对比策略对监督

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18521 2026-07-01 cs.CV 版本更新 85%

Improved Immiscible Diffusion: Accelerate Diffusion Training by Reducing Its Miscibility

改进的不可混扩散:通过降低可混性加速扩散训练

Yiheng Li, Feng Liang, Dan Kondratyuk, Masayoshi Tomizuka, Kurt Keutzer, Chenfeng Xu

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出通过降低任意层级的可混性来加速扩散模型训练,实现多种实现方式(如KNN噪声选择和图像缩放),在多种任务上获得高达4倍以上的训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09052 2026-06-25 cs.CV cs.LG 版本更新 85%

Contrastive Conditional-Unconditional Alignment for Long-tailed Diffusion Model

对比条件-无条件对齐用于长尾扩散模型

Fang Chen, Alex Villa, Gongbo Liang, Fuxing Li, Xiaoyi Lu, Meng Tang

机构 * University of California Merced(加州大学默塞德分校) Oregon State University(俄勒冈州立大学) University of Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对长尾分布下条件扩散模型的模式坍塌问题,提出对比条件-无条件对齐方法,通过对齐损失和对比损失提升尾部类别的多样性与保真度。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23332 2026-06-23 cs.CV 版本更新 85%

TraceMark-LDM: Authenticatable Watermarking for Latent Diffusion Models via Binary-Guided Rearrangement

TraceMark-LDM:通过二进制引导重排实现潜在扩散模型的可认证水印

Wenhao Luo, Zhangyi Shen, Ye Yao, Feng Ding, Guopu Zhu, Weizhi Meng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Nanchang University(南昌大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学) School of Computing and Communications, Lancaster University(计算与通信学院,兰卡斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TraceMark-LDM算法,利用水印引导重排高斯随机变量,结合分组重排和编码器微调,在不影响生成质量的前提下实现图像归属,鲁棒性优于现有方法。

Comments This paper has been accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06806 2026-06-17 cs.CV cs.LG 版本更新 85%

RAIGen: Rare Attribute Identification in Text-to-Image Generative Models

RAIGen: 文本到图像生成模型中的罕见属性识别

Silpa Vadakkeeveetil Sreelatha, Dan Wang, Serge Belongie, Muhammad Awais, Anjan Dutta

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出RAIGen框架,利用Matryoshka稀疏自编码器和新颖的少数度量,在无标签条件下发现扩散模型中的罕见属性,并支持属性放大。

Comments Accepted at ICML 2026. Webpage and code available at https://github.com/VSSILPA/RAIGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05356 2026-06-09 cs.CV cs.LG 版本更新 85%

Mitigating Diffusion Model Hallucinations with Dynamic Guidance

通过动态引导缓解扩散模型幻觉

Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型因分数函数过度平滑导致的幻觉问题,提出动态引导方法,沿预定方向选择性锐化分数函数,保留有效语义变化,显著减少幻觉。

Comments Project page: https://cvlab-stonybrook.github.io/DynamicGuidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12401 2026-08-06 cs.LG cs.AI 版本更新 85%

Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation

超越狄拉克 delta:缓解强化微调中的多样性崩溃以实现多功能图像生成

Jinmei Liu, Haoru Li, Zhenhong Sun, Chaofeng Chen, Yatao Bian, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australia National University(澳大利亚国立大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of Technology Sydney(技术科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract)

AI总结 DRIFT通过激励输出多样性缓解强化微调中的多样性崩溃,提升图像生成的多样性和任务对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 85%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13974 2026-07-08 cs.CV cs.AI cs.MM 版本更新 84%

Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers

少量通道绘制整体画面:揭示扩散变换器中的大规模激活

Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 研究扩散变换器中少量关键通道对图像生成的决定性作用,揭示其在功能、空间组织和可迁移性上的核心贡献。

Comments Project page: https://aimagelab.github.io/MAs-DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新 84%

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08063 2026-08-14 cs.CV 版本更新 83%

Interpretable ODE-style Generative Diffusion Model via Force Field Construction

基于力场构造的可解释ODE式生成扩散模型

Weiyang Jin, Yongpei Zhu, Yuxi Peng

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文从数学视角识别适配的物理模型,归纳出统一的ODE式生成扩散模型方法,在CIFAR-10实验中验证了该方法在生成速度、Inception分数和FID分数上的优异性能,提升了扩散模型的可解释性。

Comments This is empirical reproducing and experimental tries of Jianlin Su's blog use ChatGPT and Newbeing: https://kexue.fm/archives/9370 https://kexue.fm/archives/9379 https://kexue.fm/archives/9467 We make the mistakes to cite them and this paper need to be withdrawn to clearify this. We thank Jianlin reached out us and give us chance to claim

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新 83%

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05746 2026-08-12 cs.CV 版本更新 83%

HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models

HQ-DM:基于单Hadamard变换的量化感知训练用于低比特扩散模型

Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 HQ-DM通过单Hadamard变换提升低比特扩散模型的量化性能,显著提高Inception Score

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02743 2026-08-11 cs.CV 版本更新 83%

MultiShadow: Multi-Object Shadow Generation for Image Compositing via Diffusion Model

MultiShadow: 基于扩散模型的多物体阴影生成用于图像合成

Waqas Ahmed, Dean Diepeveen, Ferdous Sohel

机构 * School of Information Technology, Murdoch University(信息科技学院,穆尔彻大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的多物体阴影生成方法,通过多模态特征融合和注意力对齐损失,实现多物体阴影的物理合理合成。

Comments This work is currently under consideration for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12763 2026-08-11 cs.CV 版本更新 83%

AMD:Anatomical Motion Diffusion with Interpretable Motion Decomposition and Fusion

AMD:结合可解释动作分解与融合的解剖学动作扩散模型

Beibei Jing, Youjia Zhang, Zikai Song, Junqing Yu, Wei Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AMD模型,利用LLM将文本解析为解剖学脚本,结合双分支融合方案平衡文本与脚本影响,在CLCD1、CLCD2等复杂动作数据集上性能优于现有SOTA模型。

Comments Corrected missing spaces in the abstract; no changes to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03929 2026-08-06 cs.LG cs.CV 版本更新 83%

Latent Reward Registers for Diffusion Preference Alignment

用于扩散偏好对齐的潜在奖励寄存器

Yuanshen Guan, Zipeng Feng, Chengru Song, Zhiwei Xiong, Peiqin Sun

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型偏好对齐的时间信用分配挑战,提出Latent Reward Registers机制,结合RG-OPD和RGS策略,在高噪声下实现最优性能且大幅降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14429 2026-08-05 cs.LG cs.AI cs.CV 版本更新 83%

CollaFuse: Collaborative Diffusion Models

CollaFuse:协同扩散模型

Simeon Allmendinger, Domenique Zipperling, Lukas Struppek, Niklas Kühl

机构 * University of Bayreuth(巴耶鲁斯大学) Fraunhofer FIT(弗劳恩霍夫 FIT) FIM Research Center for Information Management(信息管理研究所以) Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CollaFuse协同扩散模型,通过本地保留数据和轻量计算,将高计算任务转移至服务器,降低客户端负担,提升性能并减少数据泄露风险。

Comments Accepted at the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29471 2026-08-04 cs.CV 版本更新 83%

V2VCrafter: Consistent Street-View Image Generation Across Vehicles

V2XCrafter:学习生成跨智能体的驾驶场景

Yihang Tao, Yu Guo, Senkang Hu, Yanan Ma, Zihan Fang, Sam Kwong, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) City University of Hong Kong(香港城市大学) Lingnan University(岭南大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出V2XCrafter框架,通过渐进式多智能体扩散模型和跨智能体注意力模块,生成跨智能体相机视角的一致可控协作驾驶场景,以增强数据并提升下游协作3D目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19139 2026-07-31 cs.CV 版本更新 83%

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

文本模板令牌是扩散Transformer中的隐式语义寄存器

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像扩散Transformer中内部计算,引入因果可解释性框架,发现结构模板令牌充当隐式语义寄存器,据此设计剪枝规则,还揭示其生成计算组织方式,提供了DiTs内部机制的因果视图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13868 2026-07-30 cs.CV 版本更新 83%

Particle-Filtering-based Latent Diffusion for Inverse Problems

基于粒子滤波的隐式扩散模型在逆问题中的应用

Amir Nazemi, Mohammad Hadi Sepanj, Nicholas Pellegrino, Chris Czarnecki, Paul Fieguth

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于粒子滤波的隐式扩散(PFLD)框架,用于逆问题求解时探索解空间,实验显示其在FFHQ-1K和ImageNet-1K数据集的三类逆问题任务中优于SoTA求解器PSLD。

Comments Mohammad Hadi Sepanj, Nicholas Pellegrino, and Chris Czarnecki contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30147 2026-07-29 cs.CV 版本更新 83%

T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

T2LDM++:一种用于真实文本到激光雷达场景生成的自条件表示引导扩散模型

Wentao Qu, Qi Zhang, Chenxu Wang, Guofeng Mei, Yongfei Liu, Xiaoshui Huang, Gim Hee Lee, Liang Xiao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanjing University of Science and Technology(南京理工大学) Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Beijing Institute of Technology(北京理工大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) School of Public Health(公共卫生学院) Shanghai Jiao Tong University(上海交通大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对文本-激光雷达数据稀缺导致场景过平滑和可控性不足的问题,提出T2LDM++模型,通过自条件表示引导(SCRG)提供重建监督,并构建高质量基准数据集,实现几何细节丰富的激光雷达场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06421 2026-07-29 cs.CV cs.LG 版本更新 83%

FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation

FREPix:频率异质流匹配用于像素空间图像生成

Mingfeng Lin, Jiakun Chen, Liang Han, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 FREPix通过分解低频和高频组件,设计显式生成流程,提升像素空间图像生成效果,实现1.91 FID在256×256和2.38 FID在512×512的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17572 2026-07-28 cs.LG cs.CV cs.SY eess.SY 版本更新 83%

JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models

AGG:用于扩散模型高效GRPO训练的雅可比聚合组梯度

Ruiyi Ding, Jie Li, He Kang, Ziyan Liu, Chengru Song, Yuan cheng

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究GRPO扩展到扩散模型的计算瓶颈问题,提出JAGG方法,通过特定插值和聚合梯度,减少反向传播次数,实验表明该方法能在质量损失小的情况下显著加速T2I训练中的DiT RL训练。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新 83%

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04731 2026-07-24 cs.CV 版本更新 83%

When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions

高CFG扩散反演何时失败?对提示-潜在交互的对照研究

Yan Zeng, Yusuke Hosoya, Huyen T. T. Tran, Takayuki Okatani

机构 * GSIS Tohoku University(东北大学全球信息社会研究院) RIKEN AIP JAPAN(日本理化学研究所先进智能项目中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究在图像编辑中,高CFG轨迹生成的目标图像何时能被反演。通过对照实验,用现有基准的提示生成图像并反演,揭示提示重建行为类型,定义提示压力分析生成,文本分析表明主体和措辞影响反演,评估干预措施支持局部轨迹感知分析。

详情

展开后加载摘要…

URL PDF HTML 收藏