arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2607.00817 2026-07-02 cs.CV 新提交 85%

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization

无需训练的扩散模型去偏方法:基于CLIP引导的去噪优化

Dain Kim, Jinseo Kim, Sungyong Baik

机构 * Dept. of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) Dept. of Data Science, Hanyang University(汉阳大学数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TES框架,通过扩散过程中优化文本嵌入来缓解人口统计偏见,无需重新训练,使用两阶段策略(早期全局对齐+迭代去噪时CLIP反馈)实现稳定可控的属性引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18521 2026-07-01 cs.CV 版本更新 85%

Improved Immiscible Diffusion: Accelerate Diffusion Training by Reducing Its Miscibility

改进的不可混扩散:通过降低可混性加速扩散训练

Yiheng Li, Feng Liang, Dan Kondratyuk, Masayoshi Tomizuka, Kurt Keutzer, Chenfeng Xu

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出通过降低任意层级的可混性来加速扩散模型训练,实现多种实现方式(如KNN噪声选择和图像缩放),在多种任务上获得高达4倍以上的训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28144 2026-06-29 cs.CV 新提交 85%

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract,abstract_cn);分类 cs.CV

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27696 2026-06-29 cs.LG cs.AI cs.CV 新提交 85%

Class-frequency Guided Noise Schedule for Diffusion Models

面向扩散模型的类别频率引导噪声调度

Jiequan Cui, Beier Zhu, Qingshan Xu, Xiaojuan Qi, Bei Yu, Hanwang Zhang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对低频类别在扩散模型中因低密度区域导致评分估计不准和生成质量差的问题,提出类别频率引导的噪声调度(CFRG),为低频类别分配更大尺度噪声,在CIFAR-100-LT和ImageNet-LT上显著提升生成质量。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27089 2026-06-26 cs.CV 新提交 85%

TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing

TMP:面向大规模图像生成与编辑的树结构混合策略剪枝

Peizhen Zhang, Yang Li, Xunsong Li, Songtao Liu, Zewen Liu, Qiangqiang Hu, Guotong Guo, Jupeng Ding, Yifu Sun, coopersli, Jian Zhang, Zhao Zhong, Liefeng Bo

机构 * Multimodal Model Department, Tencent(腾讯多模态模型部)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出首个树结构混合策略剪枝框架TMP,适用于文本到图像和文本引导图像到图像任务及MoE/DiT架构,以75%压缩比将HunyuanImage 3.0从80B降至20B参数,并在单张4090 GPU上推理。

Comments 10 pages, 3 figures, 3 tables, tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09052 2026-06-25 cs.CV cs.LG 版本更新 85%

Contrastive Conditional-Unconditional Alignment for Long-tailed Diffusion Model

对比条件-无条件对齐用于长尾扩散模型

Fang Chen, Alex Villa, Gongbo Liang, Fuxing Li, Xiaoyi Lu, Meng Tang

机构 * University of California Merced(加州大学默塞德分校) Oregon State University(俄勒冈州立大学) University of Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对长尾分布下条件扩散模型的模式坍塌问题,提出对比条件-无条件对齐方法,通过对齐损失和对比损失提升尾部类别的多样性与保真度。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24888 2026-06-24 cs.CV 新提交 85%

DiffusionBench: On Holistic Evaluation of Diffusion Transformers

DiffusionBench: 扩散变换器的整体评估

Xingjian Leng, Jaskirat Singh, Zhanhao Liang, Ethan Smith, Martin Bell, Aninda Saha, Yuhui Yuan, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) Canva Research(Canva研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出NanoGen统一框架,训练21个潜在扩散模型后发现ImageNet与文本到图像生成的方法排名无强相关性,因此建立DiffusionBench基准,建议同时评估两项任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23332 2026-06-23 cs.CV 版本更新 85%

TraceMark-LDM: Authenticatable Watermarking for Latent Diffusion Models via Binary-Guided Rearrangement

TraceMark-LDM:通过二进制引导重排实现潜在扩散模型的可认证水印

Wenhao Luo, Zhangyi Shen, Ye Yao, Feng Ding, Guopu Zhu, Weizhi Meng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Nanchang University(南昌大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学) School of Computing and Communications, Lancaster University(计算与通信学院,兰卡斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TraceMark-LDM算法,利用水印引导重排高斯随机变量,结合分组重排和编码器微调,在不影响生成质量的前提下实现图像归属,鲁棒性优于现有方法。

Comments This paper has been accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06806 2026-06-17 cs.CV cs.LG 版本更新 85%

RAIGen: Rare Attribute Identification in Text-to-Image Generative Models

RAIGen: 文本到图像生成模型中的罕见属性识别

Silpa Vadakkeeveetil Sreelatha, Dan Wang, Serge Belongie, Muhammad Awais, Anjan Dutta

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出RAIGen框架,利用Matryoshka稀疏自编码器和新颖的少数度量,在无标签条件下发现扩散模型中的罕见属性,并支持属性放大。

Comments Accepted at ICML 2026. Webpage and code available at https://github.com/VSSILPA/RAIGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15590 2026-06-16 cs.CV 新提交 85%

Unlocking Diffusion Hierarchies: Adaptive Timestep Selection for Zero-Shot Segmentation

解锁扩散层次:自适应时间步选择用于零样本分割

Ramin Nakhli, Mahesh Ramachandran, Luca Ballan

机构 * Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出自适应时间步选择机制,利用扩散模型去噪过程中的层次语义进展,结合上下文相似度图融合高分辨率注意力与U-Net特征,实现零样本分割性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11289 2026-06-11 cs.CV 新提交 85%

i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models

i1: 一种简单且完全开放的强文本到图像模型配方

Boya Zeng, Tianze Luo, Shu Pu, Jucheng Shen, Taiming Lu, Gabriel Sarch, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 扩散模型 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过300多次控制实验系统研究文本到图像扩散模型的设计选择,提出i1模型,仅用公开数据集训练3B参数模型,在五个基准上平均超越现有最佳完全开放模型29.5个百分点。

Comments Project page at https://zlab-princeton.github.io/i1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09273 2026-06-09 cs.CV 新提交 85%

EditSSC: Toward Editable Semantic Occupancy Scenes with Unconditional Diffusion Models

EditSSC: 基于无条件扩散模型的可编辑语义占用场景

Fatima Balde, Raoul de Charette, Alexandre Boulch

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(法雷奥人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出EditSSC方法,利用2D BEV表示和现成潜扩散网络实现3D语义场景生成与免训练编辑,在SemanticKITTI上优于现有3D专用基线。

Comments Accepted at CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05356 2026-06-09 cs.CV cs.LG 版本更新 85%

Mitigating Diffusion Model Hallucinations with Dynamic Guidance

通过动态引导缓解扩散模型幻觉

Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型因分数函数过度平滑导致的幻觉问题,提出动态引导方法,沿预定方向选择性锐化分数函数,保留有效语义变化,显著减少幻觉。

Comments Project page: https://cvlab-stonybrook.github.io/DynamicGuidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 85%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01380 2026-06-02 cs.CV 85%

Training-free image inversion for one-step diffusion models

无需训练的一步扩散模型图像反演

Tao Wu, Senmao Li, Yaxing Wang, Shiqi Yang, Kai Wang, Joost van de Weijer

机构 * CVC, University of Alabama in Birmingham(CVC,阿拉巴马大学伯明翰分校) Machine Intelligence Institute, Masdar Institute of Science and Technology(机器智能研究所,马斯达尔科技 institute) Jilin University(吉林大学) City University of Hong Kong, Department of Geography(香港城市大学地理系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 提出一种无需训练的反演框架TFinv,通过迭代噪声对齐和后缀学习解决一步扩散模型中真实图像反演与编辑的关键挑战,实现高效编辑。

Comments Accepted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06453 2026-06-02 cs.CV 85%

Pinterest Canvas: Large-Scale Image Generation at Pinterest

Pinterest Canvas: Pinterest 的大规模图像生成系统

Yu Wang, Eric Tzeng, Raymond Shiau, Jie Yang, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出 Pinterest Canvas,一个基于扩散模型的大规模图像生成系统,通过基础模型微调为特定任务(如背景增强和宽高比外扩)生成专用模型,并在线上实验中分别获得18.0%和12.5%的参与度提升。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16880 2026-05-29 cs.CV cs.AI cs.LG 85%

Finding DoRI: Discovery of Retained Images in Diffusion Models

Finding DoRI: 扩散模型中保留图像的发现

Antoni Kowalczuk, Dominik Hintersdorf, Lukas Struppek, Kristian Kersting, Adam Dziedzic, Franziska Boenisch

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全研究中心) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Technical University of Darmstadt(达姆施塔特技术大学) Hessian Center for AI (Hessian.AI)(黑森人工智能中心(Hessian.AI)) Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特技术大学认知科学中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 通过挑战记忆局部化假设,发现文本嵌入的小扰动可重新触发数据复制,并证明记忆本质上是非局部的,从而提出对抗微调实现更鲁棒的缓解方法。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28036 2026-05-28 cs.CV cs.LG 85%

Stay Fair! Ensuring Group Fairness in Diffusion Models Across Guidance Scales

保持公平!确保扩散模型在不同引导尺度下的群体公平性

Myeongsoo Kim, Eunji Kim, Minwoo Chae, Sangwoo Mo

机构 * POSTECH Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出StayFair方法,通过分解总偏差为模型偏差和引导偏差,并扩展强人口平价到引导过程,设计公平引导算法,使扩散模型在不同引导尺度下保持群体公平性。

Comments 28 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09675 2026-05-28 cs.CV 85%

Accelerating Diffusion Sampling via Exploiting Local Transition Coherence

利用局部转移一致性加速扩散采样

Shangwen Zhu, Han Zhang, Zhantao Yang, Qianyu Peng, Zhao Pu, Huangji Wang, Fan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种无需训练的加速方法LTC-Accel,通过利用相邻步骤间转移算子的统计关系来估计当前转移算子,从而加速文本到图像和视频的扩散采样,兼容多种网络结构和现有加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01608 2026-05-27 cs.CV 85%

Guiding Token-Sparse Diffusion Models

引导令牌稀疏扩散模型

Felix Krause, Stefan Andreas Baumann, Johannes Schusterbauer, Olga Grebenkova, Ming Gui, Vincent Tao Hu, Björn Ommer

机构 * CompVis

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对稀疏训练扩散模型在推理时对无分类器引导响应不足的问题,提出令牌级稀疏引导方法,在保持输出高质量和高方差的同时降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25191 2026-05-26 cs.CV 85%

Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference

在推理时将图像引导注入文本条件扩散模型

Agata Żywot, Iason Skylitsis, Thijmen Nijdam, Zoe Tzifa-Kratira, Derck Prinzhorn, Konrad Szewczyk, Aritra Bhowmik

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出视觉概念融合(VCF),一种无需重新训练即可在推理时同时以图像和文本为条件进行双重引导的方法,通过对齐CLIP图像特征与文本嵌入空间实现视觉概念注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25123 2026-05-26 cs.LG cs.AI cs.CL cs.CV stat.ML 85%

Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo

扩散模型的推理时对齐:基于信任区域迭代扭曲序贯蒙特卡洛方法

Weixin Wang, Yu Yang, Wei Deng, Pan Xu

机构 * Duke University(杜克大学) Morgan Stanley(摩根大通)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出信任区域迭代扭曲序贯蒙特卡洛(TRI-TSMC)框架,通过迭代学习扭曲函数来改进扩散模型推理时的对齐,在文本生成和文本到图像生成任务上优于现有方法。

Comments 34 pages, 6 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24631 2026-05-26 cs.LG cs.AI cs.CV 85%

Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion

超越生成先验:JEPA引导扩散的少数采样

Sol Park, Soobin Um

机构 * Department of Artificial Intelligence, Kookmin University, Seoul, South Korea(人工智能系,韩国全州大学,首尔)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种基于世界模型JEPA引导的扩散采样框架,通过近似策略实现高效计算,在无条件、类别条件和文本到图像生成中提升少数样本的保真度和语义有效性。

Comments ICML 2026, 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22668 2026-05-22 cs.CV 85%

SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers

SEGA:用于扩散变换器中分辨率外推的频谱-能量引导注意力

Javad Rajabi, Kimia Shaban, Koorosh Roohi, David B. Lindell, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 SEGA通过动态调整注意力权重来提升扩散变换器在高分辨率生成中的表现,其核心方法是根据潜在空间的频谱结构调整RoPE组件的注意力缩放,从而在保持全局结构和恢复细节方面取得平衡。

Comments 27 pages, 14 figures. Project page: https://rajabi2001.github.io/sega/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21123 2026-05-21 cs.CV cs.LG 85%

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

Linear-DPO: 用于扩散和流匹配生成模型的线性直接偏好优化

Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Linear-DPO,通过统一的反向时间SDE框架推导出涵盖扩散和流匹配的通用DPO目标,指出标准DPO目标在文本到图像生成中不最优,并通过定性定量实验验证了其在扩散模型和流匹配模型上的优越性。

Comments Code and models are available at: https://github.com/Whynot0101/Linear-DPO . Work done during an internship at Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20316 2026-05-21 cs.CV cs.AI 85%

FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation

FullFlow: 通过双向视觉-语言生成升级文本到图像流匹配模型

Eric Tillmann Bill, Enis Simsar, Alessio Tonioni, Thomas Hofmann

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出FullFlow方法,通过仅训练LoRA适配器和轻量级文本头部,将预训练的rectified-flow文本到图像模型升级为双向视觉-语言生成器,从而在保持图像连续流的同时添加文本离散插入过程,提升文本到图像和图像到文本的生成质量。

Comments project page: https://ericbill21.github.io/fullflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20309 2026-05-21 cs.CV cs.AI 85%

Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision

Tiny-Engram: 生成视觉中的触发索引概念表

Runyuan Cai, Yiming Wang, Yu Lin, Xiaodong Zeng

机构 * AutoArk-AI

专题命中 扩散模型 :generative vision(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Tiny-Engram,一种紧凑的触发索引概念表,通过显式地为视觉记忆分配词汇地址和激活边界,实现对冻结图像和视频生成器中的概念的控制。该方法通过注册的n-gram匹配索引参数化每个概念,仅在匹配触发区域调节文本编码器的隐藏状态,从而在保持周围提示的组合控制的同时,将罕见触发短语绑定到目标身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10180 2026-05-20 cs.CV cs.CR 85%

What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers

什么概念在其中?在扩散变换器中检测和抑制危险内容

Chenyu Zhang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了如何在扩散变换器中检测和抑制危险内容,提出了一种无需训练的推理时安全机制AHV-D&S,通过分析注意力头对概念的敏感性来检测和抑制危险生成倾向,有效压制了性内容、受版权保护的内容及有害内容,同时保持视觉质量。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16736 2026-05-20 cs.CV 85%

CAB: Accelerating Flow and Diffusion Sampling via Rectification and Corrected Adams-Bashforth

CAB: 通过校正和修正Adams-Bashforth加速流和扩散采样

Anuska Roy, Pravin Nair

机构 * Department of Electrical Engineering(电气工程系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的采样器CAB,通过将采样动态转换为统一的校正坐标系,并应用带有基于过去速度评估的简单修正项的多步Adams-Bashforth预测器,从而在不增加额外函数评估次数的情况下加速流和扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10759 2026-05-19 cs.LG cs.CV 85%

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

强化共轭匹配:扩散和流匹配模型的后训练强化学习扩展

Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) King's College London(伦敦国王学院) Microsoft Research New England(微软研究院新英格兰分部) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Reinforce Adjoint Matching方法,通过强化学习后训练优化扩散和流匹配模型,无需SDE回滚或梯度,提升生成质量与人类偏好匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏