arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2510.02307 2026-05-18 cs.CV cs.AI 85%

NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation

NoiseShift: 为更好的低分辨率图像生成的分辨率感知噪声校准

Ruozhen He, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez

机构 * Rice University(里士大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出NoiseShift,通过校准噪声条件以恢复局部正反向一致性,提升低分辨率图像生成质量,无需额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18944 2026-05-18 cs.CV cs.AI cs.CR 85%

Rethinking and Red-Teaming Protective Perturbation in Personalized Diffusion Models

重新审视并红队测试个性化扩散模型中的保护扰动

Yixin Liu, Ruoxi Chen, Xun Chen, Lichao Sun

机构 * Lehigh University(莱维大学) Lehigh University Computer Science(莱维大学计算机科学) Engineering Bethlehem PA USA(工程 布雷顿 佛罗里达 美国) Independent Researcher(独立研究员) Independent Researcher Fremont California USA(独立研究员 佛罗里达 加州 美国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过快捷学习视角分析PDM微调过程,揭示对抗扰动导致的潜在空间错位问题,提出数据净化与对比解耦学习框架以提升保护性能。

Comments Code is available at https://github.com/liuyixin-louis/DiffShortcut

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09065 2026-05-12 cs.CV cs.LG 85%

Dependency-Aware Discrete Diffusion for Scene Graph Generation

面向依赖关系的离散扩散用于场景图生成

Rajalaxmi Rajagopalan, Romit Roy Choudhury

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种依赖感知的层次约束离散扩散模型,用于生成场景图,通过分离结构与语义,提升生成的依赖关系和层次结构,实验显示在场景图和布局指标上优于基线方法,并在多对象场景中提升图像生成的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07973 2026-05-11 cs.CV 85%

HEART: Hyperspherical Embedding Alignment via Kent-Representation Traversal in Diffusion Models

HEART:通过扩散模型中的Kent表示遍历实现超球面嵌入对齐

Arani Roy, Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HEART框架,通过超球面几何对齐实现图像生成中的直观精确编辑,无需微调或优化,提升控制精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17966 2026-05-08 eess.IV cs.CV 85%

A Wavelet Diffusion GAN for Image Super-Resolution

基于小波的扩散GAN用于图像超分辨率

Lorenzo Aloisi, Luigi Sigillo, Aurelio Uncini, Danilo Comminiello

机构 * Department of Information Engineering, Electronics and Telecommunications (DIET)(信息工程、电子与电信系) ``Sapienza'' University of Rome(罗马大学萨皮恩扎分校) Via Eudossiana 18, 00184, Rome(埃杜斯西亚纳街18号,00184,罗马)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于小波的扩散GAN方案,通过减少反向扩散步骤和利用小波变换进行降维,提升图像超分辨率的训练和推理效率。实验验证在CelebA-HQ数据集上优于现有方法,实现高保真输出。

Comments The paper has been accepted at Italian Workshop on Neural Networks (WIRN) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01510 2026-05-05 cs.CV 85%

SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion

SwiftPie: 通过一步扩散实现闪电般的主体驱动图像个性化

Huy Duong, Trong-Tung Nguyen, Cuong Pham, Anh Tran, Khoi Nguyen, Minh Hoai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 SwiftPie提出一种一步扩散模型,实现快速主体驱动图像生成,通过双分支身份注入机制和掩码引导重缩放策略,提升生成效率和质量。

Comments CVPR26 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 85%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21289 2026-04-24 cs.CV 85%

AttDiff-GAN: A Hybrid Diffusion-GAN Framework for Facial Attribute Editing

AttDiff-GAN:一种用于面部属性编辑的混合扩散-生成对抗网络框架

Wenmin Huang, Weiqi Luo, Xiaochun Cao, Jiwu Huang

机构 * GuangDong Province Key Lab of Information Security Technology and School of Computer Science and Engineering(广东信息安全技术重点实验室和计算机科学与工程学院) School of Cyber Science and Technology, Shenzhen Campus(深圳校区网络科学与技术学院) Guangdong Laboratory of Machine Perception and Intelligent Computing, Faculty of Engineering(广东机器感知与智能计算实验室,工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出AttDiff-GAN框架,结合GAN属性操控与扩散图像生成,通过特征级对抗学习和PriorMapper、RefineExtractor提升风格-属性对齐,实现更精确的面部属性编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21008 2026-04-24 cs.CV 85%

Linear Image Generation by Synthesizing Exposure Brackets

通过合成曝光快门生成线性图像

Yuekun Dai, Zhoutong Zhang, Shangchen Zhou, Nanxuan Zhao

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Adobe NextCam Adobe Research(Adobe研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出基于文本的线性图像生成方法,通过合成曝光快门序列生成高质量场景参考线性图像,保留完整动态范围,用于专业后期处理。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20354 2026-04-23 cs.CV 85%

Hallucination Early Detection in Diffusion Models

扩散模型中的幻觉早期检测

Federico Betti, Lorenzo Baraldi, Lorenzo Baraldi, Rita Cucchiara, Nicu Sebe

机构 * University of Trento(特伦托大学) Università di Pisa(比萨大学) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HEaD+方法,通过整合交叉注意力图和文本信息,早期检测扩散模型生成中的幻觉问题,提高生成完整图像的准确率并减少生成时间。

Comments 21 pages, 6 figures, 4 tables. Published in International Journal of Computer Vision (IJCV)

Journal ref Int. J. Comput. Vis. 134, 35 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19135 2026-04-22 cs.CV 85%

Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval

Diff-SBSR: 学习多模态特征增强的扩散模型用于零样本素描基础3D形状检索

Hang Cheng, Fanhe Dong, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出利用文本到图像扩散模型解决零样本素描基础3D形状检索问题,通过多模态特征增强策略提升语义上下文捕捉能力,实验表明方法在公开基准上优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18076 2026-04-21 cs.CV cs.AI 85%

Class-specific diffusion models improve military object detection in a low-data domain

特定类别的扩散模型在低数据域中改进军事目标检测

Ella P. Fokkinga, Jan Erik van Woerden, Thijs A. Eker, Sebastiaan P. Snel, Elfi I. S. Hofmeijer, Klamer Schutte, Friso G. Heslinga

机构 * TNO - Intelligent Imaging(TNO智能成像实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文通过特定类别的扩散模型生成合成数据,提升低数据条件下军事车辆检测性能,特别是在样本稀少时效果显著,同时引入结构引导生成数据进一步增强模型表现。

Comments Submitted to SPIE Defense + Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21783 2026-04-20 cs.CV cs.AI cs.CR 85%

Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models

由小噪声注入驱动的噪声聚合分析:扩散模型的高效成员推断

Guo Li, Weihong Chen, Yongfu Fan

机构 * South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于噪声聚合分析的成员推断方法,通过单步低强度噪声注入策略增强成员与非成员样本差异,降低模型查询需求并提升推断效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10675 2026-04-14 cs.CV 85%

HiddenObjects: Scalable Diffusion-Distilled Spatial Priors for Object Placement

HiddenObjects: 用于物体放置的可扩展扩散-蒸馏空间先验

Marco Schouten, Ioannis Siglidis, Serge Belongie, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(人工智能先锋中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型蒸馏学习显式的类别条件空间先验,用于自然场景中的物体放置。通过自动化框架构建大规模数据集,实验表明其优于人类标注和现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06338 2026-04-07 cs.AI cs.CV cs.LG 85%

Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

扩散变换器中空间关系生成的电路机制

Binxu Wang, Jingxuan Fan, Xu Pan

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究通过机械可解释性方法探讨扩散变换器如何生成正确空间关系,发现不同文本编码器影响电路机制,随机嵌入通过双阶段电路生成,预训练编码器则通过信息融合生成,两种方法在领域内表现相似但抗扰性不同。

Comments 45 pages, 30 figures, accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26834 2026-03-31 eess.IV cs.AI cs.CV 85%

Hybrid Diffusion Model for Breast Ultrasound Image Augmentation

混合扩散模型用于乳腺超声图像增强

Farhan Fuad Abir, Sanjeda Sara Jennifer, Niloofar Yousefi, Laura J. Brattain

机构 * University of Central Florida(中佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出混合扩散框架,结合文本生成与图像精修提升超声图像真实性,通过LoRA和文本倒置优化,降低FID值,提升分类性能。

Comments Accepted at IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18425 2026-03-30 cs.CV cs.AI cs.LG 85%

U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models

U-Sketch:一种高效的从草图到图像扩散模型方法

Ilias Mitsouras, Eleftherios Tsonis, Paraskevi Tzouveli, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory(人工智能与学习系统实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) National Technical University of Athens(雅典国立技术大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 U-Sketch通过引入U-Net类型的潜在边缘预测器和草图简化网络,提升草图到图像合成的效率与真实度,减少去噪步骤并提升生成质量。

Journal ref IEEE Access 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23903 2026-03-26 cs.CV cs.AI 85%

Latent Bias Alignment for High-Fidelity Diffusion Inversion in Real-World Image Reconstruction and Manipulation

潜在偏置对齐用于高保真扩散倒置在现实世界图像重建与操控中的应用

Weiming Chen, Qifan Liu, Siyi Liu, Yushun Tang, Yijia Wang, Zhihan Zhu, Zhihai He

机构 * Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Undergraduate School of Artificial Intelligence, Shenzhen Polytechnic University(深圳理工大学人工智能本科生学院) Huawei Technologies Co., Ltd.(华为技术有限公司) Pengcheng Lab(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出Latent Bias Optimization和Image Latent Boosting方法,解决扩散模型与现实场景衔接中的重建质量与鲁棒性问题,提升图像编辑和稀有概念生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22275 2026-03-24 cs.CV 85%

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19158 2026-03-20 cs.CV 85%

Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

自适应辅助提示融合用于目标忠实的扩散生成

Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出自适应辅助提示融合框架,通过辅助锚点提示在低密度区域稳定扩散过程,提升目标提示的忠实性与生成质量。

Comments Accepted in CVPR 2026 (main track). 10 pages, 6 figures; supplementary material included (14 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19917 2026-03-17 cs.CV 85%

Scale Where It Matters: Training-Free Localized Scaling for Diffusion Models

在关键区域进行扩展:无需训练的扩散模型局部化扩展

Qin Ren, Yufei Wang, Lanqing Guo, Wen Zhang, Zhiwen Fan, Chenyu You

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LoTTS,一种无需训练的局部化测试时扩展方法,通过局部重采样缺陷区域提升图像质量并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14062 2026-03-17 cs.CV cs.LG 85%

TMPDiff: Temporal Mixed-Precision for Diffusion Models

TMPDiff:扩散模型的时序混合精度

Basile Lewandowski, Simon Kurz, Aditya Shankar, Robert Birke, Jian-Jia Chen, Lydia Y. Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TMPDiff通过为不同去噪时间步分配不同精度,优化扩散模型的推理效率,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06300 2026-03-09 cs.CV cs.LG 85%

3D CBCT Artefact Removal Using Perpendicular Score-Based Diffusion Models

使用垂直分数扩散模型进行3D锥束CT伪影去除

Susanne Schaub, Florentin Bieder, Matheus L. Oliveira, Yulan Wang, Dorothea Dagassan-Berndt, Michael M. Bornstein, Philippe C. Cattin

机构 * Department of Biomedical Engineering, University of Basel, Allschwil, Switzerland Piracicaba Dental School, University of Campinas, Piracicaba, Brazil State Key Laboratory of Oral \& Maxillofacial Reconstruction Regeneration, Key Laboratory of Oral Biomedicine Ministry of Education, Hubei Key Laboratory of Stomatology, School \& Hospital of Stomatology, Wuhan University, Wuhan, China Dental Imaging, University Center for Dental Medicine, University of Basel, Basel, Switzerland Department of Oral Health \& Medicine, University Center for Dental Medicine, University of Basel, Basel, Switzerland

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于垂直分数扩散模型的3D牙科植入物修复方法,通过结合两个2D模型在投影域中操作,有效减少CBCT图像伪影,提升临床成像质量。

Comments Accepted at DGM4MICCAI 2025

Journal ref Lecture Notes in Computer Science, vol. 16128, Springer, 2025, pp. 244-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03973 2026-03-05 cs.LG cs.CV 85%

Dual-Solver: A Generalized ODE Solver for Diffusion Models with Dual Prediction

Dual-Solver: 一种用于扩散模型的通用微分方程求解器,具有双预测功能

Soochul Park, Yeon Ju Lee

机构 * SteAI MODULABS Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Dual-Solver通过可学习参数泛化多步采样器,提高扩散模型在低NFE下的生成质量。

Comments Published as a conference paper at ICLR 2026. 36 pages, 18 figures

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08184 2026-03-05 cs.CV 85%

Scaling Laws For Diffusion Transformers

扩散变换器的扩展定律

Zhengyang Liang, Hao He, Ceyuan Yang, Bo Dai

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06547 2026-03-03 cs.CV cs.LG 85%

Concept-TRAK: Understanding how diffusion models learn concepts through concept-level attribution

Concept-TRAK: 通过概念层面的归因理解扩散模型如何学习概念

Yonghyun Park, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Naoki Murata, Wei-Hsiang Liao, Woosung Choi, Kin Wai Cheuk, Junghyun Koo, Yuki Mitsufuji

机构 * University of Pennsylvania(宾夕法尼亚大学) SONY AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Concept-TRAK通过概念层面归因方法,提升扩散模型对特定概念的解释能力,适用于图像生成中的版权与透明性问题。

Comments This paper has been accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01068 2026-03-03 cs.CV cs.LG 85%

LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model

LLaDA-o:一种高效且长度自适应的多模态扩散模型

Zebin You, Xiaolu Zhang, Jun Zhou, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China.(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 LLaDA-o通过混合扩散框架和数据驱动的长度适应策略,实现了高效且灵活的多模态扩散建模,展示了在文本到图像生成任务中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25162 2026-02-24 cs.CV 85%

AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

AlignTok: 将预训练视觉编码器对齐到分词器以用于扩散模型

Bowei Chen, Sai Bi, Hao Tan, He Zhang, Tianyuan Zhang, Zhengqi Li, Yuanjun Xiong, Jianming Zhang, Kai Zhang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 AlignTok通过将预训练视觉编码器对齐为分词器,提升扩散模型的生成质量和收敛速度,适用于图像生成任务。

Comments ICLR 2026, Project Page: https://aligntok.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11875 2026-02-13 cs.CV cs.RO 85%

DiffPlace: Street View Generation via Place-Controllable Diffusion Model Enhancing Place Recognition

DiffPlace: 通过可控制位置的扩散模型增强位置识别生成街道视图

Ji Li, Zhiwei Li, Shihao Li, Zhenjiang Yu, Boyang Wang, Haiou Liu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 DiffPlace通过引入位置ID控制器,实现了位置可控的多视角图像生成,提升了视觉位置识别任务中的生成质量和训练支持。

Comments accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09268 2026-02-11 cs.CV 85%

Rethinking Global Text Conditioning in Diffusion Transformers

重新思考扩散变换器中的全局文本条件化

Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen Liu, Zhonghao Wang, Yuqian Zhou, Zhe Lin, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文重新思考扩散变换器中的全局文本条件化,发现传统调制机制贡献有限,但通过不同视角使用池化嵌入可带来显著性能提升。

Comments Accepted at ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏