arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2869 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2193 篇

2607.14580 2026-07-17 cs.CV cs.LG 新提交 87%

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

先进图像生成:负提示优化与潜在分类器引导

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 该研究提出新系统,通过微调序列到序列语言模型集成负提示优化与潜在空间分类器引导,自动生成优化负提示,用混合分类器评估引导扩散步骤,减少伪影并提高语义保真度,提升Stable Diffusion图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06590 2026-07-09 cs.CV cs.LG 新提交 87%

AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis

用于文化遗产纺织品的人工智能:针对新型乌洛花纹合成的微调潜在扩散模型

Humasak Tommy Argo Simanjuntak, Jesika Purba, Sitogab Girsang, Widya Manurung, Samuel Situmeang, Arlinta Barus, Daniel Oranova Siahaan

机构 * Information Systems Study Program, Faculty of Informatics and Electrical Engineering, Institut Teknologi Del(信息系统研究项目,信息与电气工程学院,技术学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 该研究针对传统乌洛编织局限,提出在高分辨率乌洛图案数据集上微调Protogen v3.4和Stable Diffusion v1.4两个潜在扩散模型来生成新颖设计,通过多种方式评估模型性能,发现特定引导尺度能平衡保真度与多样性,支持非物质文化遗产创新更新。

Comments 21 pages, 8 figures, 3 tables. The manuscript is currently under review at the 2026 4th International Conference on Data, Information and Computing Science (https://www.cdics.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20416 2026-07-08 cs.LG cs.CV 新提交 87%

On the Redundancy of Timestep Embeddings in Diffusion Models

扩散模型中时间步嵌入的冗余性研究

José A. Chávez

机构 * Independent Researcher, Lima, Peru(独立研究者,秘鲁利马)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文通过理论和实验证明,在U-Net和Diffusion Transformer架构中,扩散模型无需显式时间步嵌入也能达到全局最优,甚至在某些指标上超越有条件模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 87%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07430 2026-08-10 cs.LG cs.AI 新提交 87%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06210 2026-08-07 cs.RO 新提交 87%

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:用于柔顺机器人操作的可变阻抗扩散策略(Variable Impedance Diffusion Policy)

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 该研究针对接触丰富的机器人操作问题,提出基于模仿学习的可变阻抗控制框架VIDP,利用TP-DAMM从多样本演示中提取物理一致的轨迹分布,无需力传感器即可联合预测位姿与柔顺性,在真实实验中任务成功率及力、跟踪误差表现均优于基线方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 87%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23626 2026-06-23 cs.LG cs.AI 新提交 87%

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

DiT-Reward:文本到图像奖励建模的生成式表示

Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy, JD.com(京东探索研究院,京东) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 87%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13740 2026-06-15 cs.LG 新提交 87%

Efficient On-Device Diffusion LLM Inference with Mobile NPU

基于移动NPU的高效设备端扩散大语言模型推理

Tuowei Wang, Yanfan Sun, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11655 2026-07-14 cs.CV 新提交 86%

Feature-Space Guided Diffusion for Realistic Ultrasound Image Synthesis

用于逼真超声图像合成的特征空间引导扩散

Marina Domínguez, Nélida Mirabet-Herranz, Valery Naranjo

机构 * Artikode Intelligence S.L.(Artikode智能有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对条件扩散模型合成超声图像逼真度不足问题,提出无需训练的特征空间候选引导(FSCG)采样策略,通过局部k近邻特征校正及按特征空间能量选最佳候选,缩小与真实图像差距,在多数据集上效果优于标准采样及其他基线。

Comments 11 pages, 4 figures. Pre-review manuscript version of a paper accepted at DGM4MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09787 2026-07-14 cs.CV cs.LG 新提交 86%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交 86%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title);分类 cs.CV

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22924 2026-06-23 cs.CV 新提交 86%

MythraGen: Two-Stage Retrieval Augmented Art Generation Framework

MythraGen:两阶段检索增强艺术生成框架

Quang-Khai Le, Cong-Long Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh city, Vietnam(胡志明市科学大学) Vietnam National University, Ho Chi Minh city, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MythraGen框架,结合艺术检索与LoRA微调,通过检索与提示最相似的艺术图像微调Stable Diffusion,在WikiArt数据集上生成高质量、风格匹配的艺术作品。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14727 2026-06-16 cs.CV 新提交 86%

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis

FairGen: 用于人口统计公平医学图像生成的偏好对齐扩散模型

Zhimin Li, Ruichen Zhang, Zhen Tan, Howard J Aizenstein, Jingtong Hu, Tianlong Chen

机构 * University of Pittsburgh, Swanson School of Engineering(匹兹堡大学斯旺森工程学院) The University of North Carolina at Chapel Hill, Department of Computer Science(北卡罗来纳大学教堂山分校计算机科学系) Arizona State University, School of Computing and Augmented Intelligence(亚利桑那州立大学计算与增强智能学院) University of Pittsburgh, Department of Psychiatry(匹兹堡大学精神病学系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 提出FairGen框架,通过将医生偏好嵌入扩散模型生成过程,合成人口统计平衡的医学图像,在皮肤、胸片和脑MRI任务上分别实现95.9%、80.0%和35.2%的公平性提升,同时保持诊断准确性。

Comments Accepted for publication in npj Digital Medicine. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10653 2026-06-10 cs.CV 新提交 86%

STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model

STEDiff: 增强文本嵌入以提升扩散模型中文本到图像的对齐

Hailan Zhang, Haipeng Liu, Bo Fu, Yang Wang

机构 * Hailan Zhang, Haipeng Liu, Yang Wang(未明确机构) Bo Fu(未明确机构)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title);分类 cs.CV

AI总结 提出训练免费的STEDiff方法,通过利用[EOT]令牌增强子句语义并引入语义增强损失,在文本嵌入空间中改善扩散模型对复杂提示的语义对齐,无需微调或布局先验。

Comments 8 pages, 8 figures, to appear at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13247 2026-06-12 cs.AI 新提交 86%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract,comments);diffusion(abstract,comments)

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19344 2026-07-22 cs.CV cs.AI cs.GR 新提交 86%

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

外观指针——扩散变压器的多模态区域控制

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

机构 * Brown University(布朗大学) Adobe Research(Adobe 研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。

Comments 38 Pages, Preprint with supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09438 2026-08-11 cs.CV 新提交 85%

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

揭示扩散Transformer中AdaLN-Zero的秘密

Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

机构 * Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Baidu(百度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究探究扩散Transformer(DiT)中AdaLN-Zero性能优于AdaLN的原因,发现零初始化是关键要素,提出AdaLN-Gaussian初始化策略与SE-adaLN-Zero机制,经多数据集实验验证其有效性与泛化性。

Comments Accept by IEEE TPAMI 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23488 2026-07-28 cs.LG cs.CV 新提交 85%

Learning Sampling Parameters for Diffusion Models

学习扩散模型的采样参数

Arisrei Lim, Yossi Gandelsman

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。

Comments Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09067 2026-07-13 cs.CV 新提交 85%

Probing Diffusion Denoising Dynamics for Contrastive Representation Learning

探索用于对比表示学习的扩散去噪动力学

Yasong Dai, Zeeshan Hayder, David Ahmedt-Aristizabal, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO Data61(联邦科学与工业研究组织数据61实验室) Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何让预训练扩散模型的去噪动力学适应判别表示学习,提出D³CL方法,通过结合对比目标与去噪重建损失,利用LoRA更新保持轻量级,实验证明该方法能使重建与对比目标互补,是高效参数适应框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08794 2026-07-13 cs.GR cs.AI 新提交 85%

Multi-Conditioned Diffusion Synthesis of Sand Boils for Low-Resource Earthen-Levee Inspection

用于低资源土堤检查的砂沸多条件扩散合成

Padam Jung Thapa, Abdullah Bin Naeem, Ayon Dey, Anav Katwal, Md Tamjidul Hoque

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校) Department of Computer Science, Louisiana State University New Orleans(路易斯安那州立大学新奥尔良分校计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.GR

AI总结 针对土堤砂沸像素级检测因注释稀缺受限的问题,提出基于扩散的合成管道,用多分支ControlNet堆栈等技术生成合成图像,经评估各预设利弊后发布标签可靠预设,为低资源土堤检查提供合成图像,限于图像质量等方面,代码等可复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00817 2026-07-02 cs.CV 新提交 85%

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization

无需训练的扩散模型去偏方法:基于CLIP引导的去噪优化

Dain Kim, Jinseo Kim, Sungyong Baik

机构 * Dept. of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) Dept. of Data Science, Hanyang University(汉阳大学数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TES框架,通过扩散过程中优化文本嵌入来缓解人口统计偏见,无需重新训练,使用两阶段策略(早期全局对齐+迭代去噪时CLIP反馈)实现稳定可控的属性引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28144 2026-06-29 cs.CV 新提交 85%

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract,abstract_cn);分类 cs.CV

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27696 2026-06-29 cs.LG cs.AI cs.CV 新提交 85%

Class-frequency Guided Noise Schedule for Diffusion Models

面向扩散模型的类别频率引导噪声调度

Jiequan Cui, Beier Zhu, Qingshan Xu, Xiaojuan Qi, Bei Yu, Hanwang Zhang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对低频类别在扩散模型中因低密度区域导致评分估计不准和生成质量差的问题,提出类别频率引导的噪声调度(CFRG),为低频类别分配更大尺度噪声,在CIFAR-100-LT和ImageNet-LT上显著提升生成质量。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27089 2026-06-26 cs.CV 新提交 85%

TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing

TMP:面向大规模图像生成与编辑的树结构混合策略剪枝

Peizhen Zhang, Yang Li, Xunsong Li, Songtao Liu, Zewen Liu, Qiangqiang Hu, Guotong Guo, Jupeng Ding, Yifu Sun, coopersli, Jian Zhang, Zhao Zhong, Liefeng Bo

机构 * Multimodal Model Department, Tencent(腾讯多模态模型部)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出首个树结构混合策略剪枝框架TMP,适用于文本到图像和文本引导图像到图像任务及MoE/DiT架构,以75%压缩比将HunyuanImage 3.0从80B降至20B参数,并在单张4090 GPU上推理。

Comments 10 pages, 3 figures, 3 tables, tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24888 2026-06-24 cs.CV 新提交 85%

DiffusionBench: On Holistic Evaluation of Diffusion Transformers

DiffusionBench: 扩散变换器的整体评估

Xingjian Leng, Jaskirat Singh, Zhanhao Liang, Ethan Smith, Martin Bell, Aninda Saha, Yuhui Yuan, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) Canva Research(Canva研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出NanoGen统一框架,训练21个潜在扩散模型后发现ImageNet与文本到图像生成的方法排名无强相关性,因此建立DiffusionBench基准,建议同时评估两项任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15590 2026-06-16 cs.CV 新提交 85%

Unlocking Diffusion Hierarchies: Adaptive Timestep Selection for Zero-Shot Segmentation

解锁扩散层次:自适应时间步选择用于零样本分割

Ramin Nakhli, Mahesh Ramachandran, Luca Ballan

机构 * Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出自适应时间步选择机制,利用扩散模型去噪过程中的层次语义进展,结合上下文相似度图融合高分辨率注意力与U-Net特征,实现零样本分割性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11289 2026-06-11 cs.CV 新提交 85%

i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models

i1: 一种简单且完全开放的强文本到图像模型配方

Boya Zeng, Tianze Luo, Shu Pu, Jucheng Shen, Taiming Lu, Gabriel Sarch, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 扩散模型 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过300多次控制实验系统研究文本到图像扩散模型的设计选择,提出i1模型,仅用公开数据集训练3B参数模型,在五个基准上平均超越现有最佳完全开放模型29.5个百分点。

Comments Project page at https://zlab-princeton.github.io/i1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09273 2026-06-09 cs.CV 新提交 85%

EditSSC: Toward Editable Semantic Occupancy Scenes with Unconditional Diffusion Models

EditSSC: 基于无条件扩散模型的可编辑语义占用场景

Fatima Balde, Raoul de Charette, Alexandre Boulch

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(法雷奥人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出EditSSC方法,利用2D BEV表示和现成潜扩散网络实现3D语义场景生成与免训练编辑,在SemanticKITTI上优于现有3D专用基线。

Comments Accepted at CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏