arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3474 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2510.02315 2026-03-26 cs.CV 88%

FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation

FOCUS:多实体世界建模中的最优控制

Eric Tillmann Bill, Enis Simsar, Thomas Hofmann

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出FOCUS框架,通过将流匹配转化为随机最优控制,解决文本生成图像中多实体场景的属性泄露和身份纠缠问题,提出两种算法提升多实体对齐性能。

Comments Project Page: https://ericbill21.github.io/FOCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21886 2026-03-24 cs.IR cs.CV 88%

ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval

ADaFuSE: 适应性扩散生成图像与文本融合用于交互式文本到图像检索

Zhuocheng Zhang, Xingwu Zhang, Kangheng Liang, Guanxuan Li, Richard Mccreadie, Zijun Long

机构 * Hunan University(湖南大学) University of Glasgow(格拉斯哥大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ADaFuSE通过引入双分支融合机制,结合自适应门控和语义感知专家混合,提升交互式文本到图像检索的性能,实现更稳健的多模态融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20880 2026-03-24 cs.CV 88%

When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance

当安全碰撞时:通过自适应安全引导解决文本到图像扩散中的多类别有害冲突

Yongli Xiang, Ziming Hong, Zhaoqing Wang, Xiangyu Zhao, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) City University of Hong Kong(香港城市大学) TMLR Group, Hong Kong Baptist University(Baptist大学TMLR小组)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CASG框架,通过动态识别并应用类别对齐的安全方向,解决文本到图像扩散模型中多类别有害冲突问题,实验表明其能有效降低有害率。

Comments CVPR 2026; Code is released at CVPR_CASG" target="_blank" rel="noopener">https://github.com/tmllab/2026_CVPR_CASG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17828 2026-03-19 cs.CV 88%

TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

TINA:无文本逆向攻击用于未学习的文本到图像扩散模型

Qianlong Xiang, Miao Zhang, Haoyu Zhang, Kun Wang, Junhui Hou, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) Peng Cheng Laboratory(鹏城实验室) Shandong University(山东大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。

Comments 16 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13547 2026-03-17 cs.CV 88%

NumColor: Precise Numeric Color Control in Text-to-Image Generation

NumColor: 文本到图像生成中的精确数值颜色控制

Muhammad Atif Butt, Diego Hernandez, Alexandra Gomez-Villa, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Computer Sciences Department, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目) City University of Hong Kong(香港城市大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 NumColor通过颜色标记聚合器和颜色书实现多扩散架构中的精确数值颜色控制,提升颜色准确性和和谐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13070 2026-03-16 cs.CV 88%

Mitigating Memorization in Text-to-Image Diffusion via Region-Aware Prompt Augmentation and Multimodal Copy Detection

通过区域感知提示增强和多模态复制检测缓解文本到图像扩散中的记忆化

Yunzhuo Chen, Jordan Vice, Naveed Akhtar, Nur Al Hasan Haldar, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Curtin University(科廷大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出区域感知提示增强和多模态复制检测方法,通过增强提示多样性与检测复制行为,提升文本到图像扩散模型的生成质量与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10785 2026-03-12 cs.CV 88%

The Quadratic Geometry of Flow Matching: Semantic Granularity Alignment for Text-to-Image Synthesis

流匹配的二次几何:文本到图像合成中的语义粒度对齐

Zhinan Xiong, Shunqi Yuan

机构 * Conservatoire National des Arts et Métiers(法国国家艺术与工艺学院) Sun Yat-sen University(孙中山大学)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出语义粒度对齐方法,通过优化流匹配框架中的残差场,提升文本到图像合成的效率与质量平衡。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV 88%

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02829 2026-03-05 cs.CV cs.LG 88%

Toward Early Quality Assessment of Text-to-Image Diffusion Models

面向文本到图像扩散模型早期质量评估

Huanlei Guo, Hongxin Wei, Bingyi Jing

机构 * Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出Probe-Select模块,通过早期评估指导文本到图像扩散模型的生成过程,降低采样成本并提升保留图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20376 2026-03-05 cs.CV cs.CR 88%

When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems

当记忆成为漏洞:针对文本到图像生成系统的多轮劫持攻击

Shiqian Zhao, Jiayang Liu, Yiming Li, Runyi Hu, Xiaojun Jia, Wenshu Fan, Xiao Bao, Xinfeng Li, Jie Zhang, Wei Dong, Tianwei Zhang, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学) Institute of Science(科学研究院) University of Electronic Science and Technology of China(电子科技大学) CFAR and IHPC Agency for Science Technology and Research(CFAR和IHPC科技研究局) VinUniversity(文大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出Inception,首个利用文本到图像生成系统内存机制的多轮劫持攻击方法,通过分割和递归模块有效规避安全过滤,提升攻击成功率20%。

Comments This work proposes a multi-turn jailbreak attack against real-world chat-based T2I generation systems that intergrate memory mechanism. It also constructed a simulation system, with considering three industrial-grade memory mechanisms, 7 kinds of safety filters (both input and output); It is going to appear on USENIX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13585 2026-03-02 cs.CV 88%

Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation

Diff-Aid: 修复文本到图像生成中的推理时间自适应交互去噪

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 Diff-Aid通过自适应调整文本与图像交互提升文本到图像生成质量,提供可解释的调节模式并支持下游应用改进。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19631 2026-02-24 cs.CV cs.AI 88%

Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection

通过高层表示误导实现文本到图像扩散模型中的局部概念擦除

Uichan Lee, Jeonghyeon Kim, Sangheum Hwang

机构 * Department of Data Science, Seoul National University of Science and Technology(数据科学系,首尔科学技术大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HiRM方法,通过误导文本编码器中的高层表示来实现精确的概念擦除,减少对非目标概念的影响,并在低训练成本下保持生成能力。

Comments Accepted at ICLR 2026. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13055 2026-02-16 cs.CV cs.AI cs.LG 88%

Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation

Curriculum-DPO++: 通过数据和模型课程直接优化偏好用于文本到图像生成

Florinel-Alin Croitoru, Vlad Hondru, Radu Tudor Ionescu, Nicu Sebe, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) University of Trento(特伦托大学) Center for Research in Computer Vision (CRCV), University of Central Florida(中央佛罗里达大学计算机视觉研究中心)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 Curriculum-DPO++通过数据和模型课程增强直接偏好优化,提升文本到图像生成的性能。

Comments arXiv admin note: substantial text overlap with arXiv:2405.13637

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06166 2026-02-09 cs.CV 88%

M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning

M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成

Bangji Yang, Ruihan Guo, Jiajun Fan, Chaoran Cheng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01151 2026-02-06 cs.CV cs.AI 88%

Personalized Safety Alignment for Text-to-Image Diffusion Models

面向文本到图像扩散模型的个性化安全对齐

Yu Lei, Jinbin Bai, Qingyu Shi, Aosong Feng, Hongcheng Gao, Xiao Zhang, Rex Ying

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Yale University(耶鲁大学) Collov Labs(Collov实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出个性化安全对齐框架PSA,通过用户条件适应提升文本到图像扩散模型的安全性与生成质量,实现安全与质量的动态平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11651 2026-02-03 cs.CV cs.AI cs.CY 88%

Aesthetics as Structural Harm: Algorithmic Lookism Across Text-to-Image Generation and Classification

审美作为结构性伤害:跨文本到图像生成和分类的算法审美主义

Miriam Doh, Aditya Gulati, Corinna Canali, Nuria Oliver

机构 * Université Libre de Bruxelles(布鲁塞尔自由大学) Weizenbaum Institute(魏泽曼研究所) ELLIS Alicante(阿利坎特ELLIS)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文揭示了生成式AI在文本到图像生成和性别分类中系统性地将面部吸引力与积极属性关联,导致性别偏见和审美歧视。

Comments 22 pages, 15 figures; v2 - fix typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13418 2026-02-03 cs.CV 88%

Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation

强化学习遇见掩码生成模型:Mask-GRPO用于文本到图像生成

Yifu Luo, Xinhao Hu, Keyu Fan, Haoyuan Sun, Zeyu Chen, Bo Xia, Tiantian Zhang, Yongzhe Chang, Xueqian Wang

机构 * Tsinghua University(清华大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出Mask-GRPO,通过重新定义转移概率和多步骤决策问题,改进文本到图像生成模型,实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08396 2026-02-03 cs.CV 88%

CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation

CoDi: 一致主体和多姿态文本到图像生成

Zhanxin Gao, Beier Zhu, Liang Yao, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Vipshop

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 CoDi通过两阶段策略实现文本到图像生成中主体一致性和姿态多样性的平衡,提升视觉表现和性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01370 2026-02-03 cs.CV 88%

PointT2I: LLM-based text-to-image generation via keypoints

PointT2I: 通过关键点生成基于大语言模型的文本到图像生成

Taekyung Lee, Donggyu Lee, Myungjoo Kang

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能跨学科项目,首尔国立大学) Department of Mathematical Sciences, Seoul National University(数学科学系,首尔国立大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 PointT2I通过大语言模型生成关键点并指导图像生成,无需微调即可实现基于文本提示的准确姿态对齐图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16208 2026-01-23 cs.CV 88%

Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

通过表征自编码器扩展文本到图像扩散变换器

Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, Saining Xie

机构 * New York University(纽约大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。

Comments website: https://rae-dit.github.io/scale-rae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14741 2026-01-22 cs.CV 88%

Enhancing Text-to-Image Generation via End-Edge Collaborative Hybrid Super-Resolution

通过端边协作混合超分辨率增强文本到图像生成

Chongbin Yi, Yuxin Liang, Ziqi Zhou, Peng Yang

机构 * School of Electronic Information and Communications(电子信息与通讯学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出端边协作混合超分辨率框架,通过结合扩散模型和轻量级模型提升文本到图像生成的分辨率与效率,实验显示延迟降低33%且图像质量保持竞争力。

Comments Accpeted by ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14602 2026-01-22 cs.CV 88%

3D Space as a Scratchpad for Editable Text-to-Image Generation

3D空间作为可编辑的文本到图像生成的草稿纸

Oindrila Saha, Vojtech Krs, Radomir Mech, Subhransu Maji, Matheus Gadelha, Kevin Blackburn-Matzen

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于3D空间推理的文本到图像生成方法,通过可编辑的3D网格实现空间一致性,提升图像生成的精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20362 2026-01-22 cs.CV 88%

CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation

CRAFT:连续推理与代理反馈调优用于多模态文本到图像生成

V. Kovalev, A. Kuvshinov, A. Buzovkin, D. Pokidov, D. Timonin

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 CRAFT通过显式推理和反馈调优提升多模态生成模型的可靠性,实现可控且高效的文本到图像生成。

Comments 37 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13745 2026-01-21 cs.CV cs.AI 88%

ESPLoRA: Enhanced Spatial Precision with Low-Rank Adaption in Text-to-Image Diffusion Models for High-Definition Synthesis

ESPLoRA: 基于低秩适应的文本到图像扩散模型中增强空间精度以实现高清晰度合成

Andrea Rigo, Luca Stornaiuolo, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM Watson人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯撒基金会)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ESPLoRA通过低秩适应提升文本到图像扩散模型的空间一致性,利用改进的评估指标和TORE算法优化生成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13866 2026-01-21 cs.CV 88%

SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation

SAGA:学习信号对齐的分布以提高文本到图像生成

Paul Grimal, Michaël Soumm, Hervé Le Borgne, Olivier Ferret, Akihiro Sugimoto

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Télécom Paris(巴黎电信学院) National Institute of Informatics, Japan(日本信息处理研究所)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 SAGA 通过学习信号对齐的分布,提高文本到图像生成的准确性与控制性,支持多种条件模式并优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12198 2026-01-19 cs.CV 88%

ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models

ViSTA: 基于多模态适配器的文本到图像扩散模型用于视觉叙事

Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal

机构 * Department of Computer Science, Georgetown University(计算机科学系,乔治城大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ViSTA通过多模态历史适配器提升文本到图像扩散模型在视觉叙事中的生成一致性与文本对齐能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10061 2026-01-16 cs.CV cs.AI 88%

CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation

CoF-T2I: 视频模型作为纯视觉推理器用于文本到图像生成

Chengzhuo Tong, Mingkun Chang, Shenglong Zhang, Yuran Wang, Cheng Liang, Zhizheng Zhao, Ruichuan An, Bohan Zeng, Yang Shi, Yifan Dai, Ziming Zhao, Guanbin Li, Pengfei Wan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 CoF-T2I通过引入链式帧推理提升文本到图像生成的质量,通过逐步视觉细化和显式推理步骤实现高质量图像生成。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12805 2026-01-16 cs.CV 88%

AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation

AITTI: 学习自适应包容性令牌以生成文本到图像

Xinyu Hou, Xiaoming Li, Chen Change Loy

机构 * Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 AITTI通过学习自适应包容性令牌,有效缓解文本到图像生成中的刻板印象偏见,无需显式属性指定或先验知识。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06135 2026-01-15 cs.CL cs.CV 88%

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

Prompting4Debugging: 通过寻找问题性提示对文本到图像扩散模型进行红队测试

Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(国家阳明交通大学计算机科学系) IBM Research, NY 10598, USA(IBM研究院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 Prompting4Debugging通过寻找问题性提示揭示文本到图像扩散模型的安全漏洞,表明现有安全机制存在重大缺陷。

Comments ICML 2024 main conference paper. The source code is available at https://github.com/zhiyichin/P4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11520 2026-01-15 cs.CV 88%

LaCon: Late-Constraint Diffusion for Steerable Guided Image Synthesis

LaCon:晚期约束扩散用于可操控引导图像合成

Chang Liu, Rui Li, Kaidong Zhang, Xin Luo, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 LaCon通过在预训练扩散模型中整合多种条件,实现灵活可控的图像合成,提升了扩散模型的泛化能力和效率。

Comments GitHub repo: https://github.com/AlonzoLeeeooo/LCDG

详情

展开后加载摘要…

URL PDF HTML 收藏