arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86350 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2301.13826 2023-06-01 cs.CV cs.CL cs.GR cs.LG 88%

Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models

Hila Chefer, Yuval Alaluf, Yael Vinker, Lior Wolf, Daniel Cohen-Or

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to SIGGRAPH 2023; Project page available at https://yuval-alaluf.github.io/Attend-and-Excite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.13131 2022-03-25 cs.CV cs.AI cs.CL cs.GR cs.LG 88%

Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors

Oran Gafni, Adam Polyak, Oron Ashual, Shelly Sheynin, Devi Parikh, Yaniv Taigman

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.12141 2021-08-30 cs.CV cs.MM 88%

DAE-GAN: Dynamic Aspect-aware GAN for Text-to-Image Synthesis

Shulan Ruan, Yong Zhang, Kun Zhang, Yanbo Fan, Fan Tang, Qi Liu, Enhong Chen

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV、cs.MM

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.09399 2019-10-22 cs.CV cs.CL cs.GR cs.LG 88%

A Survey and Taxonomy of Adversarial Neural Networks for Text-to-Image Synthesis

Jorge Agnese, Jonathan Herrera, Haicheng Tao, Xingquan Zhu

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV、cs.GR

Comments Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery. 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12914 2024-07-19 cs.CV 88%

An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation

Zhiyu Tan, Mengping Yang, Luozheng Qin, Hao Yang, Ye Qian, Qiang Zhou, Cheng Zhang, Hao Li

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV;diffusion(comments)

Comments To appear in ECCV-2024, Project page: https://llm-conditioned-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24353 2026-07-28 cs.CV 新提交 88%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 88%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16307 2026-07-21 cs.CV 新提交 88%

CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation

CoBind:用于无训练文本到图像生成的阶段感知组合绑定

Kaijie Chen, Ethan Caldwell, Mira Vossen, Julian Hartwell, Serena Whitlock, Adrian Bellamy

机构 * Mind Lab(思维实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散文本到图像模型处理复杂提示失败的问题,提出CoBind框架,先解析提示为组合图,利用多种约束建立布局、绑定属性,去噪时调整引导强度,无需重新训练或注释,实验证明其在多方面有改进且视觉质量有竞争力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14962 2026-07-17 cs.LG cs.AI cs.CV 新提交 88%

Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation

用于文本到图像生成中代表性多样性的多轴最大@K强化学习

Ku Onoda, Paavo Parmas, Hiroki Furuta, Soichiro Nishimori, Yuta Oshima, Shohei Taniguchi, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像生成中样本模式覆盖不足问题,提出多轴最大@K强化学习目标,通过特定信用分配机制改善覆盖,在感知外观公平性评估中提高公平分数,且保持图像质量和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 88%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12506 2026-07-07 cs.CV cs.AI cs.LG 版本更新 88%

Naïve PAINE: Lightweight Text-to-Image Generation Improvement with Prompt Evaluation

朴素PAINE:通过提示评估改进文本到图像生成

Joong Ho Kim, Nicholas Thai, Souhardya Saha Dip, Dong Lao, Keith G. Mills

机构 * LSU ATHENA Lab(LSU ATHENA实验室) LSU Vision Lab(LSU视觉实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出朴素PAINE改进扩散模型生成质量,利用文本到图像偏好基准,从初始噪声和给定提示直接预测图像质量,选择高质量噪声传入扩散模型,提供反馈且轻量,实验表明其在基准测试中优于现有方法。

Comments Code available at https://github.com/LSU-ATHENA/Naive-PAINE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30262 2026-06-30 cs.CV 88%

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

中间文本表示引导的文本到图像生成以增强唯一性对齐

Soyoun Won, Aryan Yazdan Parast, Basim Azam, Jean Honorio, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型在生成唯一性对象时因概念关联偏差导致对齐失败的问题,提出中间文本表示引导扩散方法,无需额外训练即可恢复被抑制的概念,在OAO-AttackBench上VQAScore提升高达19.1个百分点。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15283 2026-06-26 cs.CV 版本更新 88%

TF-TI2I: Training-Free Text-and-Image-to-Image Generation via Multi-Modal Implicit-Context Learning in Text-to-Image Models

TF-TI2I:通过文本到图像模型中的多模态隐式上下文学习实现无需训练的文本与图像到图像生成

Teng-Fang Hsiao, Bo-Kai Ruan, Yi-Lun Wu, Tzu-Ling Lin, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出无需训练的TF-TI2I方法,利用MM-DiT架构中文本标记隐式学习视觉信息,通过参考上下文掩码和胜者全取模块实现选择性信息共享,并引入FG-TI2I基准,在复杂图像生成任务中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24849 2026-06-24 cs.CV cs.AI 新提交 88%

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链

Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Ant Group(蚂蚁集团) The University of Hong Kong(香港大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出隐式视觉思维链(IV-CoT)框架,通过结构到语义的级联分解和训练时草图监督,在不增加推理开销的情况下提升文本到图像生成的结构感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10492 2026-06-10 cs.CV 新提交 88%

PathRelax: Parallel-Path Relaxed Speculative Jacobi Decoding for Accelerating Auto-Regressive Text-to-Image Generation

PathRelax: 并行路径松弛推测雅可比解码加速自回归文本到图像生成

Haodong Lei, Hongsong Wang, Bingxuan Dai, Pan Zhou

机构 * College of Software Engineering, Southeast University(东南大学软件工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对自回归文本到图像模型因长序列导致推理慢的问题,提出并行路径交叉松弛推测雅可比解码框架,通过多序列草稿树结构扩展搜索空间并利用跨路径语义相似性提高接受率,实现3.95-4.18倍加速。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03243 2026-06-03 cs.CV 88%

MemoGen: Can Past Experience Improve Future Text-to-Image Generation?

MemoGen:过去的经验能否改善未来的文本到图像生成?

Wenshuo Chen, Kuimou Yu, Bowen Tian, Jianfei Song, Shaofeng Liang, Haozhe Jia, Kan Cheng, Haosen Li, Kaishen Yuan, Lei Wang, Jiemin Wu, Songning Lai, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Scholarly, Guangzhou Ziyan Technology Co., Ltd.(学者,广州智源科技有限公司) LimX Dynamics Technology Co., Ltd.(LimX动力科技有限公司) Shandong University(山东大学) Data61/CSIRO Griffith University(Data61/CSIRO格里菲斯大学) Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院(JITRI))

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出MemoGen框架,通过代理进化层和可重用经验记忆,在不更新生成器的情况下,利用过去经验改进文本到图像生成,在知识密集和推理基准上超越专有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17200 2026-05-29 cs.CV 88%

GASS: Geometry-Aware Spherical Sampling for Disentangled Diversity Enhancement in Text-to-Image Generation

GASS: 几何感知球面采样用于文本到图像生成中解耦多样性增强

Ye Zhu, Kaleb S. Newman, Johannes F. Lutzeyer, Adriana Romero-Soriano, Michal Drozdzal, Olga Russakovsky

机构 * Laboratoire d'Informatique (LIX), CNRS, École Polytechnique, IPP, France(信息实验室(LIX),法国国家科学研究中心,巴黎高等技术学院,IPP,法国) Department of Computer Science, Princeton University, USA(计算机科学系,普林斯顿大学,美国) FAIR at Meta - Montreal, Canada(Meta FAIR - 加拿大蒙特利尔) McGill University, Canada(麦吉尔大学,加拿大) Mila, Quebec AI Institute, Canada(魁北克人工智能研究所,加拿大) Canada CIFAR AI chair(加拿大CIFAR人工智能主席)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出几何感知球面采样(GASS),通过正交分解CLIP嵌入中的提示相关与无关变异方向,沿两轴扩展投影分布以引导采样,在保持图像保真度和语义对齐的同时增强生成多样性。

Comments ICML 2026 Camera-ready. Code available at https://github.com/L-YeZhu/GASS_T2I

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01122 2026-05-26 cs.CV 88%

ACCORD: Alleviating Concept Coupling through Dependence Regularization for Text-to-Image Diffusion Personalization

ACCORD: 通过依赖正则化缓解文本到图像扩散个性化中的概念耦合

Shizhan Liu, Hao Zheng, Hang Yu, Jianguo Li

机构 * Ant Group(蚂蚁集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV

AI总结 提出两种即插即用损失函数(去噪解耦损失和先验解耦损失)直接最小化两种依赖差异,以缓解概念耦合问题,实现文本控制与个性化保真度的更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21195 2026-05-21 cs.CV 88%

RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution

RankE: 用于离散文本到图像生成的端到端后训练方法 with Decoder Co-Evolution

Siyong Jian, Siyuan Li, Luyuan Zhang, Zedong Wang, Xin Jin, Ying Li, Cheng Tan, Huan Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出RankE,一种端到端的后训练框架,通过解码器与策略的协同进化,解决离散自回归文本到图像生成中策略优化导致的潜在协变量偏移问题,同时提升图像质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00918 2026-05-12 cs.CV cs.AI 88%

Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

通过内在自信心奖励改进文本到图像生成

Seungwook Kim, Minsu Cho

机构 * POSTECH(POSTECH大学) RLWRLD(RLWRLD实验室) GenGenAI(GenGenAI研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出SOLACE框架,通过模型自身输出的重建误差生成自信心信号,用于强化学习,提升生成内容的组成、文本渲染和文本图像对齐能力。

Comments 22 pages, accepted to CVPR 2026. Project page https://wookiekim.github.io/SOLACE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25314 2026-04-29 cs.CV 88%

Golden RPG: Confidence-Adaptive Region-Aware Noise for Compositional Text-to-Image Generation

黄金RPG:置信度自适应的区域感知噪声用于组合文本到图像生成

Hao Li

机构 * Department of Electrical and Computer Engineering, University of Arizona(亚利桑那大学电气与计算机工程系)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出Golden RPG,通过区域感知噪声预测和置信度自适应融合提升多区域文本到图像生成的区域一致性,优于现有基线方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22302 2026-04-27 cs.CV 88%

Knowledge Visualization: A Benchmark and Method for Knowledge-Intensive Text-to-Image Generation

知识可视化:一个用于知识密集型文本到图像生成的基准和方法

Ran Zhao, Sheng Jin, Size Wu, Kang Liao, Zerui Gong, Zujin Guo, Yang Xiao, Wei Li

机构 * Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出KVBench基准,评估知识密集型文本到图像生成的可靠性,揭示现有模型在逻辑推理和符号精度上的不足,并提出KE-Check框架提升科学准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04713 2026-04-22 cs.HC cs.AI cs.CV 88%

Adaptive Prompt Elicitation for Text-to-Image Generation

自适应提示引导用于文本到图像生成

Xinyi Wen, Lena Hegemann, Xiaofu Jin, Shuai Ma, Antti Oulasvirta

机构 * Aalto University \& University of Helsinki \& ELLIS Institute Finland Helsinki Finland Aalto University Helsinki Finland Aalto University \& ELLIS Institute Finland Helsinki Finland Aalto University \& University of Helsinki \& ELLIS Institute Finland Aalto University Aalto University \& ELLIS Institute Finland

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出自适应提示引导技术,通过交互式意图推断框架提升文本到图像生成与用户意图的对齐效率,实验表明其在准确性和效率上均优于现有方法。

Comments 25 pages, 14 figures, ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15972 2026-04-20 cs.CV cs.AI 88%

When Cultures Meet: Multicultural Text-to-Image Generation

当文化相遇:多文化文本到图像生成

Parth Bhalerao, Mounika Yalamarty, Brian Trinh, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12968 2026-04-14 cs.CV 88%

GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

GrOCE:基于图的在线概念擦除用于文本到图像扩散模型

Ning Han, Zhenyu Ge, Feng Han, Yuhua Sun, Chengqing Li, Jingjing Chen

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 GrOCE提出一种无需训练的框架,通过动态语义图和适应性聚类识别实现精准的在线概念擦除,提升文本到图像扩散模型的语义准确性和稳定性。

Comments Accepted to CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03941 2026-04-07 cs.CV 88%

SafeCtrl: Region-Aware Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress

SafeCtrl: 通过检测-然后抑制方法实现区域感知的安全控制

Lingyun Zhang, Yu Xie, Zhongli Fang, Yu Liu, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 SafeCtrl通过检测-然后抑制方法实现区域感知的安全控制,精准定位风险区域并局部抑制有害内容,提升安全性与生成质量。

Comments 6 pages, 5 figures, accepted to 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01399 2026-04-02 cs.CV 88%

Resolving the Identity Crisis in Text-to-Image Generation

缓解文本到图像生成中的身份危机

Shubhankar Borse, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出DisCo框架,通过强化学习优化图像内和跨样本的身份多样性,解决多人类生成中的身份重复和计数错误问题,无需真实数据,在DiverseHumans数据集上取得高准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22041 2026-03-31 cs.CV 88%

DTVI: Dual-Stage Textual and Visual Intervention for Safe Text-to-Image Generation

DTVI:双阶段文本和视觉干预以实现安全的文本到图像生成

Binhong Tan, Zhaoxin Wang, Handing Wang

机构 * Xidian University(西安电子科技大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出DTVI双阶段防御框架,通过全提示嵌入层面的类别感知干预和视觉生成阶段的抑制,有效防御生成不安全内容,实验显示在多个有害类别上达到94.43%的防御成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25994 2026-03-30 cs.CV cs.CR 88%

Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models

邻域感知的局部概念擦除在文本到图像扩散模型中

Zhuan Shi, Alireza Dehghanpour Farashah, Rik de Vries, Golnoosh Farnadi

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,用于在移除目标概念的同时保护邻域概念。通过三个阶段处理:谱加权嵌入调节、注意力引导的空间门控和空间门控硬擦除,实现局部概念移除并保持周围概念结构。

Comments Accepted by CVPR 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22989 2026-03-27 cs.CV 88%

MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation

MultiBanana:多参考文本到图像生成的挑战性基准

Yuta Oshima, Daiki Miyake, Kohsei Matsutani, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出MultiBanana基准,用于评估多参考文本到图像生成模型的能力,涵盖参考数量变化、领域不匹配、尺度不匹配、罕见概念和多语言参考等挑战,分析不同模型的性能与不足。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏