arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2305.11588 2024-02-01 cs.CV cs.GR 79%

Text2NeRF: Text-Driven 3D Scene Generation with Neural Radiance Fields

Jingbo Zhang, Xiaoyu Li, Ziyu Wan, Can Wang, Jing Liao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV、cs.GR

Comments Accepted by TVCG; Homepage: https://eckertzhang.github.io/Text2NeRF.github.io/ Code:https://github.com/eckertzhang/Text2NeRF

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03027 2023-02-07 cs.CV cs.GR cs.LG 79%

Zero-shot Image-to-Image Translation

Gaurav Parmar, Krishna Kumar Singh, Richard Zhang, Yijun Li, Jingwan Lu, Jun-Yan Zhu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments website: https://pix2pixzero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07301 2022-05-17 cs.GR cs.CV cs.SD eess.AS 79%

Conditional Vector Graphics Generation for Music Cover Images

Valeria Efimova, Ivan Jarsky, Ilya Bizyaev, Andrey Filchenkov

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09614 2025-12-30 cs.CV cs.CL 78%

RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance

RAVEL:通过图驱动的关系引导进行罕见概念生成与编辑

Kavana Venkatesh, Yusuf Dalva, Ismini Lourentzou, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) UIUC(伊利诺伊大学香槟分校)

专题命中 文生图 :diffusion(abstract,comments);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 RAVEL通过图驱动的关系引导方法,提升罕见概念生成与编辑的可控性和可解释性,适用于长尾领域。

Comments Project Page: https://ravel-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00973 2026-08-04 cs.CL 新提交 78%

Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

关注差距:基于文本到图像系统中过滤器-生成器差异的零查询越狱攻击

Wanguang Li, Zhaoxin Wang, Handing Wang

专题命中 文生图 :text-to-image(title,abstract)

AI总结 该研究针对文本到图像系统的零查询越狱问题,提出基于过滤器-生成器差异的框架,通过筛选与集成进化搜索提升攻击成功率,在六个黑盒管线及商业服务上效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26566 2026-07-30 cs.DC cs.AI 新提交 78%

ServerlessT2I: Efficient Text-to-Image Workflow Serving on a Serverless Platform

ServerlessT2I:在无服务器平台上实现高效的文生图工作流服务

Xiaoxiao Jiang, Suyi Li, Sheng Yao, Tianyu Feng, Lingyun Yang, Dapeng Nie, Haoran Yang, Wei Wang

专题命中 文生图 :text-to-image(title,abstract)

AI总结 ServerlessT2I是将T2I工作流分解为独立模型函数的无服务器系统,通过优化调度与内存利用,在相同GPU预算下提升请求率2倍,固定请求率下节省GPU资源达3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18724 2026-07-22 cs.AI 新提交 78%

One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization

一劳永逸?用于文本到图像提示优化的类型感知修复分配

Haoyue Liu, Xiaoyu Ma, Ye Chen, Shuguang Cui, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) XJTU-POLIMI Joint School, Xi’an Jiaotong University(西安交通大学-米兰理工大学联合学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究文本到图像提示优化问题,提出将语义提示优化制定为原子修复分配的方法,在无需训练的TARA框架中实例化,实验表明该方法在多个基准生成器单元中语义准确性最佳,且运行快、图像质量好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07827 2026-07-10 cs.CR 新提交 78%

Open Models, Open Risks: Measuring Unsafe Generation in Text-to-Image Models In the Wild

开放模型,开放风险:衡量实际应用中的文本到图像模型的不安全生成

Peilin Han, Yang Liu, Yilong Yang, Jingchun Zhang, Teng Li, Jianfeng Ma, Zhuo Ma

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究实际应用中的文本到图像模型的不安全生成问题,通过越狱视角进行大规模实证研究。引入高级ASR改进指标,评估200多个模型,发现安全退化不普遍不均匀,识别出高风险模型并追溯其发布背景,向Hugging Face报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21498 2026-06-23 cs.AI cs.LG 新提交 78%

Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training

平衡GRPO自回归文本到图像后训练中的性能与多样性

Yuanhao Chiang, Hongbo Duan, Chunru Yang, Jiahua Pei, Yi Liu, Xueqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 针对自回归文本到图像生成中人类偏好对齐问题,提出统一f-散度框架,理论分析不同散度对策略优化的影响,实验证明JS散度在性能与多样性间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09151 2026-06-09 cs.CR 新提交 78%

Customization under Fire: Plugin Poisoning in Text-to-Image Ecosystem

战火中的定制化:文本到图像生态系统中的插件投毒

Jiahao Chen, Xing He, Yong Yang, Xinfeng Li, Chunyi Zhou, Junhao Li, Zhe Ma, Tianyu Du, Shouling Ji

专题命中 文生图 :text-to-image(title,abstract)

AI总结 针对文本到图像生态系统中LoRA插件的供应链风险,提出PoisonLoRA方法,实现概念劫持和任务注入两种攻击,在多个数据集上达到近100%攻击成功率且难以被检测。

Comments Accepted to ACM CCS'26 Cycle 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01803 2026-06-02 cs.AI 78%

OctoT2I: A Self-Evolving Agentic Text-to-Image Router

OctoT2I:一种自我进化的智能文本到图像路由系统

Xu Jiang, Bin Chen, Gehui Li, Yule Duan, Ronggang Wang, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸媒体技术重点实验室,北京大学深圳研究生院)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出OctoT2I框架,通过自进化机制构建知识库并采用状态化多轮路由策略,联合优化生成质量与推理效率,在GenEval上达到0.96性能,同时实现90.3%推理加速和56.6%能效提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00039 2026-06-02 cs.CY cs.AI cs.HC 78%

Beyond Categories of Caste: Examining Caste Bias and Morality in Text-to-Image AI Models

超越种姓类别:审视文本到图像AI模型中的种姓偏见与道德

Divyanshu Kumar Singh, Dipto Das, Deepika Rama Subramanian, Koustuv Saha, Stephen Voida, Bryan Semaan

机构 * University of Colorado Boulder(科罗拉多大学波得尔分校) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 通过算法审计与批判性话语分析,揭示文本到图像模型如何超越上下种姓二元对立而延续种姓偏见,并提出反种姓方法应对AI系统中的公平问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-06-01 cs.CR 78%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18979 2026-05-26 cs.LG 78%

Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters

动态优化与安全指示注入:针对多模态安全过滤器的文本到图像模型越狱方法

Zixuan Chen, Hao Lin, Ke Xu, Xinghao Jiang, Tanfeng Sun

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出OptJail框架,通过动态提示优化与自适应安全指示注入,绕过文本和图像过滤器,实现高成功率越狱,并揭示多模态防御的系统性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22645 2026-05-22 cs.AI 78%

AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

AtelierEval: 人类与LLM作为文本到图像提示器的代理评估

Hanjun Luo, Zhimu Huang, Sylvia Chung, Yiran Wang, Yingbin Jin, Jialin Li, Jiang Li, Xinfeng Li, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19190 2026-05-20 cs.CY cs.AI cs.HC 78%

Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South

Going PLACES: 参与式本地化红队测试用于全球南方的文本到图像安全

Charvi Rastogi, Mukul Bhutani, Minsuk Kahng, Shamsuddeen Hassan Muhammad, Evgeniia Razumovskaia, Priyanka Suresh, Ibrahim Said Ahmad, Charu Kalia, Yaaseen Mahomed, Madhurima Maji, Minjae Lee, Alicia Parrish, Jessica Quaye, Vijay Janapa Reddi, Aishwarya Verma, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) Yonsei University(延世大学) Imperial College(帝国理工学院) University of Wisconsin–Stevens Point(威斯康星州立大学斯普林特分校) Google Research(谷歌研究) Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出PLACES数据集,通过在非洲和亚洲的本地社区进行参与式红队测试,收集了26000多个文本到图像模型失败案例,揭示了全球南方在文化和社会规范方面的独特对抗模式和安全框架的结构性缺失。

Comments Published at ACM Conference on FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07414 2026-05-11 cs.MA cs.AI cs.CR 78%

OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

OrchJail:通过协调引导的模糊测试对工具调用文本到图像代理进行劫持

Jianming Chen, Yawen Wang, Junjie Wang, Zhe Liu, Qing Wang, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences, Beijing, China Science \& Technology on Integrated Information System Laboratory, Beijing, China State Key Laboratory of Complex System Modeling University of Chinese Academy of Sciences, Beijing, China

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究提出OrchJail框架,通过协调引导的模糊测试方法提升对工具调用文本到图像代理的劫持效果,实现更高的攻击成功率和图像质量,同时降低查询成本。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05707 2026-04-27 cs.CR 78%

Evaluating Concept Filtering Defenses against Child Sexual Abuse Material Generation by Text-to-Image Models

评估文本到图像模型中概念过滤防御对生成儿童性虐待材料的效力

Ana-Maria Cretu, Klim Kireev, Amro Abdalla, Wisdom Obinna, Raphael Meier, Sarah Adel Bargal, Elissa M. Redmiles, Carmela Troncoso

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文评估了通过过滤训练数据中的儿童图像来防止文本到图像模型生成儿童性虐待材料的有效性,发现现有检测方法无法完全去除儿童图像,且即使过滤后仍可通过少量额外查询生成儿童图像。

Comments Extended version of the paper with the name published in the Proceedings of the 47th IEEE Symposium on Security & Privacy (IEEE S&P 2026). Please cite accordingly

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 78%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09867 2026-03-30 cs.HC cs.AI 78%

DesignWeaver: Dimensional Scaffolding for Text-to-Image Product Design

DesignWeaver:基于维度的文本到图像产品设计 scaffolding

Sirui Tao, Ivan Liang, Cindy Peng, Zhiqing Wang, Srishti Palani, Steven P. Dow

机构 * UC San Diego(加州大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) Tableau Research

专题命中 文生图 :text-to-image(title,abstract)

AI总结 DesignWeaver 通过从生成图像中提取关键产品设计维度,帮助新手生成更专业的提示,从而提升产品设计的多样性和创新性。

Comments 26 pages, 22 figures, CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19703 2026-03-17 cs.HC 78%

Interactive Discovery and Exploration of Visual Bias in Generative Text-to-Image Models

交互式发现和探索生成文本到图像模型中的视觉偏见

Johannes Eschner, Roberto Labadie-Tamayo, Matthias Zeppelzauer, Manuela Waldner

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出ViBEx工具,通过交互式界面和零样本偏见探测,帮助发现生成文本到图像模型中的视觉偏见,通过案例研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05742 2026-02-04 cs.HC 78%

Vipera: Blending Visual and LLM-Driven Guidance for Systematic Auditing of Text-to-Image Generative AI

Vipera:融合视觉与LLM驱动的指导以系统性审计文本到图像生成AI

Yanwei Huang, Wesley Hanwen Deng, Sijia Xiao, Motahhare Eslami, Jason I. Hong, Arpit Narechania, Adam Perer

专题命中 文生图 :text-to-image(title,abstract)

AI总结 Vipera通过融合视觉与LLM驱动的指导,为文本到图像生成AI提供系统性审计方法,提升审计效率与准确性。

Comments 17 pages, 8 figures; Accepted by CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07141 2026-01-13 cs.CR 78%

MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models

MacPrompt:基于马卡罗尼的文本到图像模型对抗攻击

Xi Ye, Yiwen Liu, Lina Wang, Run Wang, Geying Yang, Yufei Hou, Jiayi Yu

专题命中 文生图 :text-to-image(title,abstract)

AI总结 MacPrompt通过跨语言字符级重组有害术语,实现对文本到图像模型的安全机制的高效对抗,突破现有防御体系。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18123 2025-12-10 cs.CR cs.CL 78%

AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models

AEIOU:一种针对文本到图像模型中不适宜提示的统一防御框架

Yiming Wang, Jiahao Chen, Qingming Li, Tong Zhang, Rui Zeng, Xing Yang, Shouling Ji

专题命中 文生图 :text-to-image(title,abstract)

AI总结 AEIOU提出了一种针对文本到图像模型中不适宜提示的统一防御框架,通过高效提取NSFW特征实现高准确率和效率,有效应对适应性攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10089 2025-11-18 cs.LG cs.AI 78%

T2IBias: Uncovering Societal Bias Encoded in the Latent Space of Text-to-Image Generative Models

Abu Sufian, Cosimo Distante, Marco Leo, Hanan Salam

机构 * National Research Council of Italy - Institute of Applied Sciences

专题命中 文生图 :text-to-image(title,abstract)

Comments This manuscript has been accepted for presentation in the First Interdisciplinary Workshop on Responsible AI for Value Creation. Dec 1, Copenhagen. The final version will be submitted for inclusion in a Springer LNCS Volume. (The paper is 15 pages with 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07741 2025-11-12 cs.CR cs.SE 78%

Provable Repair of Deep Neural Network Defects by Preimage Synthesis and Property Refinement

Jianan Ma, Jingyi Wang, Qi Xuan, Zhen Wang

专题命中 文生图 :image synthesis(title,abstract)

Comments 20 pages, full version of the paper accepted by CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27361 2025-11-03 cs.SI cs.CY 78%

Back to the Communities: A Mixed-Methods and Community-Driven Evaluation of Cultural Sensitivity in Text-to-Image Models

Sarah Kiden, Oriane Peter, Gisela Reyes-Cruz, Maira Klyshbekova, Sena Choi, Aislinn Gomez Bergin, Maria Waheed, Damian Eke, Tayyaba Azim, Sarvapali Ramchurn, Sebastian Stein, Elvira Perez Vallejos, Kate Devlin, Joel E Fischer

专题命中 文生图 :text-to-image(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12254 2025-10-15 cs.LG 78%

FedMMKT:Co-Enhancing a Server Text-to-Image Model and Client Task Models in Multi-Modal Federated Learning

Ningxin He, Yang Liu, Wei Sun, Xiaozhou Ye, Ye Ouyang, Tiegang Gao, Zehui Zhang

机构 * Institute for AI Industry Research, Tsinghua University(人工智能产业研究院,清华大学) School of Software Engineering, Nankai University(软件工程学院,南开大学) Department of Computing, Hong Kong Polytechnic University(计算机学院,香港理工大学) AsiaInfo Technologies(亚信息科技) China-Austria Belt and Road Joint Laboratory on Artificial Intelligence and Advanced Manufacturing, Hangzhou Dianzi University(人工智能与先进制造联合实验室,杭州电子科技大学)

专题命中 文生图 :text-to-image(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11314 2025-10-14 cs.CL 78%

Template-Based Text-to-Image Alignment for Language Accessibility: A Study on Visualizing Text Simplifications

Belkiss Souayed, Sarah Ebling, Yingqiang Gao

机构 * University of Zurich(苏黎世大学)

专题命中 文生图 :text-to-image(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06525 2025-10-09 cs.LG cs.CR 78%

Text-to-Image Models Leave Identifiable Signatures: Implications for Leaderboard Security

Ali Naseh, Anshuman Suri, Yuefeng Peng, Harsh Chaudhari, Alina Oprea, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Northeastern University(东北大学)

专题命中 文生图 :text-to-image(title,abstract)

Comments Accepted at Lock-LLM Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏