arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86504 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 84%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16516 2026-04-21 cs.CV cs.LG cs.MM 84%

Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies

在文本到图像模型中实现公平性:对偏见、公平性审计及缓解策略的综述

Megan Smith, Venkatesh Thirugnana Sambandham, Florian Richter, Laura Crompton, Matthias Uhl, Torsten Schön

机构 * AImotion Bavaria, Technische Hochschule Ingolstadt(AImotion巴伐利亚、因戈尔施塔特技术大学) School of Transformation and Sustainability, Catholic University of Eichstätt-Ingolstadt(转型与可持续性学院,埃施塔特-因戈尔施塔特天主教大学) Chair of Economic and Social Ethics, University of Hohenheim(经济与社会伦理系,霍亨海姆大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了文本到图像模型中的公平性研究,分析了偏见类型和公平性概念的分类,指出现有研究在目标公平与阈值公平之间的差距,并提出新的公平性操作框架。

Comments ICLR 2026 Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA) Workshop, reviews can be found at: https://openreview.net/forum?id=8DOkyBGWwP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29620 2026-04-02 cs.CV cs.MM 84%

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01824 2025-08-28 cs.CV cs.AI cs.LG cs.MM 84%

X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models

Zeyi Sun, Ziyang Chu, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(创新香港科技促进会) MThreads AI

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments code: https://github.com/SunzeY/X-Prompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09948 2025-05-02 cs.CV cs.AI cs.MM 84%

Omni-Dish: Photorealistic and Faithful Image Generation and Editing for Arbitrary Chinese Dishes

Huijie Liu, Bingcan Wang, Jie Hu, Xiaoming Wei, Guoliang Kang

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments 10 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18642 2025-02-03 cs.CV cs.AI cs.GR cs.HC cs.LG 84%

DebiasPI: Inference-time Debiasing by Prompt Iteration of a Text-to-Image Generative Model

Sarah Bonna, Yu-Cheng Huang, Ekaterina Novozhilova, Sejin Paik, Zhengyang Shan, Michelle Yilin Feng, Ge Gao, Yonish Tayal, Rushil Kulkarni, Jialin Yu, Nupur Divekar, Deepti Ghadiyaram, Derry Wijaya, Margrit Betke

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

Comments This work was presented at The European Conference on Computer Vision (ECCV) 2024 Workshop "Fairness and ethics towards transparent AI: facing the chalLEnge through model Debiasing" (FAILED), Milano, Italy, on September 29, 2024, https://failed-workshop-eccv-2024.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14867 2024-06-04 cs.CV cs.AI cs.CL cs.MM 84%

VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation

Max Ku, Dongfu Jiang, Cong Wei, Xiang Yue, Wenhu Chen

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACL2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03620 2024-04-05 cs.CV cs.GR 84%

LCM-Lookahead for Encoder-based Text-to-Image Personalization

Rinon Gal, Or Lichter, Elad Richardson, Or Patashnik, Amit H. Bermano, Gal Chechik, Daniel Cohen-Or

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page at https://lcm-lookahead.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14859 2024-03-12 cs.CV cs.AI cs.GR cs.LG 84%

Navigating Text-To-Image Customization: From LyCORIS Fine-Tuning to Model Evaluation

Shih-Ying Yeh, Yu-Guan Hsieh, Zhidong Gao, Bernard B W Yang, Giyeong Oh, Yanmin Gong

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments In International Conference on Learning Representations 12 (ICLR 2024) [79 pages, 54 figures, 7 tables]

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17624 2024-02-28 cs.CV cs.GR 84%

CustomSketching: Sketch Concept Extraction for Sketch-based Image Synthesis and Editing

Chufeng Xiao, Hongbo Fu

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04608 2023-09-12 cs.CV cs.MM 84%

Style Generation: Image Synthesis based on Coarsely Matched Texts

Mengyao Cui, Zhe Zhu, Shao-Ping Lu, Yulu Yang

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06925 2023-07-14 cs.CV cs.GR cs.LG 84%

Domain-Agnostic Tuning-Encoder for Fast Personalization of Text-To-Image Models

Moab Arar, Rinon Gal, Yuval Atzmon, Gal Chechik, Daniel Cohen-Or, Ariel Shamir, Amit H. Bermano

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

Comments Project page at https://datencoder.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06638 2023-06-13 cs.CV cs.AI cs.GR cs.LG 84%

Face0: Instantaneously Conditioning a Text-to-Image Model on a Face

Dani Valevski, Danny Wasserman, Yossi Matias, Yaniv Leviathan

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12228 2023-03-07 cs.CV cs.GR cs.LG 84%

Encoder-based Domain Tuning for Fast Personalization of Text-to-Image Models

Rinon Gal, Moab Arar, Yuval Atzmon, Amit H. Bermano, Gal Chechik, Daniel Cohen-Or

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page at https://tuning-encoder.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08092 2022-08-18 cs.CV cs.AI cs.LG cs.MM 84%

Paint2Pix: Interactive Painting based Progressive Image Synthesis and Editing

Jaskirat Singh, Liang Zheng, Cameron Smith, Jose Echevarria

专题命中 文生图 :image synthesis(title,abstract);image editing(abstract);分类 cs.CV、cs.MM

Comments ECCV 2022

Journal ref ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04240 2021-10-04 cs.CV cs.GR cs.LG 84%

Deep Image Synthesis from Intuitive User Input: A Review and Perspectives

Yuan Xue, Yuan-Chen Guo, Han Zhang, Tao Xu, Song-Hai Zhang, Xiaolei Huang

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

Comments 26 pages, 7 figures, 1 table

Journal ref Computational Visual Media 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.02725 2018-12-07 cs.CV cs.GR stat.ML 84%

Visual Object Networks: Image Generation with Disentangled 3D Representation

Jun-Yan Zhu, Zhoutong Zhang, Chengkai Zhang, Jiajun Wu, Antonio Torralba, Joshua B. Tenenbaum, William T. Freeman

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments NeurIPS 2018. Code: https://github.com/junyanz/VON Website: http://von.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06666 2024-10-18 cs.CV cs.AI cs.CL cs.CR 84%

SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models

Xinfeng Li, Yuchen Yang, Jiangyi Deng, Chen Yan, Yanjiao Chen, Xiaoyu Ji, Wenyuan Xu

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ACM CCS 2024. Please cite this paper as "Xinfeng Li, Yuchen Yang, Jiangyi Deng, Chen Yan, Yanjiao Chen, Xiaoyu Ji, Wenyuan Xu. SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models. In Proceedings of ACM Conference on Computer and Communications Security (CCS), 2024."

URL PDF HTML 收藏
2307.08025 2023-07-18 cs.CV 84%

Analysing Gender Bias in Text-to-Image Models using Object Detection

Harvey Mannering

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Github repo can be found at: https://github.com/harveymannering/Text-to-Image-Bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16721 2026-08-18 cs.CV 新提交 83%

GenRouter: Unified Workflow Routing for Agentic Image Generation

GenRouter:面向智能体图像生成的统一工作流路由

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SUSTech(南方科技大学) ZODA CUHK(香港中文大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GenRouter是首个智能体图像生成的统一工作流路由框架,通过需求分析、经验匹配、帕累托过滤实现自适应路由,可大幅降低计算开销与延迟并提升视觉对齐效果。

Comments Code: https://github.com/EnVision-Research/GenRouter

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19196 2026-08-17 cs.CV 版本更新 83%

CoCA: Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning

CoCA:基于强化学习的文本到图像(T2I)扩散模型微调中的免费步骤级奖励

Xinyao Liao, Wei Wei, Xiaoye Qu, Qiyuan He, Angela Yao, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对RL驱动T2I扩散模型微调的奖励稀疏问题,提出CoCA信用分配框架,通过余弦相似度变化分配密集奖励,提升样本效率与泛化性且不损害原最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09529 2026-08-11 cs.CV 新提交 83%

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

面向表达性与忠实性的音频到图像生成:一个统一的多模态数据集与合成框架

Dongxu Ge, Shansong Liu, Cheng Gong, Xiao-Lei Zhang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) China Telecom (TeleAI)(中国电信(电信人工智能研究院)) Northwest Polytechnical University(西北工业大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对音频到图像生成受限于传统数据集的问题,提出A2I-Set数据集与AudioCanvas模型,实现了更优的跨模态对齐与视觉表达性。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 83%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01780 2026-08-04 cs.CV cs.AI 新提交 83%

Investigating Social Bias in Narrative Image Generation

探究叙事图像生成中的社会偏见

Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究将偏见评估框架BBG适配图像生成,对比6种T2I模型在照片、分镜、漫画生成中的偏见表现,发现叙事视觉形式中偏见更易显现,强调需用多样视觉形式评估T2I系统。

Comments Accepted to GenAI4World Workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19946 2026-07-17 cs.CV cs.AI 版本更新 83%

When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators

当漂亮并不有用:调查现代文本到图像模型为何无法作为可靠的训练数据生成器

Krzysztof Adamkiewicz, Brian Bernhard Moser, Stanislav Frolov, Tobias Christian Nauen, Federico Raue, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究发现现代文本到图像模型在生成合成数据时性能下降,揭示其生成的数据分布狭窄且缺乏多样性,挑战了生成现实感进步即意味着数据现实感进步的假设。

Comments Accepted to CVPR26, Project Page: https://bill2462.github.io/When-Pretty-Isn-t-Useful-page/, Code: https://github.com/Bill2462/When-Pretty-Isn-t-Useful-codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06120 2026-07-08 cs.CV 新提交 83%

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

AEGIS:一种针对文本到图像模型中视觉同义词越狱的机制引导防御

Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Pudong Research Institute of Cryptology(上海浦东密码研究所) Engineering Research Center of Cyber Security Auditing and Monitoring, Ministry of Education(教育部网络安全审计与监测工程研究中心)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到图像模型中视觉同义词越狱问题,提出AEGIS防御机制,通过动态追踪不安全语义生成过程,利用稀疏语义注入注意力头,在推理时仅对易受攻击头部应用相似性感知排斥,提升了模型安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00766 2026-07-03 cs.CV 新提交 83%

Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization

解耦引导:文本到图像个性化中的主体与上下文路径分离

Seongmin Kim, Kyucheol Shin, Heesun Jung, Jinseo Kim, Sungyong Baik

机构 * Dept. of Artificial Intelligence, Hanyang University, South Korea(韩国汉阳大学人工智能系) Dept. of Data Science, Hanyang University, South Korea(韩国汉阳大学数据科学系)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出解耦引导(DeGu)框架,通过独立引导流分别处理主体身份和场景上下文,并引入空间混合机制动态融合,以解决个性化生成中保真度与可编辑性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12893 2026-07-01 cs.CV cs.AI cs.LG cs.NE stat.ML 版本更新 83%

Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models

文本到图像模型强化学习后训练的有限差分流优化

David McAllister, Miika Aittala, Tero Karras, Janne Hellsten, Angjoo Kanazawa, Timo Aila, Samuli Laine

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 文生图 :text-to-image(title);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。

Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28643 2026-06-30 cs.CV 83%

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

Obliviate: 从自回归图像生成模型中擦除概念

Hossein Shakibania, Jonas Henry Grebe, Tobias Braun, Ege Aktemur, Saleh Aslani, Mehmet Görkem Yiğit, Marcus Rohrbach

机构 * TU Darmstadt, Germany(图宾根大学) Multimodal AI Lab, TU Darmstadt, Germany(多模态人工智能实验室) Zuse School ELIZA(祖斯学院ELIZA) hessian.AI, Germany(海西斯.AI)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Obliviate方法,通过KL散度监督视觉token分布、轨迹级更新和对齐视觉前缀,有效擦除自回归文生图模型中的有害概念,在保持模型效用同时大幅降低不当内容生成。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26907 2026-06-29 cs.CV 新提交 83%

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

Qwen-Image-Agent:弥合真实世界图像生成中的上下文差距

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu

机构 * Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation(Qwen-Image-Agent:弥合现实世界图像生成中的上下文缺口)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Qwen-Image-Agent框架,通过上下文感知规划和上下文接地,整合规划、推理、搜索、记忆和反馈,弥合用户上下文与生成上下文之间的差距,在IA-Bench等基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏