arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86350 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2606.32039 2026-07-01 cs.CV 新提交 85%

GEAR: Guided End-to-End AutoRegression for Image Synthesis

GEAR: 引导式端到端自回归图像合成

Bin Lin, Zheyuan Liu, Chenguo Lin, Sixiang Chen, Yunyang Ge, Yunlong Lin, Jianwei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Li Yuan

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28091 2026-06-26 cs.CV 版本更新 85%

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

Qwen-Image-Bench:从生成到创造——文本到图像评估

Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, Shijun Shen, Jinlin Wang, Fan Zhou, Jianye Kang, Xin Shang, Ziyi He, Wei Wang, Dalin Li, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yuxiang Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, Hongzhu Shi, Yi Wang, Bing Zhao, Hu Wei, Lin Qu, Chenfei Wu

机构 * Alibaba(阿里巴巴)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03715 2026-06-03 cs.CV 85%

Text-to-Image Models Need Less from Text Encoders Than You Think

文生图模型对文本编码器的依赖比你想象的要少

Nurit Spingarn, Noa Cohen, Tamar Rott Shaham, Tomer Michaeli

机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文发现基于扩散Transformer的文生图模型主要依赖文本编码器提供的单词含义和词序信息,而非完整的上下文信息,并通过构建仅含位置标记词袋的嵌入验证了这一观点。

Comments Project webpage: https://nsping13.github.io/contextless-TTI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22276 2026-06-02 cs.LG cs.CV 85%

SurrogateSHAP: Training-Free Contributor Attribution for Text-to-Image (T2I) Models

SurrogateSHAP:文本到图像(T2I)模型的无训练贡献者归因

Mingyu Lu, Soham Gadgil, Chris Lin, Chanwoo Kim, Su-In Lee

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对文本到图像扩散模型中数据贡献者公平估值的高计算成本问题,提出基于预训练模型推理的无重训练框架SurrogateSHAP,利用梯度提升树近似效用函数并解析计算Shapley值,在多个任务上以更低开销超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20808 2026-05-21 cs.CV 85%

Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis

基于超高清图像合成的空间图对齐

Jinjin Zhang, Xiefan Guo, Di Huang

机构 * Beihang University(北航大学)

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出空间图对齐(SGA)方法,通过利用视觉基础模型的表示先验,保留LDMs的生成能力,解决超高清图像合成中生成质量与结构完整性之间的冲突,实现高质量的文本到图像合成。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25074 2026-05-12 cs.CV 85%

Z-Erase: Enabling Concept Erasure in Single-Stream Diffusion Transformers

Z-Erase:在单流扩散变换器中实现概念擦除

Nanxiang Jiang, Zhaoxin Fan, Baisen Wang, Daiheng Gao, Junhang Cheng, Jifeng Guo, Yalan Qin, Yeying Jin, Hongwei Zheng, Faguo Wu, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算北京创新中心) Privacy Computing, School of Artificial Intelligence, Beihang University(隐私计算,北京航空航天大学人工智能学院) University of Science(科学大学) Shanghai University(上海大学) Tencent(腾讯) Beijing Academy of Blockchain(北京区块链研究院)

专题命中 文生图 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Z-Erase,一种专为单流T2I模型设计的概念擦除方法,通过解耦更新和平衡擦除与保留的权衡,解决生成崩溃问题,实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12481 2026-04-15 cs.CV 85%

T2I-BiasBench: A Multi-Metric Framework for Auditing Demographic and Cultural Bias in Text-to-Image Models

T2I-BiasBench:一个用于审计文本到图像模型中人口和文化偏见的多指标框架

Nihal Jaiswal, Siddhartha Arjaria, Gyanendra Chaubey, Ankush Kumar, Aditya Singh, Anchal Chaurasiya

机构 * Department of Information Technology, Rajkiya Engineering College Banda(拉贾基亚工程学院班达信息科技系) School of AI and Data Science, Indian Institute of Technology Jodhpur(印度理工学院乔普拉人工智能与数据科学学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出T2I-BiasBench框架,通过十三个互补指标评估扩散模型中的偏见、元素缺失和文化崩溃,揭示了开源模型在人口和文化偏见方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09923 2026-04-14 cs.AI cs.CV 85%

GLEaN: A Text-to-image Bias Detection Approach for Public Comprehension

GLEaN:一种面向公众理解的文本到图像偏见检测方法

Bochu Ding, Brinnae Bent, Augustus Wendell

机构 * Duke University(杜克大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 GLEaN通过生成图像和面部特征分析,直观展示文本到图像模型的偏见,使公众能快速理解模型对不同身份提示的偏见表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 85%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 文生图 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00483 2026-03-03 cs.CV cs.AI 85%

RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment

RAISE:基于需求的进化精炼用于无训练文本到图像对齐

Liyao Jiang, Ruichen Chen, Chao Gao, Di Niu

机构 * Department of ECE, University of Alberta, Canada(阿尔伯塔大学电子工程系) Huawei Technologies, Canada(华为技术有限公司)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 RAISE是一种无训练、需求驱动的进化框架,通过动态调整生成过程实现高效且通用的文本到图像对齐。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02437 2026-02-23 cs.CV cs.AI 85%

UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing

UniReason 1.0: 一个统一的推理框架,用于世界知识对齐的图像生成与编辑

Dianyi Wang, Chaofan Ma, Feng Han, Size Wu, Wei Song, Yibin Wang, Zhixiong Zhang, Tianhang Wang, Siyuan Wang, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Southern California(美国南加州大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 UniReason 1.0通过统一推理框架整合图像生成与编辑,利用世界知识增强文本推理和视觉优化,提升复杂合成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01382 2026-02-03 cs.CV cs.LG 85%

PromptRL: Prompt Matters in RL for Flow-Based Image Generation

PromptRL: 流基于图像生成中强化学习中提示的重要性

Fu-Yun Wang, Han Zhang, Michael Gharbi, Hongsheng Li, Taesung Park

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Meta Superintelligence Labs, USA(Meta超智能实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 PromptRL通过整合语言模型作为可训练的提示精修代理,提升流基于图像生成中强化学习的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25562 2026-02-02 cs.AI cs.CL cs.CV cs.LG 85%

IRIS: Intrinsic Reward Image Synthesis

IRIS:内在奖励图像合成

Yihang Chen, Yuanhao Ban, Yunqi Hong, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles, USA(计算机科学系,加州大学洛杉矶分校)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 IRIS通过内在奖励提升自回归T2I模型性能,改进图像生成质量并促进细致推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17666 2026-01-27 cs.CV 85%

Training-Free Text-to-Image Compositional Food Generation via Prompt Grafting

无需训练的文本到图像组合食品生成 via 提示嫁接

Xinyue Pan, Yuhao Chen, Fengqing Zhu

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(电气与计算机工程学院,普渡大学) Department of Systems Design Engineering, University of Waterloo(系统设计工程系,滑铁卢大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 无需训练的文本到图像组合食品生成方法通过提示嫁接实现对多食物图像生成的可控分离。

Comments Accepted by CAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00827 2026-01-13 eess.AS cs.AI cs.MM 85%

Speak the Art: A Direct Speech to Image Generation Framework

Speak the Art: 一种直接语音到图像生成框架

Mariam Saeed, Manar Amr, Farida Adel, Nada Hassan, Nour Walid, Eman Mohamed, Mohamed Hussein, Marwan Torki

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.MM

AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01298 2025-12-23 cs.CV cs.AI 85%

Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models

通过统一生成模型中的多模态推理链提升图像生成

Yi Wang, Mushui Liu, Wanggui He, Hanyang Yuan, Longxiang Zhang, Ziwei Huang, Guanghao Zhang, Wenkai Fang, Haoze Jiang, Shengxuming Zhang, Dong She, Jinlong Liu, Weilong Dai, Mingli Song, Hao Jiang, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文通过引入多模态推理链提升统一生成模型的复杂图像生成能力,提出FoXperts架构和MCoT方法,实现更高效的多模态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07829 2025-12-17 cs.CV cs.AI 85%

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

一层就够:适应预训练视觉编码器进行图像生成

Yuan Gao, Chen Chen, Tianrong Chen, Jiatao Gu

机构 * Apple(苹果公司)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FAE通过单层注意力机制将预训练视觉编码器适应到低维潜在空间,实现高效且高质量的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14275 2025-12-15 cs.CV 85%

Free-Lunch Color-Texture Disentanglement for Stylized Image Generation

无需调优的色彩-纹理解耦用于风格化图像生成

Jiang Qin, Senmao Li, Alexandra Gomez-Villa, Shiqi Yang, Yaxing Wang, Kai Wang, Joost van de Weijer

机构 * Harbin Institute of Technology, China(哈尔滨工业大学) VCIP, CS, Nankai University, China(南开大学) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学系) City University of Hong Kong, HK SAR, China(香港城市大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需调优的SADis方法,通过分离颜色-纹理嵌入提升风格化图像生成的精度与定制能力。

Comments Accepted by NeurIPS2025. Code is available at https://deepffff.github.io/sadis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21185 2025-11-27 cs.CV cs.AI 85%

Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation

分块进展:用于自回归图像生成的测试时扩展

Joonhyung Park, Hyeongwon Jang, Joowon Kim, Eunho Yang

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 GridAR通过网格分区逐步生成和布局指定提示重述策略,在有限测试时扩展下提升视觉自回归模型的生成质量与编辑效果。

Comments Project page: https://grid-ar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16862 2025-11-18 cs.CV 85%

Conditional Panoramic Image Generation via Masked Autoregressive Modeling

Chaoyang Wang, Xiangtai Li, Lu Qi, Xiaofan Lin, Jinbin Bai, Qianyu Zhou, Yunhai Tong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Insta360 Research(Insta360研究院) National University of Singapore(新加坡国立大学) The University of Tokyo(东京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11780 2025-11-18 cs.CV cs.AI 85%

Image-POSER: Reflective RL for Multi-Expert Image Generation and Editing

Hossein Mohebbi, Mohammed Abdulrahman, Yanting Miao, Pascal Poupart, Suraj Kothawade

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Google(谷歌)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07744 2025-11-12 cs.CV 85%

VectorSynth: Fine-Grained Satellite Image Synthesis with Structured Semantics

Daniel Cher, Brian Wei, Srikumar Sastry, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21363 2025-10-27 cs.LG cs.CL cs.CV 85%

FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models

Zihao Fu, Ryan Brown, Shun Shao, Kai Rawal, Eoin Delaney, Chris Russell

机构 * The Chinese University of Hong Kong(香港中文大学) University of Oxford(牛津大学) University of Cambridge(剑桥大学) Trinity College Dublin(都柏林大学三一学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20661 2025-10-24 cs.CV 85%

UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset

Chen Zhao, En Ci, Yunzhe Xu, Tiehan Fan, Shanyan Guan, Yanhao Ge, Jian Yang, Ying Tai

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) vivo Mobile Communication Co., Ltd., China(vivo移动通信有限公司)

专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03191 2025-10-06 cs.CV 85%

Product-Quantised Image Representation for High-Quality Image Synthesis

Denis Zavadski, Nikita Philip Tatsch, Carsten Rother

机构 * Heidelberg University(海德堡大学)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26641 2025-10-01 cs.CV 85%

Query-Kontext: An Unified Multimodal Model for Image Generation and Editing

Yuxin Song, Wenkai Dong, Shizun Wang, Qi Zhang, Song Xue, Tao Yuan, Hu Yang, Haocheng Feng, Hang Zhou, Xinyan Xiao, Jingdong Wang

机构 * Baidu VIS(百度视觉) National University of Singapore(新加坡国立大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22793 2025-09-30 cs.CV 85%

DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models

Komal Kumar, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Ivan Laptev, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 13 Figures, 21 pages, accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21956 2025-09-30 cs.CV cs.AI cs.CL cs.LG 85%

Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation

Mengdan Zhu, Senhao Cheng, Guangji Bai, Yifei Zhang, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01812 2025-09-30 cs.CV 85%

Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis

Junyan Ye, Jun He, Weijia Li, Zhutao Lv, Yi Lin, Jinhua Yu, Haote Yang, Conghui He

机构 * Sun Yat-Sen University(中山大学) Shanghai AI Laboratory(上海人工智能实验室) Sensetime Research(商汤科技研究院)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025, 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09680 2025-09-12 cs.CV cs.CL 85%

FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark

Rongyao Fang, Aldrich Yu, Chengqi Duan, Linjiang Huang, Shuai Bai, Yuxuan Cai, Kun Wang, Si Liu, Xihui Liu, Hongsheng Li

机构 * CUHK(香港中文大学) HKU(香港大学) BUAA(北京航空航天大学) Alibaba(阿里巴巴)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Project page: https://flux-reason-6m.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏