arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3480 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG 83%

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04857 2025-12-05 cs.CV 83%

Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens

自回归图像生成只需少量缓存的token

Ziran Qin, Youru Lv, Mingbao Lin, Zeren Zhang, Chanfan Gan, Tieyuan Chen, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten Peking University(北京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 LineAR通过行级缓存压缩技术,在自回归图像生成中实现内存节省和吞吐量提升,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03996 2025-12-04 cs.CV cs.AI 83%

Highly Efficient Test-Time Scaling for T2I Diffusion Models with Text Embedding Perturbation

面向T2I扩散模型的高效测试时缩放方法:文本嵌入扰动

Hang Xu, Linjiang Huang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(信息与通信前沿技术联合实验室,中国科学技术大学) Beihang University(北京航空航天大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出文本嵌入扰动方法,通过结合频率引导的噪声调度与空间噪声扰动,提升T2I扩散模型生成质量与多样性,无需额外计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02161 2025-12-03 cs.CV 83%

FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges

FineGRAIN:通过视觉语言模型法官评估文本到图像模型的故障模式

Kevin David Hayes, Micah Goldblum, Vikash Sehwag, Gowthami Somepalli, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Columbia University(哥伦比亚大学) Sony AI(索尼人工智能)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 FineGRAIN通过视觉语言模型评估文本到图像模型的故障模式,揭示属性保真度和物体表示的系统性错误,强调了针对性基准测试对生成模型可靠性的重要性。

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22119 2025-12-01 cs.CV 83%

PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization

PROMPTMINER: 通过强化学习和模糊优化对文本到图像生成模型进行黑盒提示窃取

Mingzhe Li, Renhao Zhang, Zhiyang Wen, Siqi Pan, Bruno Castro da Silva, Juan Zhai, Shiqing Ma

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 PROMPTMINER通过强化学习和模糊优化实现文本到图像生成模型的黑盒提示窃取,有效恢复图像生成提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17888 2025-11-25 cs.CV 83%

MINDiff: Mask-Integrated Negative Attention for Controlling Overfitting in Text-to-Image Personalization

MINDiff: 集成掩码的负关注用于控制文本到图像个性化中的过拟合

Seulgi Jeong, Jaeil Kim

机构 * Kyungpook National University(庆尚国立大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 MINDiff通过在推理过程中引入负关注机制,有效控制文本到图像个性化中的过拟合问题,无需修改模型架构即可提升文本对齐度和主题保真度。

Comments Accepted at ICCV 2025 Personalization in Generative AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10721 2025-11-17 cs.CV cs.LG 83%

Fast Data Attribution for Text-to-Image Models

Sheng-Yu Wang, Aaron Hertzmann, Alexei A Efros, Richard Zhang, Jun-Yan Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究) UC Berkeley(伯克利大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025 camera ready. Project page: https://peterwang512.github.io/FastGDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10154 2025-11-14 cs.CV cs.AI 83%

GEA: Generation-Enhanced Alignment for Text-to-Image Person Retrieval

Hao Zou, Runqing Zhang, Xue Zhou, Jianxiao Zou

机构 * School of Automation Engineering, University of Electronic Science and Technology of China(自动化工程学院,电子科学与技术大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳高级研究学院,电子科学与技术大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 8pages,3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06724 2025-11-11 cs.CV cs.DC 83%

Argus: Quality-Aware High-Throughput Text-to-Image Inference Serving System

Shubham Agarwal, Subrata Mitra, Saud Iqbal

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at Middleware 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00686 2025-11-04 cs.CV cs.AI 83%

Evolve to Inspire: Novelty Search for Diverse Image Generation

Alex Inch, Passawis Chaiyapattanaporn, Yuchen Zhu, Yuan Lu, Ting-Wen Ko, Davide Paglieri

机构 * University College London(伦敦大学学院) University of Oxford(牛津大学) Tesco Technology(百事科技) Microsoft Research(微软研究院)

专题命中 文生图 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 14 pages, 10 figures, Accepted to Neurips 2025 GenProCC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21478 2025-11-04 cs.CV cs.AI 83%

Policy Optimized Text-to-Image Pipeline Design

Uri Gadot, Rinon Gal, Yftah Ziser, Gal Chechik, Shie Mannor

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16581 2025-10-21 cs.CR cs.CV 83%

Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries

Xinfeng Li, Shengyuan Pang, Jialin Wu, Jiangyi Deng, Huanlong Zhong, Yanjiao Chen, Jie Zhang, Wenyuan Xu

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Electrical Engineering and the Ubiquitous System Security Lab (USSLab), Zhejiang University(浙江大学电子工程学院和无处不在系统安全实验室) ETH Zurich(苏黎世联邦理工学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

Comments 14 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15015 2025-10-20 cs.CV cs.AI cs.CL 83%

DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models

Mor Ventura, Michael Toker, Or Patashnik, Yonatan Belinkov, Roi Reichart

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17965 2025-10-17 cs.CV 83%

AttenCraft: Attention-guided Disentanglement of Multiple Concepts for Text-to-Image Customization

Junjie Shentu, Matthew Watson, Noura Al Moubayed

机构 * Department of Computer Science, Durham University(计算机科学系,达勒姆大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07217 2025-10-09 cs.CV cs.AI 83%

GenPilot: A Multi-Agent System for Test-Time Prompt Optimization in Image Generation

Wen Ye, Zhaocheng Liu, Yuwei Gui, Tingyu Yuan, Yunyue Su, Bowen Fang, Chaoyang Zhao, Qiang Liu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Baichuan Inc.(北川公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所基础模型研究中心) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 30 pages, 21 figures, accepted to EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05593 2025-10-08 cs.CV cs.AI cs.CL 83%

Improving Chain-of-Thought Efficiency for Autoregressive Image Generation

Zeqi Gu, Markos Georgopoulos, Xiaoliang Dai, Marjan Ghazvininejad, Chu Wang, Felix Juefei-Xu, Kunpeng Li, Yujun Shi, Zecheng He, Zijian He, Jiawei Zhou, Abe Davis, Jialiang Wang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Meta FAIR Cornell University(康奈尔大学) Stony Brook University(石溪大学)

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02987 2025-10-06 cs.CV 83%

TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency

Juntong Wang, Huiyu Duan, Jiarui Wang, Ziheng Jia, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所) MoE Key Lab of Artificial Intelligence, AI Institute(人工智能关键实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17098 2025-10-03 cs.CV 83%

DreamOmni: Unified Image Generation and Editing

Bin Xia, Yuechen Zhang, Jingyao Li, Chengyao Wang, Yitong Wang, Xinglong Wu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) ByteDance Inc(字节跳动公司) HKUST(香港科技大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00974 2025-10-02 cs.CV 83%

JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation

Siheng Wan, Zhengtao Yao, Zhengdao Li, Junhao Dong, Yanshu Li, Yikai Li, Linshan Li, Haoyan Xu, Yijiang Li, Zhikang Dong, Huacan Wang, Jifeng Shen

机构 * Jiangsu University(江苏大学) University of Southern California(南加州大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Brown University(布朗大学) UC San Diego(加州大学圣地亚哥分校) Stony Brook University(石溪大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00796 2025-10-02 cs.CV cs.AI 83%

MetaLogic: Robustness Evaluation of Text-to-Image Models via Logically Equivalent Prompts

Yifan Shen, Yangyang Shu, Hye-young Paik, Yulei Sui

机构 * University of New South Wales, Australia(新南威尔士大学,澳大利亚)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments ICFEM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00045 2025-10-02 cs.CV cs.AI 83%

Beyond the Prompt: Gender Bias in Text-to-Image Models, with a Case Study on Hospital Professions

Franck Vandewiele, Remi Synave, Samuel Delepoulle, Remi Cozot

机构 * Laboratoire d’Informatique Signal et Image de la Côte d’Opale (LISIC)(信号与图像实验室(LISIC)) Université du Littoral Côte d’Opale(沿海大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23398 2025-10-01 cs.CV cs.CY 83%

A Large Scale Analysis of Gender Biases in Text-to-Image Generative Models

Leander Girrbach, Stephan Alaniz, Genevieve Smith, Zeynep Akata

机构 * Technical University of Munich, Munich Center for Machine Learning, MDSI(慕尼黑技术大学、慕尼黑机器学习中心、MDSI) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI、巴黎电信学院、巴黎理工学院) Helmholtz Munich(海德堡-慕尼黑研究中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25027 2025-09-30 cs.CV 83%

STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation

Xiaoxiao Ma, Haibo Qiu, Guohui Zhang, Zhixiong Zeng, Siqi Yang, Lin Ma, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Code available at https://github.com/krennic999/STAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23639 2025-09-30 cs.CV cs.AI cs.LG 83%

LightFair: Towards an Efficient Alternative for Fair T2I Diffusion via Debiasing Pre-trained Text Encoders

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Kangli Zi, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18796 2025-09-24 cs.CV 83%

Towards Application Aligned Synthetic Surgical Image Synthesis

Danush Kumar Venkatesh, Stefanie Speidel

机构 * Department of Translational Surgical Oncology, NCT/UCC Dresden(转化外科肿瘤学系) DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden,HZDR, Germany(德累斯顿技术大学医学院) The Centre for Tactile Internet with Human-in-the-Loop (CeTI), TUD Dresden(人机交互 tactile 网络中心)

专题命中 文生图 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04545 2025-09-24 cs.CV 83%

PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting

Linqing Wang, Ximing Xing, Yiji Cheng, Zhiyuan Zhao, Donghao Li, Tiankai Hang, Jiale Tao, Qixun Wang, Ruihuang Li, Comi Chen, Xin Li, Mingrui Wu, Xinchi Deng, Shuyang Gu, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文言)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Technical Report. Project Page: https://hunyuan-promptenhancer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17651 2025-09-23 cs.CV 83%

SISMA: Semantic Face Image Synthesis with Mamba

Filippo Botti, Alex Ergasti, Tomaso Fontanini, Claudio Ferrari, Massimo Bertozzi, Andrea Prati

机构 * University of Parma, Department of Engineering and Architecture(帕尔马大学工程与建筑系) University of Siena, Department of Information Engineering and Mathematical Sciences(锡耶纳大学信息工程与数学科学系)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16141 2025-09-22 cs.CV 83%

AcT2I: Evaluating and Improving Action Depiction in Text-to-Image Models

Vatsal Malaviya, Agneet Chatterjee, Maitreya Patel, Yezhou Yang, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

Comments Project Page : https://vatsal-malaviya.github.io/AcT2I/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00848 2025-09-16 cs.CV 83%

RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning

Yuanhuiyi Lyu, Xu Zheng, Lutao Jiang, Yibo Yan, Xin Zou, Huiyu Zhou, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science(香港科学与技术大学) Guangxi Key Laboratory of Digital Infrastructure, Guangxi Zhuang Autonomous Region Information Center(广西数字基础设施重点实验室,广西壮族自治区信息中心) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10441 2025-09-15 cs.CV 83%

InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis

Tao Han, Wanghan Xu, Junchao Gong, Xiaoyu Yue, Song Guo, Luping Zhou, Lei Bai

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Sydney(悉尼大学)

专题命中 文生图 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏