arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86350 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2512.13672 2026-03-11 cs.LG cs.CV 86%

Directional Textual Inversion for Personalized Text-to-Image Generation

方向性文本反转用于个性化文本到图像生成

Kunhee Kim, NaHyeon Park, Kibeom Hong, Hyunjung Shim

机构 * KAIST(韩国科学技术院) Sookmyung Woman’s University(成均馆女子大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 方向性文本反转通过优化方向提升文本到图像生成的个性化效果,实现更稳定的语义连贯性。

Comments ICLR 2026; Project page: https://kunheek.github.io/dti

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23138 2026-03-09 cs.CV 86%

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

VisualPrompter: 基于视觉反馈的语义感知提示优化用于文本到图像合成

Shiyu Wu, Mingzhen Sun, Weining Wang, Yequan Wang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV

AI总结 VisualPrompter通过语义感知的提示优化机制,提升文本到图像合成的对齐性能和内容质量。

Comments ICLR2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14553 2026-02-17 cs.CV 86%

Consistent text-to-image generation via scene de-contextualization

通过场景去上下文化实现一致的文本到图像生成

Song Tang, Peihao Gong, Kunyu Li, Kai Guo, Boyu Wang, Mao Ye, Jianwei Zhang, Xiatian Zhu

机构 * University of Shanghai for Science and Technology(上海科技大学) Universität Hamburg(汉堡大学) ComOriginMat Inc(ComOriginMat公司) Fudan University(复旦大学) Western University(西敏大学) Vector Institute(向量研究所) University of Electronic Science and Technology of China(电子科技大学) University of Surrey(萨里大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出Scene De-Contextualization方法,通过去除文本到图像生成中主体与场景的固有相关性,提升生成图像的一致性与多样性。

Comments This paper is accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18543 2026-01-29 cs.CV 86%

GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning

GenAgent:通过代理多模态推理扩展文本到图像生成

Kaixun Jiang, Yuzheng Wang, Junjie Zhou, Pandeng Li, Zhihang Liu, Chen-Wei Xie, Zhaoyu Chen, Yun Zheng, Wenqiang Zhang

机构 * Fudan University(复旦大学) Tongyi Lab(通义实验室) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 GenAgent通过代理多模态推理提升文本到图像生成性能,采用两阶段训练策略实现自主多轮交互与任务自适应推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21099 2026-01-21 cs.CV cs.AI cs.CR 86%

Beyond the Safety Tax: Mitigating Unsafe Text-to-Image Generation via External Safety Rectification

超越安全税:通过外部安全校正缓解不安全的文本到图像生成

Xiangtao Meng, Yingkai Dong, Ning Yu, Li Wang, Zheng Li, Shanqing Guo

机构 * Shandong University(山东大学) Netflix Eyeline Studios

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出SafePatch,通过外部安全校正机制有效抑制文本到图像生成中的不安全内容,同时保持生成质量与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03826 2026-01-08 cs.CV 86%

FairT2I: Mitigating Social Bias in Text-to-Image Generation via Large Language Model-Assisted Detection and Attribute Rebalancing

FairT2I: 通过大型语言模型辅助的检测与属性再平衡缓解文本到图像生成中的社会偏见

Jinya Sakurai, Yuki Koyama, Issei Sato

机构 * The University of Tokyo(东京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 FairT2I通过大型语言模型辅助检测与属性再平衡,有效缓解文本到图像生成中的社会偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 86%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 86%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07341 2025-12-09 cs.CV 86%

DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation

DCoAR: 一种深度概念注入到统一自回归模型中用于个性化文本到图像生成

Fangtai Wu, Mushui Liu, Weijie He, Zhao Wang, Yunlong Yu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 DCoAR通过深度概念注入框架实现个性化文本到图像生成,采用LMCL策略和多正则化方案提升生成质量与上下文适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04087 2025-12-05 q-bio.NC cs.CL cs.CV cs.CY cs.HC 86%

Human-Centred Evaluation of Text-to-Image Generation Models for Self-expression of Mental Distress: A Dataset Based on GPT-4o

以人为中心评估文本到图像生成模型以表达心理压力:基于GPT-4o的数据库

Sui He, Shenbin Qian

机构 * School of Culture and Communication, Swansea University(文化与沟通学院,萨里大学) Department of Informatics, University of Oslo(信息学院,奥斯陆大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本研究基于GPT-4o构建首个公开的文本到图像评估数据集,评估AI生成图像在心理健康自我表达中的有效性,发现角色提示设计显著影响用户评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00743 2025-12-02 cs.CV 86%

Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards

多组GRPO:基于树状轨迹和多奖励的文本到图像生成多组优势估计

Qiang Lyu, Zicong Chen, Chongxiao Wang, Haolin Shi, Shibo Gao, Ran Piao, Youwei Zeng, Jianlou Si, Fei Ding, Jing Li, Chun Pong Lau, Weiqiang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Beihang University(北航) Alibaba Group(阿里巴巴集团) Beijing Jiaotong University(北京交通大学) TikTok Inc.(TikTok公司) City University of Hong Kong(香港城市大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 Multi-GRPO通过树状轨迹和多奖励分组机制,提升文本到图像生成的稳定性和多目标对齐性能。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12932 2025-12-01 cs.CV 86%

Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes

Text2Traffic: 一种用于交通场景的文本到图像生成与编辑方法

Feng Lv, Haoxuan Feng, Zilu Zhang, Chunlong Xia, Yanfeng Li

机构 * Baidu(百度) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文提出了一种统一的文本驱动框架,通过可控掩码机制和多视角数据增强,提升交通场景中文本到图像生成与编辑的保真度和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19458 2025-11-26 cs.CV cs.AI 86%

Personalized Reward Modeling for Text-to-Image Generation

面向文本到图像生成的个性化奖励建模

Jeongeun Lee, Ryang Heo, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 PIGReward通过动态生成用户条件评估维度和推理过程,实现文本到图像生成的个性化评估与优化,提升生成图像与个体意图的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17282 2025-11-24 cs.CV cs.AI cs.CY 86%

Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation

文化消逝之处:揭示文本到图像生成中的文化差距

Chuancheng Shi, Shangze Li, Shiming Guo, Simiao Xie, Wenhua Wu, Jingtong Dou, Chao Wu, Canran Xiao, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出了一种解决多语言文本到图像生成中文化一致性问题的方法,通过局部化文化敏感信号并改进模型对文化相关层的激活,提升生成图像的文化一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10136 2025-11-14 cs.CV cs.AI 86%

Right Looks, Wrong Reasons: Compositional Fidelity in Text-to-Image Generation

Mayank Vatsa, Aparna Bharati, Richa Singh

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04834 2025-11-13 cs.LG cs.AI cs.CV 86%

Prompt-Based Safety Guidance Is Ineffective for Unlearned Text-to-Image Diffusion Models

Jiwoo Shin, Byeonghu Na, Mina Kang, Wonhyeok Choi, Il-Chul Moon

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);分类 cs.CV

Comments Accepted at NeurIPS 2025 Workshop on Generative and Protective AI for Content Creation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21227 2025-11-11 cs.CV cs.CL 86%

Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation

Seyed Amir Kasaei, Ali Aghayari, Arash Marioriyad, Niki Sepasian, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04112 2025-11-07 cs.CV 86%

SpatialLock: Precise Spatial Control in Text-to-Image Synthesis

Biao Liu, Yuanzhi Liang

机构 * The Sugon Group(神舟集团) TeleAI China Telecom(中国电信) Shanghai China(上海中国)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);分类 cs.CV

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06771 2025-10-27 cs.AI cs.CV cs.LG 86%

Proactive Agents for Multi-Turn Text-to-Image Generation Under Uncertainty

Meera Hahn, Wenjun Zeng, Nithish Kannen, Rich Galt, Kartikeya Badola, Been Kim, Zi Wang

机构 * Google DeepMind(谷歌DeepMind)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Journal ref International Conference on Machine Learning, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08994 2025-10-13 cs.CV 86%

Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation

Yao Teng, Fuyun Wang, Xian Liu, Zhekai Chen, Han Shi, Yu Wang, Zhenguo Li, Weiyang Liu, Difan Zou, Xihui Liu

机构 * The University of Hong Kong(香港大学) CUHK(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Tsinghua University(清华大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04201 2025-10-07 cs.CV cs.AI 86%

World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge

Moo Hyun Son, Jintaek Oh, Sun Bin Mun, Jaechul Roh, Sehyun Choi

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Georgia Institute of Technology(佐治亚理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) TwelveLabs

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21318 2025-10-03 cs.CV 86%

How far can we go with ImageNet for Text-to-Image generation?

L. Degeorge, A. Ghosh, N. Dufour, D. Picard, V. Kalogeiton

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01010 2025-10-02 cs.CV 86%

ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning

Yuxiang Guo, Jiang Liu, Ze Wang, Hao Chen, Ximeng Sun, Yang Zhao, Jialian Wu, Xiaodong Yu, Zicheng Liu, Emad Barsoum

机构 * Johns Hopkins University(约翰霍普金斯大学) AMD(AMD公司)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23457 2025-09-30 cs.CV 86%

No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation

Mohammad Hossein Sameti, Amir M. Mansourian, Arash Marioriyad, Soheil Fadaee Oshyani, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙里夫技术大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments 8 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13760 2025-09-18 cs.CV 86%

Iterative Prompt Refinement for Safer Text-to-Image Generation

Jinwoo Jeon, JunHyeok Oh, Hayeong Lee, Byung-Jun Lee

机构 * Korea University(韩国大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10260 2025-09-15 cs.CV 86%

MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation

Jia Wang, Jie Hu, Xiaoqi Ma, Hanghang Ma, Yanbing Zeng, Xiaoming Wei

机构 * University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17472 2025-08-26 cs.CV 86%

T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation

Kaiyue Sun, Rongyao Fang, Chengqi Duan, Xian Liu, Xihui Liu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments Code: https://github.com/KaiyueSun98/T2I-ReasonBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00728 2025-08-04 cs.CV 86%

YOLO-Count: Differentiable Object Counting for Text-to-Image Generation

Guanning Zeng, Xiang Zhang, Zirui Wang, Haiyang Xu, Zeyuan Chen, Bingnan Li, Zhuowen Tu

机构 * Tsinghua University(清华大学) UC San Diego(加州大学圣地亚哥分校) UC Berkeley(加州大学伯克利分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20934 2025-07-29 cs.CV 86%

Exploring text-to-image generation for historical document image retrieval

Melissa Cote, Alexandra Branzan Albu

机构 * University of Victoria(维多利亚大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments Accepted and presented as an extended abstract (double-blind review process) at the 2025 Scandinavian Conference on Image Analysis (SCIA). 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06506 2025-07-24 cs.CV cs.LG 86%

Fine-Grained Alignment and Noise Refinement for Compositional Text-to-Image Generation

Amir Mohammad Izadi, Seyed Mohammad Hadi Hosseini, Soroush Vafaie Tabar, Ali Abdollahi, Armin Saghafian, Mahdieh Soleymani Baghshah

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏