arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-14 至 2026-04-14 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 10 篇

2511.12968 2026-04-14 cs.CV 88%

GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

GrOCE:基于图的在线概念擦除用于文本到图像扩散模型

Ning Han, Zhenyu Ge, Feng Han, Yuhua Sun, Chengqing Li, Jingjing Chen

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 GrOCE提出一种无需训练的框架,通过动态语义图和适应性聚类识别实现精准的在线概念擦除,提升文本到图像扩散模型的语义准确性和稳定性。

Comments Accepted to CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09923 2026-04-14 cs.AI cs.CV 85%

GLEaN: A Text-to-image Bias Detection Approach for Public Comprehension

GLEaN:一种面向公众理解的文本到图像偏见检测方法

Bochu Ding, Brinnae Bent, Augustus Wendell

机构 * Duke University(杜克大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 GLEaN通过生成图像和面部特征分析,直观展示文本到图像模型的偏见,使公众能快速理解模型对不同身份提示的偏见表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 79%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06313 2026-04-14 cs.CV cs.CY 79%

Text-to-Image Models and Their Representation of People from Different Nationalities Engaging in Activities

文本到图像模型及其对不同民族参与活动的人的表示

Abdulkareem Alsudais

机构 * Prince Sattam bin Abdulaziz University(沙特王子萨塔姆·本·阿卜杜勒阿齐兹大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究分析了DALL-E 3和Gemini 3 Pro Preview在生成日常活动图像时对206个民族的表示,发现传统服饰在某些活动中不适用,且与地区和收入组相关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10949 2026-04-14 cs.CV cs.AI 77%

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

伪统一:熵探测揭示统一多模态模型中分歧的信息模式

Songlin Yang, Xianghao Kong, Anyi Rao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究揭示统一多模态模型中伪统一现象的根源,通过信息论方法分析输入编码和输出生成,发现模态不对称编码和响应模式分裂是导致分歧的主要原因,强调信息流一致性对真实多模态协同的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-04-14 cs.LG cs.CV 70%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09850 2026-04-14 cs.CV 70%

Training-Free Object-Background Compositional T2I via Dynamic Spatial Guidance and Multi-Path Pruning

无需训练的物体-背景组合性T2I通过动态空间引导和多路径剪枝

Yang Deng, David Mould, Paul L. Rosin, Yu-Kun Lai

机构 * Cardiff University(卡迪夫大学) Carleton University(卡尔顿大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需训练的框架,通过动态空间引导和多路径剪枝,提升文本到图像扩散模型中背景与物体的组合性与平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17458 2026-04-14 cs.CV cs.CL 70%

CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration

CARINOX:推理时间缩放与基于类别感知的奖励驱动初始噪声优化与探索

Seyed Amir Kasaei, Ali Aghayari, Arash Marioriyad, Niki Sepasian, Shayan Baghayi Nejad, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CARINOX框架,结合噪声优化与探索,通过基于人类判断的奖励选择提升文本到图像扩散模型的对齐性能,在两个基准测试中分别提升16%和11%。

Comments Accepted at TMLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05217 2026-04-14 cs.CV 57%

Organizing Unstructured Image Collections using Natural Language

用自然语言组织无结构图像集合

Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ENSTA Paris, Institut Polytechnique de Paris(巴黎高等先进技术学院,巴黎综合理工学院) Hefei University of Technology(合肥工业大学) University of Bergamo(贝加莫大学) Technical University of Munich(慕尼黑工业大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出OpenSMC任务,通过自然语言发现图像的多种语义聚类标准,并实现自动组织。X-Cluster框架通过文本推理代理,发现多种聚类标准并生成有意义的簇。

Comments Accepted to CVPR 2026 Findings. Project page: https://oatmealliu.github.io/xcluster.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09706 2026-04-14 quant-ph 50%

Hybrid Quantum-Classical Generative Adversarial Networks with Transfer Learning

混合量子-经典生成对抗网络与迁移学习

Asma Al-Othni, Saif Al-Kuwari, Mohammad Mahdi Nasiri Fatmehsari, Kamila Zaman, Ebrahim Ardeshir-Larijani

专题命中 文生图 :image synthesis(abstract)

AI总结 本文研究了结合迁移学习的混合量子-经典GAN架构,探讨了在生成器、判别器或两者中加入变分量子电路对性能的影响,发现全混合模型在图像质量和量化指标上表现更优。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏