arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-20 至 2026-03-20 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2603.18767 2026-03-20 cs.AI 88%

A Concept is More Than a Word: Diversified Unlearning in Text-to-Image Diffusion Models

一个概念远不止一个词:文本到图像扩散模型中的多样化去学习

Duc Hao Pham, Van Duy Truong, Duy Khanh Dinh, Tien Cuong Nguyen, Dien Hy Ngo, Tuan Anh Bui

机构 * VNPT AI(VNPT人工智能研究院) VNPT Group(VNPT集团) Independent Researcher(独立研究员)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本文提出多样化去学习框架,通过多样化提示集而非单一关键词表示概念,提升去学习的精度与鲁棒性,实验表明其在多个基准和最新基线中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18627 2026-03-20 cs.AI 86%

Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation

代理流引导与并行展开搜索用于空间感知的文本到图像生成

Ping Chen, Daoxuan Zhang, Xiangming Wang, Yungeng Liu, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04614 2026-03-20 cs.CV 83%

HyperAlign: Hyperbolic Entailment Cones for Adaptive Text-to-Image Alignment Assessment

HyperAlign:基于双曲蕴含几何的自适应文本到图像对齐评估

Wenzhi Chen, Bo Hu, Leida Li, Lihuo He, Wen Lu, Xinbo Gao

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Xidian University(西安电子科技大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 HyperAlign基于双曲蕴含几何提出自适应文本到图像对齐评估框架,通过CLIP提取欧几里得特征并映射到双曲空间,设计动态监督蕴含建模机制和自适应调制回归器,实现对图像-文本对齐的高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18554 2026-03-20 quant-ph cs.CV 83%

End-to-End QGAN-Based Image Synthesis via Neural Noise Encoding and Intensity Calibration

通过神经噪声编码和强度校准的端到端QGAN图像合成

Xue Yang, Rigui Zhou, Shizheng Jia, Dax Enshan Koh, Siong Thye Goh, Yaochong Li, Hongyu Chen, Fuhui Xiong

机构 * Shanghai Maritime University(上海海洋大学) Agency for Science, Technology and Research(科技研究局) Singapore University of Technology and Design(新加坡科技设计大学) Institute of High Performance Computing(高性能计算研究院)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出ReQGAN框架,利用单个D-qubit量子电路生成完整图像,解决量子生成器角色弱化和全局语义捕捉难题,通过神经噪声编码和强度校准模块实现稳定训练和有效图像合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19157 2026-03-20 cs.CV 77%

ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation

ADAPT:基于注意力的自适应提示调度与稀有概念生成的插值正交补集

Kwanyoung Lee, Hyunwoo Oh, SeungJu Cha, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 ADAPT框架通过确定性提示调度和语义对齐,提升稀有概念生成效果,无需额外训练,在RareBench基准上表现优异。

Comments Accepted in CVPR 2026 (findings). 10 pages, 4 figures; supplementary material included (8 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23098 2026-03-20 cs.CV cs.AI 57%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏