arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-29 至 2026-05-29 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2602.17200 2026-05-29 cs.CV 88%

GASS: Geometry-Aware Spherical Sampling for Disentangled Diversity Enhancement in Text-to-Image Generation

GASS: 几何感知球面采样用于文本到图像生成中解耦多样性增强

Ye Zhu, Kaleb S. Newman, Johannes F. Lutzeyer, Adriana Romero-Soriano, Michal Drozdzal, Olga Russakovsky

机构 * Laboratoire d'Informatique (LIX), CNRS, École Polytechnique, IPP, France(信息实验室(LIX),法国国家科学研究中心,巴黎高等技术学院,IPP,法国) Department of Computer Science, Princeton University, USA(计算机科学系,普林斯顿大学,美国) FAIR at Meta - Montreal, Canada(Meta FAIR - 加拿大蒙特利尔) McGill University, Canada(麦吉尔大学,加拿大) Mila, Quebec AI Institute, Canada(魁北克人工智能研究所,加拿大) Canada CIFAR AI chair(加拿大CIFAR人工智能主席)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出几何感知球面采样(GASS),通过正交分解CLIP嵌入中的提示相关与无关变异方向,沿两轴扩展投影分布以引导采样,在保持图像保真度和语义对齐的同时增强生成多样性。

Comments ICML 2026 Camera-ready. Code available at https://github.com/L-YeZhu/GASS_T2I

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29390 2026-05-29 cs.CV 86%

Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation

注意力特征空间中的正交负引导用于文本到图像生成

Jungmin Ko, Jungwon Park, Jimyeong Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Research Institute for Convergence Science, Seoul National University(融合科学研究所,首尔国立大学) Artificial Intelligence Institute, Seoul National University(人工智能研究所,首尔国立大学) Department of Intelligence and Information, Seoul National University(智能与信息系,首尔国立大学) Daegu Gyeongbuk Institute of Science and Technology(大邱庆北科学技术院) Samsung Advanced Institute of Technology, Samsung Electronics Co., Ltd(三星先进技术研究所,三星电子公司)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 提出一种基于注意力特征空间的正交负引导方法,通过正交化负提示注意力特征与正提示特征并仅减去正交分量,在无需训练的情况下有效抑制不需要的概念,同时保持图像质量和提示对齐。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30317 2026-05-29 cs.CV 70%

VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation

VPG: 视觉前缀引导的自回归图像与视频生成

Xinyao Liao, Qiyuan He, Yicong Li, Jiayin Zhu, Xiaoye Qu, Wei Wei, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Huazhong University of Science & Technology(华中科技大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出VPG,一种无需训练、推理时引导的方法,通过对比生成前缀与损坏前缀下的模型输出来改进自回归图像和视频生成的下一步预测,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29891 2026-05-29 cs.CV 57%

DVSM: Decoder-only View Synthesis Model Done Right

DVSM: 正确的仅解码器视图合成模型

Cheng Sun, Jaesung Choe, Min-Hung Chen, Ryo Hachiuma, Yu-Chiang Frank Wang

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出仅解码器架构DVSM,通过隐式KV-cache表示场景,在相同渲染复杂度下以更少参数超越编码器-解码器变体,并利用共享权重、基础模型先验和分阶段块大小优化效率与质量,在多个基准上实现新视点合成的最优结果。

Comments Code at https://github.com/NVLabs/dvsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12374 2026-05-29 cs.HC cs.AI cs.CY 50%

Expertise elevates AI usage: experimental evidence comparing laypeople and professional artists

专业知识提升AI使用:比较普通人和专业艺术家的实验证据

Thomas F. Eisenmann, Andres Karjus, Mar Canet Sola, Levin Brinkmann, Bramantyo Ibrahim Supriyatno, Iyad Rahwan

机构 * Center for Humans and Machines, Max Planck Institute for Human Development(人类与机器中心,马克斯·普朗克人类发展研究所) Tallinn University(塔林大学) Estonian Business School(爱沙尼亚商学院) Academy of Media Arts Cologne(科隆媒体艺术学院)

专题命中 文生图 :text-to-image(abstract)

AI总结 通过实验比较50位专业艺术家和普通人使用生成式AI进行图像复制和创意生成的表现,发现艺术家的专业技能迁移到AI使用中,在复制准确性和发散思维上均优于普通人,而GPT-4o在创意任务上平均略优于艺术家但未超越最佳人类。

Comments Eisenmann and Karjus contributed equally to this work and share first authorship

Journal ref International Journal of Human-Computer Interaction, 2026, pp 1-22

详情

展开后加载摘要…

URL PDF HTML 收藏