arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-26 至 2026-03-26 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2603.24086 2026-03-26 cs.CV cs.GR 90%

LGTM: Training-Free Light-Guided Text-to-Image Diffusion Model via Initial Noise Manipulation

LGTM: 通过初始噪声操控实现无训练的光引导文本到图像扩散模型

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Ko Watanabe, Riku Takahashi, Andreas Dengel

机构 * RPTU Kaiserslautern-Landau & DFKI GmbH(莱茵-穆尔大学与DFKI GmbH) Faculty of Science and Engineering, Hosei University(早稻田大学理工学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

AI总结 本文提出LGTM模型,通过操控扩散过程的初始噪声实现文本提示和用户指定光照方向的图像生成,无需微调或修改预训练模型,提升了光照控制的灵活性和适应性。

Comments Accepted to IJCNN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02315 2026-03-26 cs.CV 88%

FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation

FOCUS:多实体世界建模中的最优控制

Eric Tillmann Bill, Enis Simsar, Thomas Hofmann

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出FOCUS框架,通过将流匹配转化为随机最优控制,解决文本生成图像中多实体场景的属性泄露和身份纠缠问题,提出两种算法提升多实体对齐性能。

Comments Project Page: https://ericbill21.github.io/FOCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 85%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 文生图 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24383 2026-03-26 cs.CV 77%

ViHOI: Human-Object Interaction Synthesis with Visual Priors

ViHOI:基于视觉先验的人-物交互合成

Songjin Cai, Linjie Zhong, Ling Guo, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 ViHOI通过从2D图像中提取丰富的交互先验,利用扩散模型提升生成质量,实现人-物交互的高质量合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23140 2026-03-26 cs.LG 67%

DAK-UCB: Diversity-Aware Prompt Routing for LLMs and Generative Models

DAK-UCB: 为LLMs和生成模型的多样性感知提示路由

Donya Jafari, Farzan Farnia

机构 * Sharif University of Technology(谢赫拉扎德技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

AI总结 本文提出DAK-UCB方法,结合保真度与多样性指标,用于在线选择生成模型,以提升生成结果的多样性同时保持保真度。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏