arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-31 至 2026-03-31 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2603.22041 2026-03-31 cs.CV 88%

DTVI: Dual-Stage Textual and Visual Intervention for Safe Text-to-Image Generation

DTVI:双阶段文本和视觉干预以实现安全的文本到图像生成

Binhong Tan, Zhaoxin Wang, Handing Wang

机构 * Xidian University(西安电子科技大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出DTVI双阶段防御框架,通过全提示嵌入层面的类别感知干预和视觉生成阶段的抑制,有效防御生成不安全内容,实验显示在多个有害类别上达到94.43%的防御成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28713 2026-03-31 cs.CV 87%

DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing

DreamLite:一种轻量级的设备端统一模型用于图像生成和编辑

Kailai Feng, Yuxiang Wei, Bo Chen, Yang Pan, Hu Ye, Songwei Liu, Chenqian Yan, Yuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出DreamLite,一种轻量级设备端统一扩散模型,支持图像生成和文本引导的图像编辑,通过剪枝移动U-Net骨干网络和潜在空间内的上下文空间拼接实现统一条件化,达到高效生成和编辑效果。

Comments https://carlofkl.github.io/dreamlite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11483 2026-03-31 cs.CV cs.AI 83%

ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation

ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成

Kaishen Wang, Ruibo Chen, Tong Zheng, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。

Comments 8 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14376 2026-03-31 cs.CV 83%

DOS: Directional Object Separation in Text Embeddings for Multi-Object Image Generation

DOS:文本嵌入中多对象图像生成的定向对象分离

Dongnam Byun, Jungwon Park, Jungmin Ko, Changin Choi, Wonjong Rhee

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DOS方法,通过修改CLIP文本嵌入提升多对象图像生成效果,减少对象混合,实验表明其在多对象生成中表现更优。

Comments Accepted to AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(4), 37235. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26866 2026-03-31 cs.CV cs.AI 83%

LACON: Training Text-to-Image Model from Uncurated Data

LACON:从未整理数据中训练文本到图像模型

Zhiyang Liang, Ziyu Wan, Hongyu Liu, Dong Chen, Qiu Shen, Hao Zhu, Dongdong Chen

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) HKUST(香港科技大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LACON通过利用未整理数据分布,将质量信号作为条件标签,提升生成质量,证明了未整理数据的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27332 2026-03-31 cs.CV 70%

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 70%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏