arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-03 至 2026-06-03 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2606.03243 2026-06-03 cs.CV 88%

MemoGen: Can Past Experience Improve Future Text-to-Image Generation?

MemoGen:过去的经验能否改善未来的文本到图像生成?

Wenshuo Chen, Kuimou Yu, Bowen Tian, Jianfei Song, Shaofeng Liang, Haozhe Jia, Kan Cheng, Haosen Li, Kaishen Yuan, Lei Wang, Jiemin Wu, Songning Lai, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Scholarly, Guangzhou Ziyan Technology Co., Ltd.(学者,广州智源科技有限公司) LimX Dynamics Technology Co., Ltd.(LimX动力科技有限公司) Shandong University(山东大学) Data61/CSIRO Griffith University(Data61/CSIRO格里菲斯大学) Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院(JITRI))

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出MemoGen框架,通过代理进化层和可重用经验记忆,在不更新生成器的情况下,利用过去经验改进文本到图像生成,在知识密集和推理基准上超越专有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03715 2026-06-03 cs.CV 85%

Text-to-Image Models Need Less from Text Encoders Than You Think

文生图模型对文本编码器的依赖比你想象的要少

Nurit Spingarn, Noa Cohen, Tamar Rott Shaham, Tomer Michaeli

机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文发现基于扩散Transformer的文生图模型主要依赖文本编码器提供的单词含义和词序信息,而非完整的上下文信息,并通过构建仅含位置标记词袋的嵌入验证了这一观点。

Comments Project webpage: https://nsping13.github.io/contextless-TTI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18599 2026-06-03 cs.CV 70%

SJD-PAC: Accelerating Speculative Jacobi Decoding via Proactive Drafting and Adaptive Continuation

SJD-PAC:通过主动草稿和自适应延续加速推测性雅可比解码

Jialiang Kang, Han Shu, Wenshuo Li, Yingjie Zhai, Xinghao Chen

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出SJD-PAC框架,通过主动草稿策略和自适应延续机制提升推测性雅可比解码的接受率,实现无损加速文本到图像合成。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03354 2026-06-03 cs.CR 50%

ImageAuditor: Membership Inference Attack against Image-based Retrieval-Augmented Generation

ImageAuditor: 针对基于图像的检索增强生成系统的成员推理攻击

Jinghuai Zhang, Pengyue Yu, Zhexiao Lin, Kunlin Cai, Fnu Suya, Yuan Tian

专题命中 文生图 :text-to-image(abstract)

AI总结 提出首个针对基于图像的检索增强生成(IRAG)的成员推理攻击方法ImageAuditor,通过奖励引导策略优化解决跨模态检索和判别信号提取两大挑战,在仅需四次查询时AUROC超过80%。

详情

展开后加载摘要…

URL PDF HTML 收藏