arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-19 至 2026-03-19 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2603.17828 2026-03-19 cs.CV 88%

TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

TINA:无文本逆向攻击用于未学习的文本到图像扩散模型

Qianlong Xiang, Miao Zhang, Haoyu Zhang, Kun Wang, Junhui Hou, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) Peng Cheng Laboratory(鹏城实验室) Shandong University(山东大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。

Comments 16 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16830 2026-03-19 cs.CL 86%

PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models

PEPPER:基于感知的扰动用于文本到图像扩散模型的鲁棒后门防御

Oscar Chew, Po-Yi Lu, Jayden Lin, Kuan-Hao Huang, Hsuan-Tien Lin

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) University of Michigan(密歇根大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(title)

AI总结 PEPPER通过重写提示生成语义上不同但视觉上相似的描述,干扰输入提示中的触发器,提高文本到图像扩散模型的鲁棒性,尤其有效对抗基于文本编码器的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05305 2026-03-19 cs.CV cs.AI 83%

Frequency Autoregressive Image Generation with Continuous Tokens

基于连续标记的频率自回归图像生成

Hu Yu, Hao Luo, Hangjie Yuan, Yu Rong, Jie Huang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group, DAMO Academy(阿里巴巴集团,达摩院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出频率自回归(FAR)范式,通过连续标记器构建图像,利用频谱依赖性提升生成效果,并在ImageNet上验证了其在图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17637 2026-03-19 cs.LG cs.CV 79%

DSS-GAN: Directional State Space GAN with Mamba backbone for Class-Conditional Image Synthesis

DSS-GAN:基于Mamba架构的定向状态空间GAN用于类条件图像合成

Aleksander Ogonowski, Konrad Klimaszewski, Przemysław Rokita

机构 * Warsaw University of Technology(华沙技术大学) National Centre for Nuclear Research(国家核物理研究所)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 DSS-GAN引入了定向潜在路由机制,通过分解潜在向量并结合类别嵌入,提升图像合成的FID、KID和精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17895 2026-03-19 cs.CV 57%

A Creative Agent is Worth a 64-Token Template

一个创意代理值得一个64-token模板

Ruixiao Shi, Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(1 南京大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(2 教育部新一代人工智能技术及其跨学科应用关键实验室(东南大学))

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CAT框架,通过创意令牌化提升文本到图像生成的创造力,实现3.7倍速度提升和4.8倍计算成本降低,生成图像更受人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏