arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-16 至 2026-03-16 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2603.13070 2026-03-16 cs.CV 88%

Mitigating Memorization in Text-to-Image Diffusion via Region-Aware Prompt Augmentation and Multimodal Copy Detection

通过区域感知提示增强和多模态复制检测缓解文本到图像扩散中的记忆化

Yunzhuo Chen, Jordan Vice, Naveed Akhtar, Nur Al Hasan Haldar, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Curtin University(科廷大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出区域感知提示增强和多模态复制检测方法,通过增强提示多样性与检测复制行为,提升文本到图像扩散模型的生成质量与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14041 2026-03-16 cs.CV cs.AI 77%

BitDance: Scaling Autoregressive Generative Models with Binary Tokens

BitDance: 通过二进制令牌扩展自回归生成模型

Yuang Ai, Jiaming Han, Shaobin Zhuang, Weijia Mao, Xuefeng Hu, Ziyan Yang, Zhenheng Yang, Yali Wang, Huaibo Huang, Xiangyu Yue, Hao Chen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 BitDance通过二进制令牌生成高熵表示,结合二进制扩散头和next-patch扩散方法,实现高效图像生成,达到最佳FID分数并显著提升推理速度。

Comments Code and models: https://github.com/shallowdream204/BitDance

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12998 2026-03-16 cs.CV 70%

A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法

Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan

机构 * King’s College London(伦敦国王学院) Queen Mary University of London(伦敦女王学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13116 2026-03-16 cs.HC 67%

Memory Printer: Exploring Everyday Reminiscing by Combining Slow Design with Generative AI-based Image Creation

记忆打印机:通过结合缓慢设计与基于生成AI的图像创作探索日常回忆

Zhou Fang, Janet Yi-Ching Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

AI总结 本文提出Memory Printer,结合丝网印刷隐喻与文本到图像生成,通过分层重建、物理木刮刀和内置打印,探索慢互动如何重塑人机关系,发现记忆唤起与控制感提升等机遇及算法偏见等挑战。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13118 2026-03-16 cs.CV 57%

NOIR: Neural Operator mapping for Implicit Representations

NOIR:用于隐式表示的神经算子映射

Sidaty El Hadramy, Nazim Haouchine, Michael Wehrli, Philippe C. Cattin

机构 * Department of Biomedical Engineering, University of Basel(巴塞尔大学生物医学工程系) Harvard Medical School, Brigham and Women’s Hospital(哈佛医学院布里奇沃特医院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 NOIR框架将医学影像任务重新表述为连续函数空间间的算子学习,实现分辨率无关的功能到功能转换,展示了对未见过离散化的强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏