arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-12 至 2026-03-12 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2603.10785 2026-03-12 cs.CV 88%

The Quadratic Geometry of Flow Matching: Semantic Granularity Alignment for Text-to-Image Synthesis

流匹配的二次几何:文本到图像合成中的语义粒度对齐

Zhinan Xiong, Shunqi Yuan

机构 * Conservatoire National des Arts et Métiers(法国国家艺术与工艺学院) Sun Yat-sen University(孙中山大学)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出语义粒度对齐方法,通过优化流匹配框架中的残差场,提升文本到图像合成的效率与质量平衡。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11106 2026-03-12 cs.CV cs.CR 79%

Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models

针对文本到图像模型的令牌级约束边界搜索

Jiangtao Liu, Zhaoxin Wang, Handing Wang, Cong Tian, Yaochu Jin

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Trustworthy and General Artificial Intelligence Laboratory, School of Engineering, Westlake University(之江实验室可信与通用人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 TCBS攻击通过搜索决策边界附近的令牌,有效突破全链T2I模型的防御,实现高劫持成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10210 2026-03-12 cs.CV cs.AI 77%

Delta-K: Boosting Multi-Instance Generation via Cross-Attention Augmentation

Delta-K: 通过交叉注意力增强提升多实例生成

Zitong Wang, Zijun Shen, Haohao Xu, Zhengjie Luo, Weibin Wu

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Nanjing University(南京大学) College of Management and Economics, Tianjin University(天津大学管理学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17066 2026-03-12 cs.AI cs.CL cs.CV cs.LG cs.MA 70%

Mindstorms in Natural Language-Based Societies of Mind

自然语言基础的思维社会中的风暴

Mingchen Zhuge, Haozhe Liu, Francesco Faccio, Dylan R. Ashley, Róbert Csordás, Anand Gopalakrishnan, Abdullah Hamdi, Hasan Abed Al Kader Hammoud, Vincent Herrmann, Kazuki Irie, Louis Kirsch, Bing Li, Guohao Li, Shuming Liu, Jinjie Mai, Piotr Piękos, Aditya Ramesh, Imanol Schlag, Weimin Shi, Aleksandar Stanić, Wenyi Wang, Yuhui Wang, Mengmeng Xu, Deng-Ping Fan, Bernard Ghanem, Jürgen Schmidhuber

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨了基于自然语言的思维社会(NLSOMs)的结构和应用,通过多代理系统解决多种AI任务,并提出未来研究方向。

Comments published in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices

Journal ref (2025). Computational Visual Media, 11(1), 29-81

详情

展开后加载摘要…

URL PDF HTML 收藏