arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-24 至 2026-06-24 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2606.24849 2026-06-24 cs.CV cs.AI 新提交 88%

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链

Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Ant Group(蚂蚁集团) The University of Hong Kong(香港大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出隐式视觉思维链(IV-CoT)框架,通过结构到语义的级联分解和训练时草图监督,在不增加推理开销的情况下提升文本到图像生成的结构感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24081 2026-06-24 cs.CR cs.AI 新提交 82%

PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

PixJail:面向文本到图像越狱评估的自演化论文到流水线复现

Leyi Sheng, Han Sun, Zhen Sun, Yuntao Yue, Jinlin Wu, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Technology and Science (Guangzhou)(香港科技与应用科技大学(广州)) East China Normal University(华东师范大学) Shanghai Qi Zhi Institute(上海启智研究院) Wuhan University(武汉大学) Institute of Deep Perception Technology, JITRI(视觉感知技术研究院,JITRI) CAIR, Hong Kong Institute of Science and Innovation (HKISI)(创新科技研究院,香港科学与创新研究院(HKISI)) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

AI总结 提出PixJail框架,通过自演化论文到流水线代理,自动构建攻击模块和可运行评估流水线,忠实复现原始实验结果,平均误差仅2.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06021 2026-06-24 cs.CV cs.AI cs.LG 79%

Improved Sub-Visible Particle Classification in Flow Imaging Microscopy via Generative AI-Based Image Synthesis

通过生成式AI图像合成改进流成像显微镜下的亚可见粒子分类

Utku Ozbulak, Michaela Cohrs, Hristo L. Svilenov, Joris Vankerschaver, Wesley De Neve

机构 * Center for Biosystems and Biotech Data Science(生物系统与生物技术数据科学中心) Ghent University Global Campus(根特大学全球校区) Department of Electronics and Information Systems(电子与信息系统系) Faculty of Pharmaceutical Sciences(药学系) Biopharmaceutical Technology, TUM School of Life Sciences(生物制药技术,技术大学生命科学学院) Department of Mathematics, Computer Science and Statistics(数学、计算机科学与统计学系)

专题命中 文生图 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于生成式AI的图像合成方法,解决流成像显微镜下亚可见粒子分类中的数据不平衡问题,通过生成高保真图像提升多类分类性能,公开模型和工具促进研究复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24484 2026-06-24 cs.CV 新提交 57%

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

推进面向艺术字的场景文本识别:数据集与方法

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) South China University of Technology(华南理工大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏