arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-13 至 2026-04-13 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2603.13450 2026-04-13 cs.CV cs.CL 92%

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20068 2026-04-13 cs.CV 77%

PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images

PRADA:基于概率比的自回归生成图像归因与检测

Simon Damm, Jonas Ricker, Henning Petzka, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PRADA方法,通过分析自回归生成图像的概率比特征,实现对生成图像的可靠检测和归因,适用于多种图像生成模型。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11795 2026-04-13 cs.CV 70%

Intrinsic Concept Extraction Based on Compositional Interpretability

基于组合可解释性的内在概念提取

Hanyu Shi, Hong Tao, Guoheng Huang, Jianbin Jiang, Xuhang Chen, Chi-Man Pun, Shanhu Wang, Pan Pan

机构 * Guangdong University of Technology(广东工业大学) VIPSHOP(唯品会) Huizhou University(惠州学院) University of Macau(澳门大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CI-ICE任务,利用扩散模型提取可组合的物体和属性概念,通过超表达方法实现概念解耦与可组合性,提升单图内在概念提取性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 57%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏