arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-10 至 2026-04-10 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2504.13378 2026-04-10 cs.GR cs.CV 91%

SMPL-GPTexture: Dual-View 3D Human Texture Estimation using Text-to-Image Generation Models

SMPL-GPTexture:利用文本到图像生成模型进行双视角3D人体纹理估计

Mingxiao Tu, Shuchang Ye, Hoijoon Jung, Jinman Kim

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);inpainting(abstract)

AI总结 本文提出SMPL-GPTexture方法,通过文本提示生成双视角图像,结合人体网格恢复模型和反向光栅化技术,生成高精度纹理映射,解决3D人体纹理生成中的隐私和数据获取难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08123 2026-04-10 cs.DC cs.AI 89%

LegoDiffusion: Micro-Serving Text-to-Image Diffusion Workflows

LegoDiffusion:微服务文本到图像扩散工作流

Lingyun Yang, Suyi Li, Tianyu Feng, Xiaoxiao Jiang, Zhipeng Di, Weiyi Lu, Kan Liu, Yinghao Yu, Tao Lan, Guodong Yang, Lin Qu, Liping Zhang, Wei Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract)

AI总结 LegoDiffusion通过将扩散工作流分解为松耦合的模型执行节点,实现高效管理与调度,提升请求率和突发流量容忍度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07427 2026-04-10 cs.CV 86%

Personalizing Text-to-Image Generation to Individual Taste

根据个人口味个性化文本到图像生成

Anne-Sofie Maerten, Juliane Verwiebe, Shyamgopal Karthik, Ameya Prabhu, Johan Wagemans, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Department of Brain and Cognition, KU Leuven(鲁汶大学大脑与认知系)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出PAMELA框架和数据集,通过个性化奖励模型提升文本到图像生成对个体偏好的适应性,展示了简单提示优化方法在引导生成个体偏好中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 85%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17489 2026-04-10 cs.CV 83%

LumiCtrl : Learning Illuminant Prompts for Lighting Control in Personalized Text-to-Image Models

LumiCtrl : 基于光照提示的学习以实现个性化文本到图像模型中的光照控制

Muhammad Atif Butt, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) City University of Hong Kong(香港城市大学) Computer Sciences Department, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出LumiCtrl方法,通过学习单个物体图像的光照提示,实现对文本到图像模型中光照的精准控制,提升生成图像的光照真实性、审美质量和场景一致性。

Comments Accepted to IEEE/CVF CVPR 2026 Workshop on AI for Creative Visual Content Generation, Editing, and Understanding (CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08008 2026-04-10 cs.CV cs.AI cs.LG 57%

SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

SearchAD:大规模稀有图像检索数据集用于自动驾驶

Felix Embacher, Jonas Uhrig, Marius Cordts, Markus Enzweiler

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃斯林根应用技术大学智能系统研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 SearchAD为自动驾驶提供大规模稀有图像检索数据集,包含423k帧和513k个标注框,针对稀有类别检索问题,支持文本到图像和图像到图像检索及少样本学习。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08637 2026-04-10 cs.CY cs.AI cs.CR 50%

How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets

数据所有者如何说不?Web抓取视觉-语言AI训练数据集中的数据同意机制案例研究

Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Amazon AWS AI/ML(亚马逊AWS AI/ML)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究探讨了数据所有者在AI训练数据集中的同意表达方式,分析了DataComp数据集中样本层面和网络层面的信息,揭示了当前数据收集流程对数据同意的不尊重问题。

详情

展开后加载摘要…

URL PDF HTML 收藏