arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-25 至 2026-05-25 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 2 篇

2503.06684 2026-05-25 cs.CV 89%

PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation

PixelPonder: 动态补丁自适应增强多条件文本到图像生成

Yanjie Pan, Qingdong He, Zhengkai Jiang, Pengcheng Xu, Chaoyi Wang, Jinlong Peng, Haoxuan Wang, Yun Cao, Zhenye Gan, Mingmin Chi, Bo Peng, Yabiao Wang

机构 * Fudan University(复旦大学) Tencent Youtu Lab(腾讯优图实验室) Western University(西澳大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出PixelPonder统一控制框架,通过补丁级自适应条件选择和时间感知控制注入机制,解决多条件文本到图像生成中结构失真和伪影问题,在保持文本语义一致性的同时提升空间对齐精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23178 2026-05-25 cs.CV 85%

Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

将人物组合在一起:面向多人交互场景的迭代姿态-图像生成

Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种双姿态-图像表示方法,将人物结构先验引入预训练扩散Transformer,通过跨模态对齐和迭代场景构建,提升多人交互图像生成的提示对齐度和场景多样性。

Comments Accepted to SIGGRAPH Conference Papers 2026. 22 pages, 12 figures. Project page: https://cornell-vailab.github.io/PeopleComposer/

详情

展开后加载摘要…

URL PDF HTML 收藏