arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-29 至 2026-04-29 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 3 篇

2604.25457 2026-04-29 cs.CV 83%

GramSR: Visual Feature Conditioning for Diffusion-Based Super-Resolution

GramSR: 基于视觉特征条件的扩散式超分辨率

Fabio D'Oronzio, Federico Putamorsi, Leonardo Zini, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 GramSR通过利用低分辨率输入提取的密集视觉特征替代文本条件,提出了一种基于扩散的超分辨率框架,采用三阶段LoRA架构提升结构保真度和纹理真实感。

Comments Accepted at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI 57%

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24842 2026-04-29 cs.AI cs.MA cs.MM 57%

Co-Director: Agentic Generative Video Storytelling

Co-Director: 基于代理的生成视频叙事

Yale Song, Yiwen Song, Nick Losier, Nathan Hodson, Ye Jin, Rhyard Zhu, Yan Xu, Daniel Vlasic, Carina Claassen, Jasmine Leon, Khanh G. LeViet, Zack Chomyn, Joe Timmons, Brett Slatkin, Scott Penberthy, Tomas Pfister

机构 * Google(谷歌)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 本文提出Co-Director框架,通过分层多代理方法解决视频生成的语义一致性问题,引入分层参数化和多模态自优化循环,实现叙事策略探索与有效配置的平衡,通过GenAD-Bench验证其在个性化广告中的优越性。

Comments Project Page: https://co-director-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏