arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-24 至 2026-02-24 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2602.19631 2026-02-24 cs.CV cs.AI 88%

Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection

通过高层表示误导实现文本到图像扩散模型中的局部概念擦除

Uichan Lee, Jeonghyeon Kim, Sangheum Hwang

机构 * Department of Data Science, Seoul National University of Science and Technology(数据科学系,首尔科学技术大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HiRM方法,通过误导文本编码器中的高层表示来实现精确的概念擦除,减少对非目标概念的影响,并在低训练成本下保持生成能力。

Comments Accepted at ICLR 2026. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19350 2026-02-24 cs.CV 79%

PoseCraft: Tokenized 3D Body Landmark and Camera Conditioning for Photorealistic Human Image Synthesis

PoseCraft: 基于令牌化的3D人体姿态和相机条件化的人像图像合成

Zhilin Guo, Jing Yang, Kyle Fogarty, Jingyi Wan, Boqiao Zhang, Tianhao Wu, Weihao Xia, Chenliang Zhou, Sakar Khattar, Fangcheng Zhong, Cristina Nader Vasconcelos, Cengiz Oztireli

机构 * University of Cambridge(剑桥大学) Google(谷歌)

专题命中 文生图 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 PoseCraft通过令牌化3D姿态和相机信息,提升人像合成的逼真度和细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD 73%

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19557 2026-02-24 cs.CV 70%

The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models

提示复杂性、质量、多样性与一致性在T2I模型中的微妙舞蹈

Zhang Xiaofeng, Aaron Courville, Michal Drozdzal, Adriana Romero-Soriano

机构 * FAIR at Meta - Montréal(Meta - Montréal 的 FAIR) Mila - Québec AI Institute(魁北克 AI 院) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能 chair)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究了提示复杂性对T2I模型生成数据质量、多样性和一致性的影响,提出新的评估框架并发现提示扩展在生成多样性与美观性上优于真实数据。

Comments accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06292 2026-02-24 eess.IV cs.CV 57%

Zero-shot Multi-Contrast Brain MRI Registration by Intensity Randomizing T1-weighted MRI (LUMIR25)

无监督多对比脑MRI配准:通过强度随机化T1加权MRI(LUMIR25)

Hengjie Liu, Yimeng Dou, Di Xu, Xinyi Fu, Dan Ruan, Ke Sheng

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于强度随机化的多对比度脑MRI配准方法,通过多模态损失、强度随机化和轻量级优化策略,在无需显式图像合成的情况下实现了跨对比度的稳健泛化。

Comments Submitted to and reviewed by Learn2Reg MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏