arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-11 至 2026-08-11 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 6 篇

2608.09244 2026-08-11 cs.CV 新提交 89%

In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation

用于高保真主体驱动文本到图像生成的耦合潜在噪声引导的循环内模型适配

Yushun Tang, Weiming Chen, Siyi Liu, Yi Zhang, Feng Wu, Zhihai He

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) Pengcheng Lab(鹏城实验室)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究针对主体驱动文本到图像生成中参考图像变化时模型难适配且难保持主体身份的问题,提出IMA方法,通过耦合潜在噪声损失引导循环内模型适配,提升了生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08446 2026-08-11 cs.AI 新提交 78%

TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation

TRACE-Memory:用于个性化生成的公共条件检索与效用感知证据接纳

Jing Wang, Zhu Wang, Yifan Guo, Yulong Yang, Yunji Liang

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 该研究针对个性化生成系统中记忆使用的效用问题,提出TRACE-Memory两阶段框架,经多阶段训练后在三类数据集的4500个任务上表现优于多种记忆使用方法,支持选择性个性化。

Comments 9 pages, 4 figures, and 6 tables. Submitted to the 41st AAAI Conference on Artificial Intelligence (AAAI 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08460 2026-08-11 cs.CV 新提交 77%

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions

InstructionCrafter:生成一致且高保真的视觉指令

Shun Okamoto, Satoshi Iizuka, Kazuhiro Fukui

机构 * University of Tsukuba(筑波大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于扩散的InstructionCrafter框架,通过空间冻结训练和两种适配器优化,实现了文本到分步视觉指令的生成,在多基准数据集上达成了最优性能且减少了噪声等问题,代码和模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07713 2026-08-11 cs.CV cs.LG 新提交 74%

Tokenizer Generator Coupling in Medical Image Generation

医疗图像生成中的分词器-生成器耦合

Liam Chalcroft

机构 * University College London(伦敦大学学院)

专题命中 个性化与一致性 :image generation(title);分类 cs.CV

AI总结 该研究针对64×64低分辨率医疗图像,发现分词器与生成器的分离不合理,提出邻域条件预测增益指标,调优D3PM和SE-D3PM后FID-192大幅下降,验证了分词器-生成器耦合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23094 2026-08-11 cs.CV cs.GR cs.LG 版本更新 62%

FusionRelight: Relighting Portraits in Real Time via Hybrid Domain Knowledge Fusion

面向真实场景中人像重照明的混合领域知识融合

Qian Huang, Mayoore Selvarasa Jaiswal, Zhen Zhong, Rochelle Pereira, Jianyuan Min

机构 * NVIDIA

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出混合领域知识融合方法,通过融合合成、单光源和真实数据集的优势,提升人像重照明的实用性与效率,实现6至240倍的推理加速且保持SOTA视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06009 2026-08-11 cs.CV 版本更新 57%

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Wan-Animate-2:拓展角色动画的应用边界

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Xindi Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Hai Xu, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。

Comments Project page: https://humanaigc.github.io/wan-animate-2/

详情

展开后加载摘要…

URL PDF HTML 收藏