arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-17 至 2026-07-17 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2607.14962 2026-07-17 cs.LG cs.AI cs.CV 新提交 88%

Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation

用于文本到图像生成中代表性多样性的多轴最大@K强化学习

Ku Onoda, Paavo Parmas, Hiroki Furuta, Soichiro Nishimori, Yuta Oshima, Shohei Taniguchi, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像生成中样本模式覆盖不足问题,提出多轴最大@K强化学习目标,通过特定信用分配机制改善覆盖,在感知外观公平性评估中提高公平分数,且保持图像质量和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14807 2026-07-17 cs.CV 新提交 85%

TAMF-VTON: Texture-Aware Mask-Free Virtual Try-On via High-Fidelity Image Synthesis

TAMF-VTON:通过高保真图像合成实现纹理感知无掩码虚拟试穿

Jie Wang, Qian He, Gaofeng He, Xiaogang Jin, Huamin Wang

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Style3D Research China(中国凌迪科技风格实验室)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 TAMF-VTON旨在解决虚拟试穿方法局限,通过统一生成管道,含轻量级专家混合适应方案、频域监督机制和强大数据管理管道,实现无掩码、多服装组合、纹理保留及高效推理,优于现有方法,为数字时尚提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19946 2026-07-17 cs.CV cs.AI 版本更新 83%

When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators

当漂亮并不有用:调查现代文本到图像模型为何无法作为可靠的训练数据生成器

Krzysztof Adamkiewicz, Brian Bernhard Moser, Stanislav Frolov, Tobias Christian Nauen, Federico Raue, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究发现现代文本到图像模型在生成合成数据时性能下降,揭示其生成的数据分布狭窄且缺乏多样性,挑战了生成现实感进步即意味着数据现实感进步的假设。

Comments Accepted to CVPR26, Project Page: https://bill2462.github.io/When-Pretty-Isn-t-Useful-page/, Code: https://github.com/Bill2462/When-Pretty-Isn-t-Useful-codebase

详情

展开后加载摘要…

URL PDF HTML 收藏