arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-01 至 2026-07-01 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2606.32039 2026-07-01 cs.CV 新提交 85%

GEAR: Guided End-to-End AutoRegression for Image Synthesis

GEAR: 引导式端到端自回归图像合成

Bin Lin, Zheyuan Liu, Chenguo Lin, Sixiang Chen, Yunyang Ge, Yunlong Lin, Jianwei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Li Yuan

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12893 2026-07-01 cs.CV cs.AI cs.LG cs.NE stat.ML 版本更新 83%

Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models

文本到图像模型强化学习后训练的有限差分流优化

David McAllister, Miika Aittala, Tero Karras, Janne Hellsten, Angjoo Kanazawa, Timo Aila, Samuli Laine

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 文生图 :text-to-image(title);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。

Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31711 2026-07-01 cs.AI 新提交 50%

Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist

Arena-T2I Hard:基于依赖感知清单的忠实性基准测试与改进

Yuanhao Ban, Tong Xie, Sohyun An, Yunqi Hong, Evan Frick, I-Hung Hsu, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

机构 * Arena Intelligence Inc UCLA(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract)

AI总结 针对现有忠实性基准在复杂指令上的不足,提出310条压力测试提示集Arena-T2I Hard,并设计依赖感知清单奖励结合美学奖励,显著提升文本到图像模型的忠实性-美学权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏