arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-28 至 2026-04-28 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2604.22847 2026-04-28 cs.CV 77%

Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes

Dream-Cubed:通过训练数十亿个立方体实现Minecraft中的可控生成建模

Tim Merino, Sam Earle, Ryunosuke Iwai, Julian Togelius, Edoardo Cetin

机构 * New York University(纽约大学) Sakana AI

专题命中 可控生成 :inpainting(abstract,abstract_cn);diffusion(abstract);分类 cs.CV

AI总结 本文提出Dream-Cubed数据集及基于立方体的生成模型,用于高效生成交互式3D环境,通过分析扩散模型的不同形式和架构,评估生成质量并释放预训练模型以推动未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24459 2026-04-28 cs.CV 70%

TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering

TextGround4M:一种对齐提示的布局感知文本渲染数据集

Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang

机构 * Central South University(中南大学) Zhejiang University(浙江大学) Microsoft Research(微软研究院)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出TextGround4M数据集,通过细粒度布局监督提升文本生成的准确性,引入轻量训练策略和布局评估指标,验证了布局感知在文本到图像生成中的重要性。

Comments aaai poster; Project page: https://dongxingmao.github.io/TextGround4M.github.io/

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, vol. 40, no. 10, pp. 7918-7926, Mar. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23540 2026-04-28 cs.CV 70%

Oracle Noise: Faster Semantic Spherical Alignment for Interpretable Latent Optimization

Oracle Noise: 更快的语义球面对齐用于可解释的潜在优化

Haosen Li, Wenshuo Chen, Lei Wang, Shaofeng Liang, Haozhe Jia, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Griffith University & Data61/CSIRO(格里菲斯大学及Data61/CSIRO)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Oracle Noise框架,通过将噪声初始化重新定义为语义驱动的优化,严格限制在黎曼流形上,以提升文本到图像扩散模型的语义对齐效率和图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19019 2026-04-28 cs.CV 57%

TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery

TokenTrace: 通过水印标记令牌恢复实现多概念归因

Li Zhang, Shruti Agarwal, John Collomosse, Pengtao Xie, Vishal Asnani

机构 * Adobe Research(Adobe研究院) University of California, San Diego(加州大学圣地亚哥分校) DECaDE, University of Surrey(Surrey大学DECaDE实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TokenTrace框架,通过在语义域中嵌入秘密签名,实现对生成图像中多个概念的鲁棒归因,实验表明其在单概念和多概念归因任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24108 2026-04-28 math.OC math.AP 50%

Optimal control for a fourth-order nonisothermal tumor growth model of Caginalp type

四阶非等温Caginalp型肿瘤生长模型的最优控制

Cavalleri Giulia, Pierluigi Colli, Elisabetta Rocca

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了一种非等温Caginalp型相场模型的分布式最优控制问题,考虑了热疗下肿瘤生长的数学建模,结合Cahn-Hilliard方程、热平衡方程和营养浓度反应扩散方程,分析了最优控制的存在性及变分不等式条件。

Comments 35 pages. The keywords are: tumor growth model, Cahn--Hilliard system, nonisothermal model, optimal control, adjoint system, necessary optimality conditions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23370 2026-04-28 math.OC cs.AI cs.LG cs.SY eess.SY stat.ML 50%

Nonlinear Non-Gaussian Density Steering with Input and Noise Channel Mismatch: Sinkhorn with Memory for Solving the Control-affine Schrödinger Bridge Problem

非线性非高斯密度操控与输入和噪声通道不匹配:具有记忆的Sinkhorn方法用于求解控制-仿射Schrödinger桥问题

Georgiy A. Bondar, Asmaa Eldesoukey, Yongxin Chen, Abhishek Halder

机构 * Department of Applied Mathematics, University of California Santa Cruz(加州大学圣克鲁兹分校应用数学系) Department of Aerospace Engineering, Iowa State University(爱荷华州立大学航空航天工程系) School of Aerospace Engineering, Georgia Institute of Technology(佐治亚理工学院航空航天工程学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种具有记忆的Sinkhorn递归方法,用于解决控制-仿射Schrödinger桥问题中的输入和噪声通道不匹配问题,通过非线性PDEs结构证明了算法的局部稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏