arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-19 至 2026-05-19 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2605.16842 2026-05-19 cs.AI 82%

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

草图然后绘画:用于扩散多模态大语言模型的分层强化学习

Siqi Luo, Jianghan Shen, Yi Xin, Huayu Zheng, Haoxing Chen, Yan Tai, Yue Li, Junjun He, Yihao Liu, Guangtao Zhai, Yuewen Cao, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出了一种分层强化学习方法HT-GRPO,通过Sketch-Then-Paint训练方案和分层信用分配机制,解决扩散多模态大语言模型在强化学习优化中的关键问题,提升图像质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16961 2026-05-19 cs.CV cs.AI 79%

Latent Action Control for Reasoning-Guided Unified Image Generation

潜在动作控制用于推理引导的统一图像生成

Fuxiang Zhai, Sixiang Chen, Yingjin Li, Shuaibo Li, Jianyu Lai, Tengjun Huang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出Latent Action Control (LAC),通过将推理表示为隐藏的连续动作,使推理过程可操作,从而在统一生成器中实现推理引导的图像生成。LAC通过角色结构化的潜在轨迹进行规划、内部视觉草图、诊断和细化,并将这些动作注入到条件流生成的隐藏流中,从而提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18735 2026-05-19 cs.CV cs.GR cs.LG 62%

PIXLRelight: Controllable Relighting via Intrinsic Conditioning

PIXLRelight: 通过内在条件实现可控的图像重照明

Miguel Farinha, Ronald Clark

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 PIXLRelight通过内在条件将物理基础渲染与学习图像合成相结合,实现对单图像重照明的可控性,其核心方法是利用真实照片或PBR渲染得到的内在条件进行训练和推理,从而在保证图像细节的同时实现高质量的重照明效果。

Comments Project page: https://mlfarinha.github.io/pixl-relight/. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16355 2026-05-19 cs.GR cs.CV 62%

Generative 3D Gaussians with Learned Density Control

具有学习密度控制的生成3D高斯

Runjie Yan, Yan-Pei Cao, Peng Wang, Ding Liang, Yuan-Chen Guo

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Density-Sampled Gaussians (DeG),通过学习概率密度函数实现3D表示的自适应密度控制,结合渲染监督优化空间密度和高斯属性,提升单图到3D生成的质量。

Comments 19 pages, 16 figures, SIGGRAPH Conference Papers '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19102 2026-05-19 cs.RO cs.AI cs.CV 57%

FUNCanon: Learning Pose-Aware Action Primitives via Functional Object Canonicalization for Generalizable Robotic Manipulation

FUNCanon: 通过功能对象规范化学习姿态感知的动作原语以实现通用的机器人操作

Hongli Xu, Lei Zhang, Xiaoyue Hu, Boyang Zhong, Kaixin Bai, Zoltán-Csaba Márton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FUNCanon框架,通过功能对象规范化学习姿态感知的动作原语,以实现通用的机器人操作,该方法将长周期操作任务分解为由主体、动词和对象定义的动作片段,从而提升策略的可组合性和可重用性。

Comments project website: https://sites.google.com/view/funcanon, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16810 2026-05-19 cs.CV 57%

Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending

无需训练的遮挡文本渲染:通过字形先验和注意力引导的语义融合

Jingqi Hou, Hongtian Wang

机构 * College of Computer Science, Beijing University of Technology, Beijing, China(北京理工大学计算机学院)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的遮挡文本渲染框架,通过预训练的FLUX.1-dev模型,解决文本生成中遮挡物位置和文本结构稳定性问题,采用双流推理和字形先验稳定文本结构,提升文本可读性和遮挡对齐效果。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18381 2026-05-19 cs.LG 50%

Generating Physically Consistent Molecules with Energy-Based Models

生成具有物理一致性的分子的基于能量模型

Christoph Griesbacher, Lea Bogensperger, Andreas Habring, Thomas Pock

机构 * Graz University of Technology(格拉茨技术大学) University of Zurich(苏黎世大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于能量模型(EBM)的方法EBMol,用于生成三维分子,通过学习原子可加的标量势能恢复了能量归纳偏差,从而在QM9和GEOM-Drugs数据集上实现了最先进的性能,并展示了学习的能量景观作为质量度量用于配置排序和过滤,以及通过形状引导采样实现可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17740 2026-05-19 math.NA cs.NA math.OC 50%

Two-scale neural networks for optimal control of linear convection-dominated equations

用于线性对流主导方程最优控制的双尺度神经网络

Sijing Liu, Marcus Sarkis, Yi Zhang, Zhongqiang Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种双尺度神经网络方法,用于求解由对流主导的对流-扩散-反应方程所支配的最优控制问题。该方法基于针对奇异摄动前向问题开发的双尺度架构,通过引入适当缩放的特征来增强空间输入,当扩散系数变小时这些特征变得越来越重要。该方法分别使用神经网络处理最优系统的状态和伴随状态变量,反映了由于相反的对流场,这些量在域的不同部分发展出尖锐层的事实。通过为两个网络选择不同的中心点,架构自然地与每个变量的层位置对齐。本文提出了两种方法形式,一种基于一阶最优性条件,另一种使用惩罚PDE约束,并将其与逐步训练策略结合,逐步将扩散系数降至目标值。数值实验在基准问题上展示了所提出方法的有效性和行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16823 2026-05-19 cond-mat.stat-mech cond-mat.mes-hall physics.app-ph physics.chem-ph 50%

Engineering Ratchet-Based Particle Separation via Shortcuts to Isothermality

通过‘等温性捷径’实现基于棘轮的粒子分离工程

Xiu-Hua Zhao, Z. C. Tu, Yu-Han Ma

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种非平衡热力学方法,利用‘等温性捷径’概念,实现对过阻尼布朗粒子的可控分离,展示了不同扩散系数的粒子在预设D*下向不同方向运动,并揭示了额外能量成本和准静态功消耗。

Comments 5 pages, 3 figures + Supplemental Materials (10 pages, 4 figures). Comments are welcome!

Journal ref Physical Review E 110, 034105 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16964 2026-05-19 eess.AS 50%

SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis

SemaVoice: 基于语义的连续自回归语音合成

Huimeng Wang, Hui Lu, Jiajun Deng, Haoning Xu, Youjun Chen, Xueyuan Chen, Zhaoqing Li, Shuhai Peng, Shiyin Kang, Xunying Liu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出SemaVoice,一种语义感知的连续自回归语音合成框架,旨在解决零样本文本到语音合成中语义-语音建模与重建驱动的连续语音表示之间的不匹配问题,通过引入Speech Foundation Model(SFM)引导对齐机制提升语音合成的高质量和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏