arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-21 至 2026-05-21 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2605.21116 2026-05-21 eess.IV 85%

GeoDiff-SAR II: 3D-Driven Foundation Diffusion Models for SAR Generation via Decoupled Control

GeoDiff-SAR II: 3D-Driven Foundation Diffusion Models for SAR Generation via Decoupled Control

Xuanting Wu, Fan Zhang, Fei Ma, Yingbing Liu, Lingxiao Peng, Qiang Yin, Yongsheng Zhou

专题命中 可控生成 :diffusion(title,title_cn);image generation(abstract)

AI总结 本文提出GeoDiff-SAR II,一种基于3D模型引导的解耦框架,用于通过解耦控制生成合成孔径雷达图像,通过物理基础的几何-电磁线索实现对关键成像参数的可控生成。

Comments 23 pages,14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21343 2026-05-21 cs.CV 79%

OcclusionFormer: Arranging Z-Order for Layout-Grounded Image Generation

OcclusionFormer: 布局导向图像生成中的Z轴顺序安排

Ziye Li, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China(大数据研究院,计算机科学与人工智能学院,复旦大学,中国)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出OcclusionFormer,一种基于Z轴顺序的扩散变换框架,通过解耦实例并利用体积渲染进行合成,以解决布局到图像模型中物体间遮挡问题,并通过查询对齐损失提升空间精度和语义一致性。

Comments ICML 2026, Project Page: https://henghuiding.com/OcclusionFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21381 2026-05-21 cs.CV cs.LG 57%

Disentangling Generation and Regression in Stochastic Interpolants for Controllable Image Restoration

解耦生成与回归在可控图像恢复中的随机插值

Yi Liu, Jia Ma, Wengen Li, Jihong Guan, Shuigeng Zhou, Yichao Zhang

机构 * Tongji University(同济大学) Fudan University(复旦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DiSI框架,通过解耦随机插值过程中的生成与回归组件,实现从纯回归到全生成的连续可控过渡,提升图像恢复任务的效率和精度。

Comments 44 pages, 16 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20733 2026-05-21 cs.CV 57%

Sketch2MinSurf: Vision-Language Guided Generation of Editable Minimal Surfaces from Hand-Drawn Sketches

Sketch2MinSurf: 通过视觉-语言引导从手绘草图生成可编辑的最小曲面

Wenda Wang, Anqi Liu, Junqi Yang, Lei He, Luying Wang, Jiachen Lu, Weixin Huang

机构 * School of Architecture, Tsinghua University(清华大学建筑学院) Department of Architecture, National University of Singapore(新加坡国立大学建筑系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出Sketch2MinSurf方法,结合视觉-语言引导和几何优化,从手绘草图生成平滑且可编辑的3D曲面,通过空间-拓扑编码和Sketch2MinSurf结构损失函数实现拓扑一致性与几何重建的联合约束。

Comments 22 pages, 16 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14417 2026-05-21 cs.RO cs.CV 57%

Before the Body Moves: Learning Anticipatory Joint Intent for Language-Conditioned Humanoid Control

在身体移动之前:为语言条件的人形控制学习预见性关节意图

Haozhe Jia, Honglei Jin, Yuan Zhang, Youcheng Fan, Shaofeng Liang, Lei Wang, Shuxu Jin, Kuimou Yu, Zinuo Zhang, Jianfei Song, Wenshuo Chen, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动态技术有限公司) Shandong University(山东大学) Data61/CSIRO Griffith University(格里菲斯大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(深度感知技术研究院,江苏省工业技术研究院(JITRI))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DAJI框架,通过学习语言生成与闭环控制之间的预见性关节意图接口,解决语言条件人形机器人中预见未来物理转换的需求,实现了在HumanML3D风格生成和BABEL任务中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09060 2026-05-21 cs.AI cs.CV 57%

Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching

让轨迹扩散:用于多样化流匹配的质量保持控制

Jingxuan Wu, Zhenglin Wan, Xingrui Yu, Yuzhe Yang, Bo An, Ivor Tsang, Yang You

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) CFAR, Agency for Science, Technology and Research, Singapore(新加坡科技研究局CFAR) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的推理时控制机制,使流本身具备多样性意识,通过几何上与模式质量寻求方向解耦的引导来鼓励轨迹横向扩散,同时通过时间调度的随机扰动重新引入不确定性,从而在不降低图像细节和提示忠实度的情况下提升多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20593 2026-05-21 math.OC math.PR 50%

Viscosity Solutions of Stochastic Hamilton--Jacobi--Bellman Equations with Jumps

具有跳跃的随机Hamilton-雅可比-贝尔曼方程的粘性解

Dunxiang Liang, Qingxin Meng

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了跳跃扩散过程的随机最优控制及相关的非线性反向随机Hamilton-雅可比-贝尔曼方程,通过反向半群建立动态规划原理以刻画价值函数,并引入基于半鞅测试函数和全局切线条件的随机粘性解框架来处理非局部积分微分算子和多项式增长问题,最后在超抛物性条件下建立弱比较原理并证明了全局唯一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08155 2026-05-21 cs.LG 50%

C$^2$FG: Control Classifier-Free Guidance via Score Discrepancy Analysis

C$^2$FG: 通过分数差异分析实现控制分类器无关引导

Jiayang Gao, Tianyi Zheng, Jiayang Zou, Fengxiang Yang, Shice Liu, Luyao Fan, Zheyu Zhang, Hao Zhang, Jinwei Chen, Peng-Tao Jiang, Bo Li, Jia Wang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo BlueImage Lab(vivo 蓝影实验室) vivo Mobile Communication Co., Ltd.(vivo 通信有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出C$^2$FG,一种基于分数差异分析的控制分类器无关引导方法,通过严格理论分析建立了条件分布与无条件分布在不同时间步的分数差异上界,从而为时间依赖引导提供了理论基础,并通过实验验证了其在多种生成任务中的有效性。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20433 2026-05-21 cs.RO 50%

Spacetime Optimal-Transport Attention for Visuo-Haptic Imitation Learning of Contact-Rich Manipulation

时空最优传输注意力用于视觉-触觉模仿学习中的富接触操作

Yue Feng, Weicheng Huang, I-Ming Chen

机构 * Robotics Research Centre, School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(机器人研究中心,机械与航空航天工程学院,南洋理工大学,新加坡) Wings Robotics(Wings机器人)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种三模态融合框架Spacetime Optimal-Transport Attention (SO-TA),通过熵正则化的最优传输对力-姿态衍生的子查询和视觉块进行对齐,以解决富接触操作中多模态信息融合的问题,并在真实机器人任务中实现了高成功率。

Comments 8 pages, 16 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02352 2026-05-21 math.OC econ.GN math.PR q-fin.EC 50%

Stochastic Optimal Control with Measurable Coefficients and Applications

具有可测系数的随机最优控制及其应用

Filippo de Feo

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了具有可测系数的无限时间随机最优控制问题,通过$L^p$-粘性解理论证明了HJB方程的解的存在性,并建立了最优控制的验证定理,首次在该领域提出了可测系数下的完全非线性随机最优控制问题的解决方案。

Comments Accepted for publication on SIAM Journal on Control and Optimization

详情

展开后加载摘要…

URL PDF HTML 收藏