arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

1712.07778 2017-12-22 cs.CV 79%

Context-Aware Semantic Inpainting

Haofeng Li, Guanbin Li, Liang Lin, Yizhou Yu

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.00212 2017-11-23 cs.CV 79%

Depth Structure Preserving Scene Image Generation

Wendong Zhang, Bingbing Ni, Yichao Yan, Jingwei Xu, Xiaokang Yang

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

Comments There is an error in the first paragraph in Section 4.4. Actually, we train and test another new CGAN model with the input in our model to evaluate the improvements. This error can lead readers misunderstand the improvements of our model and make the comparison unfair. Therefore, we request to withdraw the current submission and will submit a final version later

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.01560 2017-08-03 cs.CV cs.LG 79%

LR-GAN: Layered Recursive Generative Adversarial Networks for Image Generation

Jianwei Yang, Anitha Kannan, Dhruv Batra, Devi Parikh

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

Comments 21 pages, 22 figures, published as a conference paper at ICLR 2017, code available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.05817 2017-08-02 cs.CV 79%

Depth Image Inpainting: Improving Low Rank Matrix Completion with Low Gradient Regularization

Hongyang Xue, Shengming Zhang, Deng Cai

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.07539 2017-07-14 cs.CV 79%

Semantic Image Inpainting with Deep Generative Models

Raymond A. Yeh, Chen Chen, Teck Yian Lim, Alexander G. Schwing, Mark Hasegawa-Johnson, Minh N. Do

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00835 2016-12-06 cs.CV cs.LG 79%

Scribbler: Controlling Deep Image Synthesis with Sketch and Color

Patsorn Sangkloy, Jingwan Lu, Chen Fang, Fisher Yu, James Hays

专题命中 可控生成 :image synthesis(title,abstract);分类 cs.CV

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.03500 2015-11-24 cs.CV cs.CL 79%

Unveiling the Dreams of Word Embeddings: Towards Language-Driven Image Generation

Angeliki Lazaridou, Dat Tien Nguyen, Raffaella Bernardi, Marco Baroni

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

Comments A 6-page version to appear at the Multimodal Machine Learning NIPS 2015 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02873 2026-01-22 cs.RO 79%

Warm-Starting Collision-Free Model Predictive Control With Object-Centric Diffusion

基于物体中心扩散的无碰撞模型预测控制暖启动

Arthur Haffemayer, Alexandre Chapin, Armand Jordana, Krzysztof Wojciechowski, Florent Lamiraux, Nicolas Mansard, Vladimir Petrik

机构 * LAAS-CNRS, Université de Toulouse, CNRS(拉夫堡-安德鲁·马歇尔研究中心,图卢兹大学,法国国家科学研究中心) Artificial and Natural Intelligence Toulouse Institute(图卢兹人工智能与自然智能研究所) Continental(大陆集团) Ecole Centrale de Lyon, LIRIS(里昂高等工程师学院,LIRIS研究所) CIIRC, Czech Technical University in Prague(布拉格捷克技术大学智能信息研究中心)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出一种结合扩散模型和MPC的无碰撞运动生成方法,通过物体中心表示和碰撞感知控制实现高效可靠运动生成。

Comments An open-source implementation is provided https://ahaffemayer.github.io/diffusion_warmstart_slot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23738 2025-11-26 cs.CV cs.GR 79%

How Animals Dance (When You're Not Looking)

动物跳舞(当你不在看的时候)

Xiaojuan Wang, Aleksander Holynski, Brian Curless, Ira Kemelmacher, Steve Seitz

机构 * University of Washington(华盛顿大学) Columbia University(哥伦比亚大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 该研究提出了一种生成音乐同步且具有舞蹈意识的动物跳舞视频的框架,通过引入舞蹈模式和图优化问题实现高效舞蹈合成。

Comments Project page: https://how-animals-dance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05039 2023-12-11 cs.CV cs.AI cs.HC cs.LG cs.MM 79%

SmartMask: Context Aware High-Fidelity Mask Generation for Fine-grained Object Insertion and Layout Control

Jaskirat Singh, Jianming Zhang, Qing Liu, Cameron Smith, Zhe Lin, Liang Zheng

专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14190 2026-08-06 cs.LG 版本更新 78%

Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation

对比扩散对齐:用于可控生成的结构化潜在学习

Ruchi Sandilya, Sumaira Perez, Charles Lynch, Lindsay Victoria, Benjamin Zebley, Derrick Matthew Buchanan, Mahendra T. Bhati, Nolan Williams, Timothy J. Spellman, Faith M. Gunning, Conor Liston, Logan Grosenick

机构 * Department of Psychiatry, Weill Cornell Medicine, New York, NY, USA(威立·科林斯医学中心精神科) Department of Psychiatry, Stanford University, Stanford, CA, USA(斯坦福大学精神科) Department of Neuroscience, University of Connecticut School of Medicine, Farmington, CT, USA(康涅狄格大学医学院神经科学系)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 ConDA通过对比学习在扩散模型中学习结构化潜在空间,实现可控生成和动态解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18637 2026-07-22 cs.RO cs.LG 新提交 78%

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

用于逼真且可控的视觉交通场景生成的端到端条件扩散

Jingzheng Li, Yufei Ge, Zhijun Chen, Qianren Mao, Zizhe Wang, Binhang Qi, Bing Li, Keyu Chen, Baochang Zhang, Xianglong Liu, Philip S Yu

机构 * Zhongguancun Laboratory(中关村实验室) Tianjin University(天津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) State Key Laboratory of Software Development Environment(软件开发环境国家重点实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 研究如何生成逼真且可控的视觉交通场景,提出端到端条件扩散框架E2E-CDiff,基于前视图视觉观察联合去噪未来运动状态等,减轻规划控制不匹配,实验表明其在可控性与逼真性权衡上表现良好,还能引发挑战性交互,作为自我规划器有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10243 2026-07-14 cs.RO cs.SY eess.SY 新提交 78%

Diffusion-Residual Model Predictive Steering Control for Vehicle Stabilization at the Limit of Handling under Model Uncertainty

模型不确定性下车辆极限操控时基于扩散残差模型预测的转向控制实现车辆稳定

Bongsob Song

机构 * Ajou University(韩国亚洲大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 研究在模型不确定性下车辆极限操控时的稳定问题,核心方法是用条件扩散残差模型学习不确定性并应用于控制器参考值和约束,主要贡献是降低峰值侧滑、恢复低摩擦操控方向稳定性,且算法运行高效。

Comments 16 pages, 6 figures, 7 tables. Submitted to IEEE Transactions on Control Systems Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09588 2026-07-14 eess.IV q-bio.QM 版本更新 78%

Diffusion-Based Quality Control of Medical Image Segmentations across Organs

基于扩散的质量控制用于跨器官医学图像分割

Vincenzo Marcianò, Hava Chaptoukaev, Virginia Fernandez, M. Jorge Cardoso, Sébastien Ourselin, Michela Antonelli, Maria A. Zuluaga

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出nnQC框架,通过扩散生成模型实现跨器官医学图像分割的质量控制,有效解决现有方法的通用性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14945 2026-06-25 cs.RO cs.AI 版本更新 78%

TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control

TIDAL: 时间交错扩散与动作循环用于高频VLA控制

Yuteng Sun, Haoran Wang, Ruofei Bai, Zhengguo Li, Jun Li, Meng Yee Michael Chuah, Wei Yun Yau

机构 * Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(信息通信研究所(I²R),A*STAR,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出TIDAL分层框架,通过双频架构解耦语义推理与高频执行,实现边缘硬件上约9Hz控制更新,在动态拦截任务中性能提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14275 2026-06-23 eess.AS cs.AI cs.SD 版本更新 78%

Controllable Accent Normalization via Discrete Diffusion

通过离散扩散实现可控口音标准化

Qibing Bai, Yuhan Du, Tom Ko, Shuai Wang, Yannan Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Tencent Ethereal Audio Lab(腾讯虚音频实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出DLM-AN系统,利用掩蔽离散扩散和自监督语音令牌,通过选择性重用源令牌控制口音强度,结合流匹配时长比预测器调整节奏,实现低词错误率和可解释的口音强度控制。

Comments Accepted to Interspeech 2026 as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16345 2026-06-16 math.OC cs.SY eess.SY 新提交 78%

Output-Feedback Boundary Control of Reaction--Diffusion PDEs on Arbitrary Lipschitz Domains: A Target-Domain Approach

任意Lipschitz域上反应-扩散PDE的输出反馈边界控制:一种目标域方法

Rafael Vazquez

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出一种域扩展框架,通过将不规则域嵌入已知稳定设计的目标域(如球或矩形),实现任意有界Lipschitz域上反应-扩散方程的输出反馈边界镇定,并保证适定性和指数稳定性。

Comments Preprint submitted to IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08946 2026-06-16 stat.CO physics.chem-ph physics.comp-ph 新提交 78%

A Diffusion Monte Carlo algorithm employing depth first traversal and a stack instead of a swarm

一种采用深度优先遍历和栈而非群体的扩散蒙特卡罗算法

Bastiaan J. Braams

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出基于深度优先遍历和栈的扩散蒙特卡罗算法(DMCD),通过栈管理分裂历史,相比传统广度优先群体方法更节省内存,并统一了特征值问题与线性方程问题的算法处理。

Comments 12 pages. The code in the original (v1) Arxiv submission could randomly get trapped in a cycle where the same walker is all the time restarted with ever decreasing weight. The issue is described and addressed in this (v2) submission

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.00915 2026-06-04 math.NA cs.NA 78%

Radial basis function methods for optimal control of the convection-diffusion equation

径向基函数方法用于对流-扩散方程的最优控制

Pedro González Casanova, Jorge Zavaleta

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出两种局部径向基函数方法,用于解决对流-扩散控制问题,通过预处理技术缓解病态问题,提高计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.04914 2026-06-04 math.OC cs.SY eess.SY 78%

Boundary Control of Coupled Reaction-Advection-Diffusion Systems with Spatially-Varying Coefficients

具有空间变化系数的耦合反应-对流-扩散系统的边界控制

Rafael Vazquez, Miroslav Krstic

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文研究了具有空间变化系数的耦合反应-对流-扩散系统边界稳定化问题,通过回溯法证明了H^1稳定性,并揭示了回溯核在抛物型与双曲型问题间的联系。

Comments Submitted to IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.06641 2026-06-04 math.OC cs.SY eess.SY 78%

Boundary Control of Reaction-Diffusion PDEs on Balls in Spaces of Arbitrary Dimensions

球体上任意维数反应扩散PDEs的边界控制

Rafael Vazquez, Miroslav Krstic

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出一种显式输出反馈边界反馈律,利用边界测量稳定不稳定线性定系数反应扩散方程,通过回步法设计控制律和边界观测器,利用球面谐波将系统转化为无限序列的1D系统,并在H^1空间证明了系统well-posedness和稳定性。

Comments Submitted to ESAIM: Control and Calculus of Variations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29626 2026-05-29 cs.CL cs.AI 78%

DLM-SWAI: Steering Diffusion Language Models Before They Unmask

DLM-SWAI: 在扩散语言模型去掩码之前引导它们

Hyeseon An, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出一种无需训练的引导方法DLM-SWAI,通过预计算的词级风格分数在去噪步骤中偏置词分布,实现扩散语言模型的可控生成。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12775 2026-05-14 math.OC 78%

Indefinite Stochastic LQ Optimal Control for Jump-Diffusion Systems with Random Coefficients

不定性随机线性二次最优控制:具有随机系数的跳跃扩散系统

Xinyu Ma, Qingxin Meng

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文研究具有随机系数的跳跃扩散系统中的不定性随机线性二次最优控制问题,通过构造代数逆流提取价值函数的半鞅核,并证明其满足带跳跃的广义随机矩阵方程,无需松弛技术或额外可逆性假设,扩展了经典不定性LQ理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08965 2026-05-04 cs.LG cs.AI 78%

Semantic Level of Detail for Knowledge Graphs: Discovering Abstraction Boundaries via Spectral Heat Diffusion

知识图谱的语义层次细节:通过谱热扩散发现抽象边界

Edward Izgorodin

机构 * Mnemoverse.AI, Funchal, Madeira, Portugal(Mnemoverse.AI,法赫尔,马德拉,葡萄牙)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出SLoD框架,通过谱热扩散在图拉普拉斯上定义连续缩放操作,解决知识图谱中抽象层次边界检测问题,实验证明其在合成数据和WordNet中的有效性。

Comments v2: extended companion of GRAAI 2026 workshop paper; full proofs of Lemmas A.1-A.2 (Frechet-mean and heat-kernel Lipschitz constants, corrected) in Appendix A; Proposition 1(i) empirical anchor (new Figure 1); 50-seed ablation with BCa CIs and Wilcoxon tests (Tables 3-4, p<10^-15); WordNet retained (tau=0.79). 21 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04057 2026-04-07 cs.IT math.IT 78%

CTD-Diff: Cooperative Time-Division Diffusion for Multi-User Semantic Communication Systems

CTD-Diff: 多用户语义通信系统中的协作时分扩散

Chengyang Liang, Dong Li

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出CTD-Diff框架,通过时分多址技术实现多用户协作,将物理信道噪声转化为扩散噪声,提升低信噪比下的语义通信可靠性与重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10402 2026-03-18 cs.LG cs.AI cs.CE 78%

Controllable Graph Generation with Diffusion Models via Inference-Time Tree Search Guidance

通过推理时间树搜索引导实现可控图生成

Jiachi Zhao, Zehong Wang, Yamei Liao, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学) Independent Researcher(独立研究者) University of Connecticut(康涅狄格大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出TreeDiff框架,通过MCTS引导双空间扩散模型实现可控图生成,解决传统方法控制不足的问题,实验显示其在分子生成中表现优异。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09031 2026-03-11 cs.RO 78%

ImpedanceDiffusion: Diffusion-Based Global Path Planning for UAV Swarm Navigation with Generative Impedance Control

阻抗扩散:基于扩散的全局路径规划用于无人机群导航的生成阻抗控制

Faryal Batool, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Roohan Ahmed Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科夫科学与技术研究所)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 ImpedanceDiffusion通过结合扩散模型和人工势场跟踪,实现无人机群在复杂环境中的可靠路径规划与自适应阻抗控制。

Comments This is paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04366 2026-03-05 cs.SD cs.AI cs.LG 78%

Low-Resource Guidance for Controllable Latent Audio Diffusion

低资源指导的可控潜在音频扩散

Zachary Novack, Zack Zukowski, CJ Carr, Julian Parker, Zach Evans, Josiah Taylor, Taylor Berg-Kirkpatrick, Julian McAuley, Jordi Pons

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出了一种低计算开销的可控潜在音频扩散方法,通过潜在控制头实现对音频强度、音高和节拍的精确控制,同时保持生成质量。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01553 2026-03-03 cs.AI cs.LG 78%

State-Action Inpainting Diffuser for Continuous Control with Delay

具有延迟的连续控制状态-动作修复扩散器

Dongqi Han, Wei Wang, Enze Zhang, Dongsheng Li

机构 * University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiaotong University(上海交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :inpainting(title,abstract)

AI总结 SAID通过结合动力学学习和策略优化,提出了一种具有延迟的连续控制新方法,实现了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01478 2026-03-03 cs.NI 78%

Regularized Diffusion-based Contract Model for Covert Semantic Entropy Control in LAENets

基于正则化扩散的合同模型用于LAENets中的隐秘语义熵控制

Yansheng Liu, Jinbo Wen, Kun Zhu, Yang Zhang, Jiawen Kang

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出基于正则化扩散的合同模型,用于LAENets中的隐秘语义熵控制,通过调整语义抽象级别提升任务信息传输可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏