arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-19 至 2026-05-19 共收录 214 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2605.18381 2026-05-19 cs.LG 50%

Generating Physically Consistent Molecules with Energy-Based Models

生成具有物理一致性的分子的基于能量模型

Christoph Griesbacher, Lea Bogensperger, Andreas Habring, Thomas Pock

机构 * Graz University of Technology(格拉茨技术大学) University of Zurich(苏黎世大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于能量模型(EBM)的方法EBMol,用于生成三维分子,通过学习原子可加的标量势能恢复了能量归纳偏差,从而在QM9和GEOM-Drugs数据集上实现了最先进的性能,并展示了学习的能量景观作为质量度量用于配置排序和过滤,以及通过形状引导采样实现可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17740 2026-05-19 math.NA cs.NA math.OC 50%

Two-scale neural networks for optimal control of linear convection-dominated equations

用于线性对流主导方程最优控制的双尺度神经网络

Sijing Liu, Marcus Sarkis, Yi Zhang, Zhongqiang Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种双尺度神经网络方法,用于求解由对流主导的对流-扩散-反应方程所支配的最优控制问题。该方法基于针对奇异摄动前向问题开发的双尺度架构,通过引入适当缩放的特征来增强空间输入,当扩散系数变小时这些特征变得越来越重要。该方法分别使用神经网络处理最优系统的状态和伴随状态变量,反映了由于相反的对流场,这些量在域的不同部分发展出尖锐层的事实。通过为两个网络选择不同的中心点,架构自然地与每个变量的层位置对齐。本文提出了两种方法形式,一种基于一阶最优性条件,另一种使用惩罚PDE约束,并将其与逐步训练策略结合,逐步将扩散系数降至目标值。数值实验在基准问题上展示了所提出方法的有效性和行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16823 2026-05-19 cond-mat.stat-mech cond-mat.mes-hall physics.app-ph physics.chem-ph 50%

Engineering Ratchet-Based Particle Separation via Shortcuts to Isothermality

通过‘等温性捷径’实现基于棘轮的粒子分离工程

Xiu-Hua Zhao, Z. C. Tu, Yu-Han Ma

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种非平衡热力学方法,利用‘等温性捷径’概念,实现对过阻尼布朗粒子的可控分离,展示了不同扩散系数的粒子在预设D*下向不同方向运动,并揭示了额外能量成本和准静态功消耗。

Comments 5 pages, 3 figures + Supplemental Materials (10 pages, 4 figures). Comments are welcome!

Journal ref Physical Review E 110, 034105 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16964 2026-05-19 eess.AS 50%

SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis

SemaVoice: 基于语义的连续自回归语音合成

Huimeng Wang, Hui Lu, Jiajun Deng, Haoning Xu, Youjun Chen, Xueyuan Chen, Zhaoqing Li, Shuhai Peng, Shiyin Kang, Xunying Liu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出SemaVoice,一种语义感知的连续自回归语音合成框架,旨在解决零样本文本到语音合成中语义-语音建模与重建驱动的连续语音表示之间的不匹配问题,通过引入Speech Foundation Model(SFM)引导对齐机制提升语音合成的高质量和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 3 篇

2601.20306 2026-05-19 cs.CV 79%

TPGDiff: Hierarchical Triple-Prior Guided Diffusion for Image Restoration

TPGDiff: 基于三级先验引导的图像修复扩散网络

Yanjie Tu, Qingsen Yan, Axi Niu, Jiacong Tang

机构 * School of Computer Science, Northwestern Polytechnical University, Xi'an, China(西北工业大学计算机学院,西安,中国) Shenzhen Research Institute of Northwestern Polytechnical University, Shenzhen, China(西北工业大学深圳研究院,深圳,中国)

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 TPGDiff通过整合降质先验、结构先验和语义先验,实现图像修复的分层引导,提升严重降质区域的重建能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16396 2026-05-19 cs.CV cs.LG 70%

Beyond MMSE: Enhancing PnP Restoration with ProxiMAP

超越MMSE:通过ProxiMAP增强PnP修复

Kenta Vert, Giacomo Meanti, Scott Pesme, Michael Arbel, Julien Mairal

机构 * Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家科学研究中心) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔理工大学) LJK(实验室) MaLGa Centre(MaLGa中心) DIBRIS(DIBRIS研究所) Università di Genova(热那亚大学) MMS(MMS机构) Italian Institute of Technology(意大利理工学院)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出ProxiMAP,通过调整噪声调度使去噪器保持分布内,实现更稳定的图像重建,适用于去模糊、补全、超分辨率和相位恢复等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18619 2026-05-19 stat.ME stat.CO 50%

Random spanning tree Markov random field priors for Bayesian inverse problems in imaging

随机生成树马尔可夫随机场先验用于成像中的贝叶斯反问题

Jasper Marijn Everink

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出了一种基于随机生成树的马尔可夫随机场先验,用于解决成像中的贝叶斯反问题,通过将连续和离散随机变量结合,改进了图像去噪、去模糊和修复等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 6 篇

2605.17312 2026-05-19 cs.CV 79%

VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers

VISTA: 基于扩散变换器的三元组监督视频风格迁移

Yiren Song, Wangzi Yao, Haofan Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Lovart AI(Lovart人工智能)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出VISTA方法,通过引入大规模三元组数据和基于扩散变换器的框架,解决视频风格迁移中风格、内容和运动的联合建模与解耦问题,实现了高质量的风格迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17309 2026-05-19 cs.CV cs.AI 79%

StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting

StyleText: 一个大规模数据集和基准,用于具有风格保留的场景文本修复

Aleksandr Simonyan, Nipun Jindal

机构 * Adobe Inc.(Adobe公司)

专题命中 个性化与一致性 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出StyleText,一个用于具有风格保留的场景文本修复的大规模数据集和基准,通过控制评估文本可读性和视觉一致性,利用共享场景上下文。

Comments Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI 70%

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18365 2026-05-19 cs.CV 57%

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

GeoFlow: 在视频生成中强制隐式几何一致性

Jan Ackermann, Shengqu Cai, Boyang Deng, Zhengfei Kuang, Songyou Peng, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GeoFlow,一种通过强化学习微调来增强视频生成中几何一致性的方法,通过引入几何一致性奖励,有效减少时间上的几何伪影,同时保持感知质量。

Comments Project Page: https://geometryflow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16406 2026-05-19 cs.CV 57%

Contrastive-SDXL: Annotation-Preserving Night-Time Augmentation for Pedestrian Detection

对比-SDXL:保留标注的夜间增强用于行人检测

Franky George, Muhammad Khalid, Adil Khan

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Contrastive-SDXL框架,利用SDXL-Turbo和LoRA微调,通过语义对比损失和对象一致性损失生成逼真夜间图像,提升行人检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17827 2026-05-19 cs.LG cs.AI 50%

Content-Style Identification via Differential Independence

通过微分独立性进行内容-风格识别

Subash Timilsina, Hoang-Son Nguyen, Sagar Shrestha, Xiao Fu

机构 * School of Electrical Engineering and Computer Science, Oregon State University, Corvallis, Oregon, USA(电气工程与计算机科学学院,俄勒冈州立大学,科瓦利斯,俄勒冈,美国)

专题命中 个性化与一致性 :image generation(abstract)

AI总结 本文提出了一种新的结构条件,即内容-风格微分独立性(CSDI),用于在内容和风格可能依赖的情况下实现生成分析中的可识别性,通过在雅可比子空间上施加块状正交约束,并设计了基于数值雅可比近似的随机正则化器以支持高维生成模型。

Comments 24 pages, 15 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2605.17382 2026-05-19 cs.AI cs.CL cs.GR 57%

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估

Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri

机构 * AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室) Department of Computer Engineering and Information Technology(计算机工程与信息科技系) Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系) University of Genoa(热那亚大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.GR

AI总结 本文提出QQJ框架,通过专家设计的多维评分标准和高质量标注集校准大语言模型评估器,实现与人类判断一致的可扩展评估方法,验证了结构化定性判断在大规模应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03280 2026-05-19 cs.LG cs.AI 50%

BlendedNet++: A dataset and benchmark for field-resolved aerodynamics and inverse design of blended wing body aircraft

BlendedNet++:一种用于混合翼身融合飞机场解气动学和逆设计的数据集和基准

Nicholas Sung, Steven Spreizer, Mohamed Elrefaie, Matthew C. Jones, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出BlendedNet++数据集,包含12492种独特的BWB几何体,通过RANS模拟提供集成力和密集表面场,利用几何深度学习模型实现实时气动预测和生成性逆设计,验证了Transolver在场预测中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 15 篇

2507.05482 2026-05-19 cs.LG stat.ML 87%

Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions

Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions

Van Khoa Nguyen, Lionel Blondé, Alexandros Kalousis

机构 * Department of Computer Science, University of Geneva(日内瓦大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(title,title_cn)

AI总结 本文提出了一种基于Stein扩散引导的训练自由后验校正方法,用于在高密度区域之外进行采样。该方法结合了随机最优控制和Stein变分推断,通过引入新的理论界和运行成本函数,实现了在低密度区域的有效引导。

Comments Revised version accepted to the ICML 2026 main track; prior version accepted to two ICLR 2026 workshops: ReALM-GEN and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17834 2026-05-19 cs.CV 83%

Stabilizing, Scaling & Enhancing MeanFlow for Large-scale Diffusion Distillation

稳定、扩展与增强MeanFlow用于大规模扩散蒸馏

Xiao He, Yang Li, Peizhen Zhang, Songtao Liu, Zhao Zhong, Nannan Wang

机构 * State Key Laboratory of Integrated Services Networks(信息服务网络国家重点实验室) Xidian University(西安电子科技大学) Tencent Hunyuan(腾讯文英)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种稳定MeanFlow的方法,通过引入暖启动技术并结合轨迹分布对齐,提高了大规模工业模型蒸馏的性能和泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16732 2026-05-19 cs.CV cs.LG 83%

DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

DiRotQ:面向4位扩散变换器的旋转感知量化

Sayeh Sharify, Mahsa Salmani, Hesham Mostafa

机构 * d-Matrix

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiRotQ,一种W4A4量化框架,通过旋转感知激活量化缓解扩散变换器在4位精度下的性能下降问题,同时引入VLM-as-a-Judge评估协议和Triton定制内核提升压缩下的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17546 2026-05-19 astro-ph.IM astro-ph.GA cs.LG 82%

Accelerating Redshift-Conditioned Galaxy Image Synthesis with One-step Generative Modeling

通过一步生成建模加速红移条件下的星系图像合成

Tianyue Yang, Sandro Tacchella, Xiao Xue

机构 * The Center for Computational Science(计算科学中心) University College London(伦敦大学学院) Cavendish Laboratory(卡文迪许实验室) Kavli Institute for Cosmology University of Cambridge(剑桥大学卡文迪许宇宙研究所)

专题命中 效率与蒸馏 :image synthesis(title,abstract);diffusion(abstract)

AI总结 本文研究了利用扩散模型和像素MeanFlow实现高效红移条件下的星系图像生成,通过对比不同模型在GalaxiesML-64数据集上的表现,发现一步生成模型在计算成本大幅降低的情况下能有效恢复星系形态统计信息,为大规模宇宙巡天和基于模拟的科学推断提供了新路径。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18346 2026-05-19 cs.CV cs.AI 79%

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

聚焦强制:面向内容的每帧KV选择用于高效的自回归视频扩散

Peiliang Cai, Evelyn Zhang, Jiacheng Liu, Hao Lin, Ruiqi Zhang, Weile Mo, Yue Ma, Shikang Zheng, Jiehang Huang, Dongrui Liu, Linfeng Zhang

机构 * SJTU(上海交通大学) SDU(山东大学) HUST(华中科技大学) UTokyo(东京大学) HKUST(香港科技大学) SCUT(上海大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的KV选择方法,通过结合注意力分数和历史帧的多样性分数,保留最相关和有区别的历史帧,从而在不牺牲质量的情况下提高自回归视频扩散的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09450 2026-05-19 cs.LG cs.AI eess.IV 78%

ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion

ECHO: 通过一步块扩散实现高效的胸部X光报告生成

Lifeng Chen, Tianqi You, Hao Liu, Zhimin Bao, Jile Jiao, Xiao Han, Zhicai Ou, Tao Sun, Xiaofeng Mou, Xiaojie Jin, Yi Xu

机构 * Beijing Jiaotong University(北京交通大学) Dalian University of Technology(大连理工大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出ECHO,一种基于扩散模型的高效视觉-语言模型,用于生成胸部X光报告,通过一步块扩散和响应不对称扩散策略,显著提高了生成效率和文本连贯性,同时在临床准确性上保持良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18052 2026-05-19 cs.CV 57%

Efficient 3D Content Reconstruction and Generation

高效3D内容重建与生成

Jiahao Li

机构 * TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO(丰田技术研究所芝加哥分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种高效的3D内容生成和重建方法,通过结合多视图扩散和稀疏视图3D重建,实现了高质量的3D资产生成,并开发了FastMap算法以提高3D重建的速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17365 2026-05-19 cs.CV 57%

Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval

基于记忆的查询意图理解用于高效的基于聊天的图像检索

Xianke Chen, Daizong Liu, Yushuo Lou, Xin Tan, Xun Yang, Shuhui Wang, Xun Wang, Jianfeng Dong

机构 * School of Computer Science and Technology, and the School of Statistics and Mathematics, Zhejiang Gongshang University(计算机科学与技术学院,和统计与数学学院,浙江工商大学) School of Computer Science and Technology, Zhejiang Gongshang University, and the Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(计算机科学与技术学院,浙江工商大学,和大数据与未来电子商务技术浙江省重点实验室) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) School of Information and Electronic Engineering, Zhejiang Gongshang University(信息与电子工程学院,浙江工商大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences , Institute of Computing Technology, CAS(中国科学院智能信息处理重点实验室,计算技术研究所,中国科学院) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种高效的基于聊天的图像检索任务中的记忆增强查询意图理解框架MAQIU,通过动态聚合和演化查询意图的语义表示,防止意图遗忘并增强长期语义完整性,从而在保持高计算效率的同时实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16649 2026-05-19 cs.CV 57%

AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling

AtlasVid: 通过解耦的全局-局部建模实现高效超高清长视频生成

Ziyang Mai, Yuyao Zhang, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AtlasVid框架,通过解耦建模提升超高清长视频生成效率,实现60.9倍加速和更低训练成本,优于原生4K生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22459 2026-05-19 stat.ML cs.LG 50%

Universal Inverse Distillation for Matching Models with Real-Data Supervision (No GANs)

通用逆向蒸馏用于匹配模型与真实数据监督(无GANs)

Nikita Kornilov, David Li, Tikhon Mavrin, Aleksei Leonov, Nikita Gushchin, Evgeny Burnaev, Iaroslav Koshelev, Alexander Korotin

机构 * Applied AI Institute(应用人工智能研究所) MIRAI BRAIn Lab(BRAIn实验室) AI Foundation lab(人工智能基础实验室) MBZUAI(穆扎伊国际人工智能大学) AXXX

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出RealUID框架,通过无需GANs的方式将真实数据无缝融入逆向蒸馏过程,为所有匹配模型提供统一的蒸馏方法,涵盖流匹配和扩散模型,并可扩展至其变种。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17899 2026-05-19 cs.LG cs.AI q-bio.QM 50%

DCFold: Efficient Protein Structure Generation with Single Forward Pass

DCFold: 通过单次前向传递高效生成蛋白质结构

Zhe Zhang, Yuanning Feng, Yuxuan Song, Keyue Qiu, Hao Zhou, Wei-Ying Ma

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Department of Computer Science and Technology(计算机科学与技术系) School of Computer Science and Technology(计算机科学与技术学院) ByteDance Seed(字节跳动种子)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出DCFold,一种单步生成模型,实现了与AlphaFold3同等的精度,通过双一致性训练框架和新的时间测地匹配(TGM)调度器,在保持预测保真度的同时将推理速度提升15倍,验证了其在结构预测和结合设计基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05993 2026-05-19 cs.LG cs.AI 50%

Diamond Maps: Efficient Reward Alignment via Stochastic Flow Maps

钻石映射:通过随机流映射实现高效的奖励对齐

Peter Holderrieth, Douglas Chen, Luca Eyring, Ishin Shah, Giri Anantharaman, Yutong He, Zeynep Akata, Tommi Jaakkola, Nicholas Matthew Boffi, Max Simchowitz

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出钻石映射,一种通过随机流映射实现高效奖励对齐的生成模型,能够在推理时对任意奖励进行准确对齐,提升模型适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01629 2026-05-19 stat.ML cs.LG cs.NA math.NA 50%

Lipschitz-Guided Design of Interpolation Schedules in Generative Models

基于Lipschitz性的生成模型插值调度设计

Yifan Chen, Eric Vanden-Eijnden, Jiawei Xu

机构 * Department of Mathematics, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校数学系) Machine Learning Lab, Capital Fund Management, Paris, France(Capital Fund Management机器学习实验室) Courant Institute, New York University, NY, USA(纽约大学Courant研究所) Now at University of Maryland, College Park, MD, USA(现在位于马里兰大学 College Park 分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究了生成模型中插值调度的设计,从统计和数值角度出发,提出通过最小化漂移场的平均平方Lipschitz性来设计调度,以提升生成模型的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16348 2026-05-19 cs.LG cs.AI 50%

Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field

Flow-Direct: 通过非参数指导场实现反馈高效且可重用的流模型指导

Kim Yong Tan, Yueming Lyu, Ivor Tsang, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,新加坡科技研究局) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,新加坡科技研究局)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出Flow-Direct框架,通过持续指导场提升流模型的反馈效率和可重用性,利用累积的奖励评估样本构建非参数估计器,实现高效优化和多目标样本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05688 2026-05-19 eess.AS cs.SD 50%

Robust One-step Speech Enhancement via Consistency Distillation

通过一致性蒸馏实现鲁棒的一步语音增强

Liang Xu, Longfei Felix Yan, W. Bastiaan Kleijn

机构 * School of Engineering and Computer Science(工程与计算机科学学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出ROSE-CD,通过一致性蒸馏生成鲁棒的一步模型,提升语音增强的实时性和性能,实验表明其在语音质量上优于传统多步扩散模型。

Comments Accepted to IEEE WASPAA 2025. 6 pages, 1 figures

Journal ref Proceedings of the IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), Lake Tahoe, CA, USA, October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏