arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-04 至 2026-05-04 共收录 60 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 42 篇

2605.00656 2026-05-04 cond-mat.stat-mech 50%

Renormalized entropy production for optimal transport in jump processes: Make conservative forces optimal again

重整化熵产在跳跃过程最优传输中的应用:使保守力再次成为最优解

Andreas Dechant, Jann van der Meer

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了在跳跃过程中,尽管保守力不最小化熵产,但能唯一表征重整化熵产,通过数值例子探讨了其与传统熵产的异同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00542 2026-05-04 math.PR 50%

Convergence of the Condensing Symmetric Inclusion Process on the Torus in the Thermodynamical Limit to Coalescing Brownian Motions

凝聚对称包含过程在环面上热力学极限下的收敛性到凝聚布朗运动

Seonwoo Kim, Claudio Landim

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了离散一维环面上凝聚对称包含过程的饱和态,证明在适当缩放下,凝聚体位置收敛于连续环面上的凝聚布朗运动,通过控制凝聚时间并结合无凝聚运动的精确估计,证明其收敛性。

Comments 40 pages, 5 figures. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00360 2026-05-04 cs.LG stat.ME 50%

Binomial flows: Denoising and flow matching for discrete ordinal data

二项流:用于离散序数数据的去噪和流匹配

Yair Shenfeld, Ricardo Baptista, Stefano Peluchetti

机构 * Division of Applied Mathematics, Brown University, Providence, RI, USA 02912(应用数学系,布朗大学,普罗维德恩,罗德岛州,美国 02912) Department of Statistical Sciences, University of Toronto, Toronto, ON, Canada M5G 1X6(统计科学系,多伦多大学,多伦多,安大略省,加拿大 M5G 1X6)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出二项流,为离散非负序数数据提供训练离散扩散模型的简单方法,同时实现去噪、采样和精确似然估计。

Comments 41 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00243 2026-05-04 physics.flu-dyn physics.ao-ph 50%

Frequency spreading of internal wave energy by balanced flows in two dimensions

二维平衡流中内波能量频谱扩散

Nicholas DeFilippis, Oliver Bühler, K. Shafer Smith

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究二维平衡流中内波能量频谱扩散机制,发现真实湍流流场中频谱扩散弱于合成流场,推导出频谱扩散时间尺度,揭示大气和海洋中宽带频谱的其他成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00178 2026-05-04 astro-ph.HE 50%

A Detailed View of the Large-Scale Sloshing Cold Front in RXJ2014.8-2430

RXJ2014.8-2430中大尺度晃动冷前缘的详细视图

M. J. Sundquist, S. A. Walker, M. S. Mirakhor

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过新的Chandra观测分析RXJ2014.8-2430中三个冷前缘的精细结构,发现一个可能的Kelvin-Helmholtz不稳定性或AGN活动产生的气体空洞,并测量冷前缘宽度,发现其与库仑自由程一致,表明扩散被抑制。

Comments 11 pages, 13 figures, accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00167 2026-05-04 cond-mat.dis-nn physics.ao-ph 50%

Data-Driven Modelling to predict forest fire spread in the Patagonian region in Argentina

数据驱动建模用于预测阿根廷巴塔哥尼亚地区森林火灾蔓延

Lucas Becerra, Monica Malen Denham, Alejandro B. Kolton, Karina Laneri

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于反应-扩散-对流模型的数据驱动方法,结合高精度地形和植被数据,通过遗传算法和XGBoost优化参数,提升火灾预测精度,为森林管理提供新方法。

Comments 29 pages, 8 figures

Journal ref Ecological Modelling, Volume 518, August 2026, 111618

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26848 2026-05-04 cs.RO 50%

STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation

STARRY:面向机器人操作的时空动作中心世界建模

Yuxuan Tian, Yurun Jin, Bin Yu, Yukun Shi, Hao Wu, Chi Harold Liu, Kai Chen, Cong Huang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) East China Normal University(华东师范大学) DeepCybo

专题命中 扩散模型 :diffusion(abstract)

AI总结 STARRY通过统一扩散过程联合去噪未来时空潜在表示和动作,提升机器人操作中时空协调的精度与成功率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02756 2026-05-04 cond-mat.mes-hall nlin.PS 50%

Intrinsic Step Jamming in Nanometer-Scale KPZ-like Rough Surfaces under Interface-Limited Crystal Growth and Retreat

纳米尺度KPZ类粗糙表面在界面限制的晶体生长与退却中的内在台阶阻塞现象

Noriko Akutsu, Yoshihiro Kangawa

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了纳米尺度KPZ类动力学粗糙晶体表面在界面限制的晶体生长或退却过程中出现的内在台阶阻塞现象,通过MC模拟揭示了台阶阻塞的机制及抑制方法。

Comments stepJam_w7acs-latex-templates3barxivex; 19 pages, 7 figures. Version 2. Crystal Growth & Design in press. https://doi.org/10.1021/acs.cgd.6c00011

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03893 2026-05-04 eess.IV 50%

DeepFixel: Crossing white matter fiber identification through spherical convolutional neural networks

DeepFixel:通过球形卷积神经网络实现交叉白质纤维识别

Adam M. Saunders, Lucas W. Remedios, Elyssa M. McMaster, Jongyeon Yoon, Gaurav Rudravaram, Adam Sadriddinov, Praitayini Kanakaraj, Bennett A. Landman, Adam W. Anderson

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出DeepFixel,一种球形卷积神经网络,用于高效分离交叉白质纤维的ODF,相较于非凸优化和基于fixel的方法,具有更高的计算效率和更小的角分离能力。

Comments 11 pages, 6 figures. Accepted to SPIE Medical Imaging 2026: Clinical and Biomedical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00233 2026-05-04 cs.LG physics.flu-dyn 50%

Differentiable Autoencoding Neural Operator for Interpretable and Integrable Latent Space Modeling

可微自动编码神经算子用于可解释且可整合的潜在空间建模

Siva Viknesh, Amirhossein Arzani

机构 * Department of Mechanical Engineering, University of Utah, Salt Lake City, UT, USA(犹他大学机械工程系) Imaging Institute, University of Utah, Salt Lake City, UT, USA(犹他大学成像研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出Diano,一种可微自动编码神经算子框架,通过构建可可视化粗网格潜在空间,实现不同空间离散化下的维度和几何缩减,并在潜在空间中直接施加守恒方程,通过编码和解码神经算子实现高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06421 2026-05-04 cond-mat.stat-mech 50%

Duality between dissipation-coherence trade-off and thermodynamic speed limit based on thermodynamic uncertainty relation for stochastic limit cycles

耗散-相干权衡与热力学速度限制之间的对偶性基于随机极限环的热力学不确定性关系

Ryuna Nagayama, Sosuke Ito

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于热力学不确定性关系,推导了随机极限环在弱噪声极限下的两个基本权衡:耗散-相干权衡和热力学速度限制,并通过噪声罗素模型和随机化学系统进行了数值验证。

Comments 10 pages, 3 figures (main text) + 22 pages, 2 figures (supplemental material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02780 2026-05-04 math.PR 50%

An extension of Stein's method incorporating independence

将独立性纳入Stein方法的扩展

Aleksandar Balašev-Samarski, Abdol-Reza Mansouri

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文扩展Stein方法以纳入辅助随机变量的独立性,适用于存在Stein特征化的任何分布,并通过马尔可夫算子工具展示了对ergodic扩散不变测度定律的应用。

Comments Accepted for publication in Statistics and Probability Letters. 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13419 2026-05-04 astro-ph.HE 50%

Hyperactive Magnetar Eruptions: Giant Flares, Baryon Ejections, and Fast Radio Bursts

超活跃磁星喷发:巨量耀斑、重子喷射与快速射电暴

Ashley Bransgrove, Andrei M. Beloborodov, Yuri Levin

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究探讨磁星内部磁场通过偶极扩散演化引发喷发的过程,发现其可喷射磁环并产生巨量耀斑,解释了SGR 1806-20 2004年耀斑及后续辐射现象,提出超活跃磁星可能为宇宙快速射电暴的引擎。

Comments 9 pages, 4 figures, accepted ApJL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02331 2026-05-04 stat.ME 50%

A parameterization of anisotropic Gaussian fields with penalized complexity priors

各向异性高斯场的参数化与惩罚复杂性先验

Liam Llamazares-Elias, Jonas Latz, Finn Lindgren

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种平滑可逆的各向异性高斯场相关长度和扩散矩阵参数化方法,并构建惩罚复杂性先验,以获得合适的后验协方差结构。

Comments v2: revised version, accepted for publication in the Journal of the American Statistical Association

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2605.00345 2026-05-04 cs.CV 87%

Pose-Aware Diffusion for 3D Generation

姿态感知扩散用于3D生成

Zihan Zhou, Luxi Chen, Jingzhi Zhou, Yuhao Wan, Min Zhao, Baoyu Fan, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学 Gallagher人工智能学院) VCIP, School of Computer Science, Nankai University(南开大学计算机学院 VCIP) THU-Bosch MLCenter, Tsinghua University(清华大学 THU-Bosch 机器学习中心) Inspur Group(Inspur集团)

专题命中 可控生成 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出Pose-Aware Diffusion,通过直接在观测空间生成3D几何,解决姿态对齐难题,实现高保真姿态一致的3D资产生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08965 2026-05-04 cs.LG cs.AI 78%

Semantic Level of Detail for Knowledge Graphs: Discovering Abstraction Boundaries via Spectral Heat Diffusion

知识图谱的语义层次细节:通过谱热扩散发现抽象边界

Edward Izgorodin

机构 * Mnemoverse.AI, Funchal, Madeira, Portugal(Mnemoverse.AI,法赫尔,马德拉,葡萄牙)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出SLoD框架,通过谱热扩散在图拉普拉斯上定义连续缩放操作,解决知识图谱中抽象层次边界检测问题,实验证明其在合成数据和WordNet中的有效性。

Comments v2: extended companion of GRAAI 2026 workshop paper; full proofs of Lemmas A.1-A.2 (Frechet-mean and heat-kernel Lipschitz constants, corrected) in Appendix A; Proposition 1(i) empirical anchor (new Figure 1); 50-seed ablation with BCa CIs and Wilcoxon tests (Tables 3-4, p<10^-15); WordNet retained (tau=0.79). 21 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00503 2026-05-04 cs.CV cs.LG 74%

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

端到端自回归图像生成与1D语义分词器

Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 本文提出端到端训练 pipeline,结合重建与生成优化,改进1D分词器,实现自回归图像生成的高FID分数结果。

Comments In ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00605 2026-05-04 cs.CV 57%

Faithful Extreme Image Rescaling with Learnable Reversible Transformation and Semantic Priors

基于可学习可逆变换和语义先验的忠实极端图像放大

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Information and Communications Engineering, Xi’an Jiaotong University(信息与通信工程学院,西安交通大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FaithEIR框架,通过可学习可逆变换和语义先验提升极端图像放大的真实性与细节,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 57%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01955 2026-05-04 cs.CV cs.AI cs.LG 57%

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。

Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 3 篇

2605.00664 2026-05-04 cs.CV cs.AI 83%

InpaintSLat: Inpainting Structured 3D Latents via Initial Noise Optimization

InpaintSLat:通过初始噪声优化进行结构化3D潜在映射修复

Jaeyoung Chung, Suyoung Lee, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的可控3D修复方法,通过优化初始噪声提升3D修复的高保真度,引入基于修正流模型的反向传播近似,优化结构化3D潜在映射,实验显示在上下文一致性和提示对齐方面优于基线方法。

Comments project page: https://robot0321.github.io/InpaintSLat/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23116 2026-05-04 cs.CV 79%

Residual Diffusion Bridge Model for Image Restoration

残差扩散桥模型用于图像修复

Hebaixu Wang, Jing Zhang, Haoyang Chen, Haonan Guo, Di Wang, Jiayi Ma, Bo Du

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出残差扩散桥模型,通过理论重构扩散桥的随机微分方程,利用残差调节噪声注入与去除,实现自适应修复受损区域并保留完整区域,验证了模型的最优性。

Comments Accepted by CVPR 2026 as Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00498 2026-05-04 cs.CV 57%

GOR-IS: 3D Gaussian Object Removal in the Intrinsic Space

GOR-IS: 在内在空间中进行3D高斯物体移除

Yonghao Zhao, Yupeng Gao, Jian Yang, Jin Xie, Beibei Wang

机构 * Nankai University(南开大学) Nanjing University(南京大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出GOR-IS框架,通过分解场景为内在组件并建模光传输,实现物理一致且视觉连贯的3D物体移除,实验表明其在感知相似度和PSNR上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2605.00658 2026-05-04 cs.CV 79%

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 4 篇

2601.09896 2026-05-04 cs.HC cs.AI cs.CV 57%

The Algorithmic Gaze of Image Quality Assessment: An Audit and Trace Ethnography of the LAION-Aesthetics Predictor

图像质量评估的算法凝视:LAION-Aesthetics预测器的审计与踪迹民族志

Jordan Taylor, William Agnew, Maarten Sap, Sarah E. Fox, Haiyi Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了广泛用于训练视觉生成图像模型的LAION-Aesthetics预测器,揭示其在筛选图像数据时对女性描述的偏向性,以及其对西方艺术史中帝国和男性凝视的强化,呼吁转向更多元的审美评估。

Comments To Appear at FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21864 2026-05-04 cs.CV 57%

Deepfakes: we need to re-think the concept of "real" images

深度伪造:我们需要重新思考“真实”图像的概念

Janis Keuper, Margret Keuper

机构 * Institute for Machine Learning and Analytics, Offenburg University(机器学习与分析研究所,奥芬堡大学) University of Mannheim(曼海姆大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰州信息校区)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文指出当前“伪造”检测方法依赖过时的低分辨率“真实”图像数据集,呼吁重新定义“真实”图像并建立新基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00689 2026-05-04 cs.CL cs.CR 50%

ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models

ML-Bench&Guard: 政策导向的多语言安全基准与大型语言模型的防护机制

Yunhan Zhao, Zhaorun Chen, Xingjun Ma, Yu-Gang Jiang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fudan University(复旦大学) University of Chicago(芝加哥大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出ML-Bench和ML-Guard,通过区域法规构建多语言安全基准,并开发基于扩散模型的防护系统,实现文化与法律一致的多语言安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04465 2026-05-04 cs.AI 50%

The Topology of Multimodal Fusion: Why Current Architectures Fail at Creative Cognition

多模态融合的拓扑学:为何当前架构在创造性认知上失败

Xiujiang Tan

机构 * Guangzhou Academy of Fine Arts(广州美术学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文指出当前多模态AI架构存在拓扑限制而非参数限制,通过哲学、认知科学和数学三个支柱提出多模态融合的拓扑学框架,提出UOO实现、ANALOGY-MM基准和META-TOP三阶基准,通过实验路线验证拓扑同构性。

Comments Expanded 11 technical improvements; 5 reference corrections; Appendix B pseudocode added. ~43 pages, 5 figures. Chinese philosophical terms romanized. Companion monograph available separately

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 2 篇

2605.00329 2026-05-04 cs.SD eess.AS 50%

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

通过能量评分与辅助上下文表示蒸馏实现一步文本到音频生成

Kuan-Po Huang, Bo-Ru Lu, Byeonggeun Kim, Mihee Lee, Zalan Fabian, Renard Korzeniowski, Qingming Tang, Greg Ver Steeg, Hung-yi Lee, Chieh-Chi Kao, Chao Wang

机构 * National Taiwan University(国立台湾大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种结合能量距离训练和表示层蒸馏的一步采样框架,有效提升了文本到音频生成的速度与质量,在AudioCaps基准上优于现有方法,达到与多步采样扩散模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07744 2026-05-04 cs.LG 50%

Riemannian MeanFlow

Riemannian MeanFlow:在流形上直接学习流映射的高效生成框架

Dongyeop Woo, Marta Skreta, Seonghyun Park, Kirill Neklyudov, Sungsoo Ahn

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 Riemannian MeanFlow在流形上直接学习流映射,通过单次前向传递实现高质量生成,相比传统方法减少10倍的函数评估次数,并通过奖励预览实现高效奖励引导设计。

详情

展开后加载摘要…

URL PDF HTML 收藏