arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-07 至 2026-07-07 共收录 243 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 16 篇

2607.03964 2026-07-07 cs.RO cs.AI 新提交 50%

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 可控生成 :diffusion(abstract)

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03952 2026-07-07 math.OC cs.SY eess.SY 新提交 50%

L1 Optimal Control of Continuous-Time Stochastic Positive Systems

连续时间随机正系统的 L1 最优控制

Alba Gurpegui, Takashi Tanaka, Anders Rantzer

专题命中 可控生成 :diffusion(abstract)

AI总结 研究连续时间随机正系统的 L1 最优控制问题,考虑线性非负成本及输入约束,建立正象限前向不变性并提出模拟方法,给出有限和无限时域问题的显式解,证明对乘性随机不确定性的鲁棒性。

Comments 14 Pages. 2 Figures. Accepted for publication in IEEE Control Systems Letters (L-CSS) and under review for the 65th IEEE Conference in decision and control 2026 (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05137 2026-07-07 physics.plasm-ph cs.CE physics.comp-ph 新提交 50%

SoPlasmaFoam: an OpenFOAM-based solver for streamer and dielectric barrier discharges with adaptive mesh refinement

SoPlasmaFoam:基于OpenFOAM的用于流光和介质阻挡放电的求解器及自适应网格细化

R. Pasolari, K. Kourtzanidis

专题命中 可控生成 :diffusion(abstract)

AI总结 研究基于OpenFOAM构建求解器SoPlasmaFoam,通过耦合泊松方程求解带电粒子输运。评估对流方案,分析泊松输运耦合,引入边界条件。该求解器经验证并展示多区域能力,为多物理模拟提供模块化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22726 2026-07-07 cs.AI 新提交 50%

Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation

文本主导,音乐装饰:基于能量的注意力机制用于可编辑舞蹈动作生成

Seong Jong Yoo, Siyuan Peng, Felix Gu, Stratis Aloimonos, Cornelia Fermüller

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出STREAM模型,通过模态解耦的扩散变压器分离文本语义和音乐节奏控制,实现可编辑舞蹈动作生成,并引入新数据集Motorica++和评估指标EDS。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24589 2026-07-07 eess.AS cs.SD 版本更新 50%

YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance

YingMusic-Singer-Plus: 可控歌唱语音合成与灵活歌词操控及无标注旋律引导

Chunbo Hao, Junjie Zheng, Guobin Ma, Yuepeng Jiang, Huakang Chen, Wenjie Tian, Gongyu Chen, Zihao Chen, Lei Xie

机构 * AI Lab, GiantNetwork(巨人网络AI实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出YingMusic-Singer-Plus,一种基于扩散模型的可控歌唱语音合成方法,支持灵活歌词操控和无标注旋律引导,优于现有基准模型。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02948 2026-07-07 cs.LG cs.NA math.NA 版本更新 50%

Variational Sparse Paired Autoencoders (vsPAIR) for Inverse Problems and Uncertainty Quantification

用于逆问题和不确定性量化的变分稀疏配对自动编码器(vsPAIR)

Jack Michael Solomon, Rishi Leburu, Matthias Chung

机构 * Emory University Department of Mathematics(埃默里大学数学系)

专题命中 可控生成 :inpainting(abstract)

AI总结 针对逆问题,提出变分稀疏配对自动编码器(vsPAIR)。架构通过学习的潜在映射连接标准VAE和稀疏VAE,能进行不确定性估计,鼓励可解释性,提供结构化不确定性估计,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03324 2026-07-07 math.PR 版本更新 50%

Strong law of large numbers and L log L condition for supercritical branching processes

超临界分支过程的强大数定律和L log L条件

Vincent Bansaye, Tresnia Berah, Bertrand Cloez

专题命中 可控生成 :diffusion(abstract)

AI总结 研究结构化种群的超临界分支过程,在重正化半群加权全变差范数收敛假设下,结合鞅族、半群收缩等技术,证明归一化经验测度强收敛等,在Llog L条件下扩展大数定律适用范围。

Comments MISTEA - Axe syst{è}mes dynamiques

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 4 篇

2607.02560 2026-07-07 cs.CV 新提交 79%

Inpainting U-Net for seamless pedestrian-level wind prediction across urban morphologies

用于跨城市形态的无缝行人级风速预测的修复U-Net

Jingzi Huang, Claire E. Heaney, Tao Li, Xinzhe Li, Graham O. Hughes, Maarten van Reeuwijk

机构 * Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系) Department of Earth Science and Engineering, Applied Modelling and Computation Group, Imperial College London(伦敦帝国理工学院地球科学与工程系应用建模与计算组)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 研究针对行人级风速预测,开发两阶段U-Net框架。先由基线U-Net逐块预测,再用基于修复的U-Net改进,减少块边界不连续性,为跨城市形态的高分辨率行人级风速预测提供了高效灵活的替代模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 70%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05354 2026-07-07 cs.CV 新提交 57%

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

几何互易性:解锁立体视频生成的自监督能力

Jingyi Lu, Kai Han

机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。

Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02952 2026-07-07 cs.CV cs.AI 新提交 57%

Pooling-Based Context Modeling for Convolution-Free Deep Image Prior

基于池化的无卷积深度图像先验的上下文建模

Gihyun Kim, Jong-Seok Lee

机构 * Yonsei University(延世大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究提出Pool-DIP,一种无卷积架构,通过基于池化的对比建模捕捉空间上下文,提升去噪性能,减少参数和计算复杂度,在多数据集表现良好,还能用于其他图像恢复任务。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 7 篇

2604.17195 2026-07-07 cs.CV 版本更新 83%

DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

DreamShot: 基于视频扩散先验的个性化分镜合成

Junjia Huang, Binbin Yang, Pengxiang Yan, Jiyang Liu, Bin Xia, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) ByteDance Intelligent Creation(字节跳动智能创作) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 DreamShot通过视频扩散先验实现可控的多镜头合成,支持文本到镜头和参考到镜头生成,提升叙事连贯性和角色一致性。

Comments Accepted by CVPR2026 as a Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24197 2026-07-07 cs.CL cs.AI 版本更新 78%

Seeing Is No Longer Believing: Frontier Image Generation Models, Synthetic Visual Evidence, and Real-World Risk

看到不再等于相信:前沿图像生成模型、合成视觉证据与现实世界风险

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 个性化与一致性 :image generation(title,abstract)

AI总结 本文探讨前沿图像生成模型带来的合成视觉证据风险,分析其对社会信任的影响,并提出多层面的控制措施以降低现实世界中的潜在危害。

Comments Technical report. 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04677 2026-07-07 cs.CV 新提交 57%

AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer

AnyStyle:单个LoRA足以实现图像引导的风格迁移

Yongwen Lai, Chaoqun Wang

机构 * School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究图像引导风格迁移,指出基于扩散方法存在内容与风格解缠难题。提出AnyStyle框架,采用统一单适配器范式,结合无训练结构引导,提升可控性与稳定性,实验显示性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02957 2026-07-07 cs.CV 新提交 57%

ReLo-IRR: Reflection-Guided LoRA Framework for Image Reflection Removal

ReLo-IRR:用于图像反射去除的反射引导LoRA框架

Chaoqun Wang, Yuehuan Wei, Haoxiang Cao, Shaobo Min

机构 * School of Artificial Intelligence, South China Normal University(南方科技大学人工智能学院) University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对单图像反射去除问题,提出基于整流流模型的ReLo-IRR框架。设计轻量级估计器预测反射强度描述符,引入时间条件机制,联合建模反射强度和去噪动态,有效抑制不同反射条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09030 2026-07-07 cs.CV cs.LG 版本更新 57%

When Style Similarity Scores Fail: Diagnosing Raw CSD Cosine in Artist-Style Evaluation

当风格相似性评分失效时:诊断原始CSD余弦在艺术家风格评估中的问题

Jörg Frochte

机构 * Bochum University of Applied Sciences(博湖应用科学大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种诊断方法,用于检验对比风格描述符(CSD)的原始余弦是否能作为绝对风格保真度评分。通过实验发现,CSD+方法在不同模型上均能有效减少负差距,提升评估准确性。

Comments 24 pages, 7 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08572 2026-07-07 cs.CV 版本更新 57%

ECTraj: Enhanced Consistency Training for Multi-Agent Trajectory Prediction

增强多智能体轨迹预测的一致性模型

Alen Mrdovic, Qingze, Liu, Danrui Li, Mathew Schwartz, Kaidong Hu, Sejong Yoon, Mubbasir Kapadia, Vladimir Pavlovic

机构 * Rutgers University - New Brunswick(罗格斯大学-新不伦瑞克分校) New Jersey Institute of Technology(新泽西理工学院) The College of New Jersey(新泽西学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ECTraj,通过改进训练和条件生成方法,提升多智能体轨迹预测的一致性模型性能,实现更快推理和更准确预测,建立新的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02208 2026-07-07 eess.IV cs.CV cs.LG 版本更新 57%

MACS: Measurement-Aware Consistency Sampling for Inverse Problems

MACS:用于逆问题的测量感知一致性采样

Amirreza Tanevardi, Pooria Abbas Rad Moghadam, Seyed Mohammad Eshtehardian, Sajjad Amini, Babak Khalaj

机构 * Department of Electrical Engineering(电气工程系) Sharif University of Technology(谢里夫大学) Electronics Research Institute(电子研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对逆成像问题,改进一致性采样框架,利用测量一致性机制调控采样随机性,兼顾数据保真与计算效率,实验表明该方法在多指标上有提升,少量采样步就能实现有竞争力或更优的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 5 篇

2607.02582 2026-07-07 cs.CV 新提交 70%

Evaluating Intellectual Property Guardrails of Generative Image Models: A Technical Report

评估生成式图像模型的知识产权保护措施:技术报告

Austin T. Hoag, Apostolos Modas, Yunhao Ba, Julienne M. LaChance, Jinru Xue, Wiebke Hutiri, Jan Simson, Tiffany Georgievski, Alex Towli, Joseph Smith, Yuki Mitsufuji, Alice Xiang

机构 * Sony AI New York(索尼人工智能纽约分部) Sony AI Zurich(索尼人工智能苏黎世分部) Sony Group Corporation London(索尼集团公司伦敦分部) Sony Group Corporation New York(索尼集团公司纽约分部)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出基准和自动化评估流程,测试生成式图像模型的知识产权保护证据及生成含可识别知识产权图像的倾向,评估了14个文本到图像模型,发现私有模型有不同程度拒绝生成情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18528 2026-07-07 cs.AI 版本更新 67%

Correlation-Weighted Multi-Reward Optimization for Compositional Generation

基于相关性的多奖励优化用于组合生成

Jungmyung Wi, Hyunsoo Kim, Donghyun Kim

机构 * Korea University(韩国大学) Korea Institute of Science and Technology(韩国科学技术院)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract)

AI总结 本文提出相关性加权多奖励优化方法,通过调整概念奖励权重提升多概念生成效果,改进了SD3.5和FLUX.1-dev模型在多概念基准测试中的表现。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04796 2026-07-07 cs.GR 新提交 57%

Glare Mitigation using a Differentiable Unified Glare Rating

使用可微统一眩光评级减轻眩光

Linas Beresna, Eugene Fiume

专题命中 图像生成评测 :image generation(abstract);分类 cs.GR

AI总结 研究利用可微光传输,引入连续可微的UGR代理,解决低样本密度下蒙特卡洛方差导致的优化不稳定,通过可调Sigmoid边界替换离散UGR阶梯函数,在多领域减轻眩光,提供优化视觉舒适度的管道。

Comments 15 pages, 16 figures. Published in Proceedings of the Eurographics Symposium on Rendering (EGSR) 2026, Symposium Track. This is the authors' version; the definitive version is available at the Eurographics Digital Library

Journal ref Eurographics Symposium on Rendering 2026 (Symposium Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13416 2026-07-07 cs.CV cs.AI 版本更新 57%

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13438 2026-07-07 cs.CV cs.LG 57%

Explainable Concept Generation through Vision-Language Preference Learning for Understanding Neural Networks' Internal Representations

通过视觉-语言偏好学习实现可解释的概念生成以理解神经网络的内部表示

Aditya Taparia, Som Sagar, Ransalu Senanayake

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出通过视觉-语言偏好学习生成概念图像集,解决传统方法需手动收集概念图像集的不足,提高神经网络内部表示理解的效率和可靠性。

Comments 28 pages, 31 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML 2025), PMLR 267:59154-59181, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 10 篇

2602.12262 2026-07-07 cs.CL cs.LG 版本更新 78%

Few-Step Diffusion Language Models via Trajectory Self-Distillation

通过轨迹自蒸馏实现少步扩散语言模型

Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04923 2026-07-07 cs.CV 新提交 74%

UniSpine-GS: An Efficient Physics-Aware Gaussian Framework for Cross-Modality Multi-view Spine Image Synthesis

UniSpine-GS:一种用于跨模态多视图脊柱图像合成的高效物理感知高斯框架

Qiuhua Chen, Changning Yu, Na Huang, Chao Sun, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) The Department of Ultrasound of Renmin Hospital East Branch of Wuhan University(武汉大学人民医院东院区超声科) Institute of Artificial Intelligence, Wuhan University(武汉大学人工智能研究院) National Engineering Research Center for Multimedia Software, Wuhan University(武汉大学多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(武汉大学多媒体网络通信工程湖北省重点实验室)

专题命中 效率与蒸馏 :image synthesis(title);分类 cs.CV

AI总结 为解决脊柱疾病诊断中3D成像成本高、模态差异挑战等问题,提出UniSpine-GS框架,通过3D感知表示用于多视图脊柱成像新视图投影渲染,引入策略提升边界保真度和局部细节,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03524 2026-07-07 cs.CV 新提交 70%

Perceptual Flow Matching for Few-Step Generative Modeling

用于少步生成建模的感知流匹配

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院) Fudan University(复旦大学) Tsinghua University(清华大学) USTC(中国科学技术大学)

专题命中 效率与蒸馏 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06422 2026-07-07 cs.CV 版本更新 70%

Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

通过在基于流的GRPO中对逐步和长期采样效应建模来缓解稀疏奖励

Yunze Tong, Mushui Liu, Canyu Zhao, Didi Zhu, Wanggui He, Shiyi Zhang, Hongwei Zhang, Peng Zhang, Jinlong Liu, Hao Jiang

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究在基于流的GRPO中缓解奖励稀疏问题,提出TurningPoint-GRPO框架,用逐步增量奖励替代基于结果的奖励,识别转折点并赋予长期奖励,有效利用奖励信号提升图像生成效果。

Comments Accepted by ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12555 2026-07-07 cs.SD cs.CV cs.MM 新提交 62%

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

AudioX-Turbo:高效任意到音频生成的统一框架

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Noiz AI Independent Researcher(独立研究员)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03960 2026-07-07 cs.CV 新提交 57%

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

奖励闪电:通过同源偏好蒸馏实现快速视频生成

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型中同时进行偏好对齐和蒸馏加速的挑战,提出统一框架Reward Lightning,利用同源原理在共享表示中对齐和加速模型,介绍潜在奖励模型和同源偏好蒸馏,实验证明其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13649 2026-07-07 cs.CV 版本更新 57%

Distribution Matching Distillation Meets Reinforcement Learning

分布匹配蒸馏与强化学习的结合

Dengyang Jiang, Dongyang Liu, Zanyi Wang, Qilong Wu, Liuzhuozheng Li, Hengzhuang Li, Xin Jin, David Liu, Changsheng Lu, Zhen Li, Bo Zhang, Mengmeng Wang, Steven Hoi, Peng Gao, Harry Yang

机构 * HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) SIAT, CAS(中国科学院深圳先进技术研究院) Shanghai AI Lab(上海人工智能实验室) ZJUT(浙江工业大学) CUHK(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DMDR框架,结合奖励倾斜分布匹配与动态蒸馏策略,通过联合优化提升生成质量与可控性,优于多步生成模型。

Comments [ECCV 26] The synergy of reinforcement learning and distribution matching distillation. See more: https://github.com/vvvvvjdy/dmdr

详情

展开后加载摘要…

URL PDF HTML 收藏