arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-17 至 2026-03-17 共收录 186 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 22 篇

2603.15546 2026-03-17 cs.CV cs.GR cs.RO 62%

Kimodo: Scaling Controllable Human Motion Generation

Kimodo:可控制的人体运动生成

Davis Rempe, Mathis Petrovich, Ye Yuan, Haotian Zhang, Xue Bin Peng, Yifeng Jiang, Tingwu Wang, Umar Iqbal, David Minor, Michael de Ruyter, Jiefeng Li, Chen Tessler, Edy Lim, Eugene Jeong, Sam Wu, Ehsan Hassani, Michael Huang, Jin-Bey Yu, Chaeyeon Chung, Lina Song, Olivier Dionne, Jan Kautz, Simon Yuen, Sanja Fidler

机构 * NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Kimodo模型,通过大规模动作捕捉数据训练,实现高质量可控的人体运动生成,结合文本输入和多种运动约束条件,提升生成质量和泛化能力。

Comments Project page: https://research.nvidia.com/labs/sil/projects/kimodo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV 57%

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01535 2026-03-17 cs.CV 57%

Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing

通过外观和几何属性编辑评估语义分割模型

Zijin Yin, Bing Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。

Comments Accepted to IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14151 2026-03-17 cs.CV 57%

Seeing Through the PRISM: Compound & Controllable Restoration of Scientific Images

通过PRISM:科学图像的复合与可控恢复

Rupa Kurinchi-Vendhan, Pratyusha Sharma, Antonio Torralba, Sara Beery

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PRISM通过结合复合感知监督和加权对比度解纠缠目标,实现科学图像中复杂退化的同时恢复,支持通过自然语言提示选择性修复,提升下游科学准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14112 2026-03-17 cs.CV 57%

Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution

重新审视基于空间-语义引导的超分辨率中的感知-失真权衡

Dan Wang, Haiyan Sun, Shan Du, Z. Jane Wang, Zhaochong An, Serge Belongie, Xinrui Cui

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09160 2026-03-17 cs.CV 57%

WonderVerse: Extendable 3D Scene Generation with Video Generative Models

WonderVerse:基于视频生成模型的可扩展3D场景生成

Hao Feng, Zhi Zuo, Jia-Hui Pan, Ka-Hei Hui, Qi Dou, Jingyu Hu, Zhengzhe Liu

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出WonderVerse框架,利用视频生成模型中的世界级先验知识生成沉浸式且几何一致的3D环境,并引入可控扩展技术与异常序列检测模块,实现高效高质量的可扩展3D场景生成。

Comments Accepted at CVM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13745 2026-03-17 cs.CV 57%

Multi-Object Advertisement Creative Generation

多对象广告创意生成

Jialu Gao, Mithun Das Gupta, Qun Li, Raveena Kshatriya, Andrew D. Wilson, Keng-hao Chang, Balasaravanan Thoravi Kumaravel

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出CreativeAds系统,通过多产品广告生成管道解决大规模广告创作中的产品配对、布局生成和背景生成挑战,实现自动化高质量广告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13368 2026-03-17 cs.CV cs.AI cs.RO 57%

Real-Time Monocular Scene Analysis for UAV in Outdoor Environments

无人机在户外环境中实时单目场景分析

Yara AlaaEldin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Co-SemDepth模型,用于无人机在低空非结构化环境中实时预测深度和语义图。通过合成数据集TopAir和图像风格迁移技术提升泛化能力,并在海洋领域验证模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15292 2026-03-17 stat.ML cs.AI cs.LG 50%

Scalable Simulation-Based Model Inference with Test-Time Complexity Control

可扩展的基于模拟的模型推断与测试时间复杂度控制

Manuel Gloeckler, J. P. Manzano-Patrón, Stamatios N. Sotiropoulos, Cornelius Schröder, Jakob H. Macke

机构 * Machine Learning in Science, University of Tübingen Tübingen AI Center, Tübingen, Germany Max Planck Institute for Intelligent Systems, Department Empirical Inference, Tübingen, Germany Sir Peter Mansfield Imaging Centre, School of Medicine, University of Nottingham, UK National Institute for Health Research (NIHR) Nottingham Biomedical Research Centre, Queens Medical Centre, Nottingham, United Kingdom

专题命中 可控生成 :diffusion(abstract)

AI总结 PRISM通过模拟基于编码器-解码器结构,在大规模模型家族中推断联合后验,同时通过可调模型先验实现测试时间复杂度控制,适用于符号回归和生物物理建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15152 2026-03-17 cs.RO 50%

Master Micro Residual Correction with Adaptive Tactile Fusion and Force-Mixed Control for Contact-Rich Manipulation

通过自适应触觉融合和力混合控制实现接触密集操作的主微残差校正

Xingting Li, Yifan Xie, Han Liu, Wei Hou, Guangyu Chen, Shoujie Li, Wenbo Ding

机构 * Shenzhen Ubiquitous Data Enabling Key Lab, Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China(深圳智能数据赋能重点实验室,深圳国际研究生院,清华大学,深圳518055,中国) School of Electronics and Communication Engineering, Sun Yat-sen University, Shenzhen 518107, China(电子与通信工程学院,中山大学,深圳518107,中国) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore 639956, Singapore(机械与航空航天工程学院,南洋理工大学,新加坡639956,新加坡)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出M2-ResiPolicy,结合高阶动作指导与低阶校正,通过触觉强度驱动的自适应融合机制和力混合PBIC执行层,提升接触密集操作的精度与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14277 2026-03-17 math.OC 50%

Second order necessary conditions for quantum stochastic optimal control problems

二阶必要条件用于量子随机最优控制问题

Penghui Wang, Shan Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过变分方法建立量子随机系统的最优控制二阶必要条件,研究了受费米布朗运动驱动的量子随机微分方程中的控制问题,为量子随机控制的优化研究提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11920 2026-03-17 cs.RO 50%

H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos

H2R: 一种从视频中为机器人预训练的人到机器人的数据增强

Guangrun Li, Yaoxu Lyu, Zhuoyang Liu, Chengkai Hou, Jieyu Zhang, Shanghang Zhang

专题命中 可控生成 :inpainting(abstract)

AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12511 2026-03-17 cs.LG 50%

Trust Region Constrained Measure Transport in Path Space for Stochastic Optimal Control and Inference

路径空间中的信任区域约束度量传输用于随机最优控制与推断

Denis Blessing, Julius Berner, Lorenz Richter, Carles Domingo-Enrich, Yuanqi Du, Arash Vahdat, Gerhard Neumann

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出基于信任区域约束的路径空间度量传输方法,通过系统性逐步逼近目标测度,提升随机最优控制与推断的性能,应用于扩散采样、过渡路径采样和扩散模型微调等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2603.13901 2026-03-17 cs.CV 79%

CT-Conditioned Diffusion Prior with Physics-Constrained Sampling for PET Super-Resolution

带有物理约束采样的CT条件扩散先验用于PET超分辨率

Liutao Yang, Zi Wang, Peiyuan Jing, Xiaowen Wang, Javier A. Montoya-Zegarra, Kuangyu Shi, Daoqiang Zhang, Guang Yang

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种CT条件扩散框架,结合物理约束采样,解决PET超分辨率因缺乏配对多分辨率扫描数据而受限的问题,提升图像质量和临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14850 2026-03-17 cs.CV cond-mat.mes-hall 70%

From Artefact to Insight: Efficient Low-Rank Adaptation of BrushNet for Scanning Probe Microscopy Image Restoration

从 artefact 到洞察:为扫描探针显微镜图像修复的高效低秩适应 BrushNet

Ziwei Wei, Yao Shen, Wanheng Lu, Ghim Wei Ho, Kaiyang Zeng

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于扩散的修复框架,通过低秩适应对BrushNet进行微调,有效去除SPM图像中的结构化artefacts,提升PSNR并降低LPIPS,实现高效图像修复。

Comments 37 pages, 7 figures, 7 tables, jounral paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 6 篇

2603.13695 2026-03-17 cs.HC cs.CV 83%

Steering Generative Models for Accessibility: EasyRead Image Generation

引导生成模型以提升可及性:EasyRead图像生成

Nicolas Dickenmann, Yanis Merzouki, Sonia Laguna, Thy Nowak-Tran, Emanuele Palumbo, Julia E. Vogt, Gerda Binder

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过微调Stable Diffusion模型生成EasyRead图像,提出EasyRead评分标准,展示扩散模型可生成一致的简单图像,提升无障碍内容的可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14770 2026-03-17 cs.CV 79%

AnyPhoto: Multi-Person Identity Preserving Image Generation with ID Adaptive Modulation on Location Canvas

AnyPhoto: 多人身份保持图像生成与基于ID自适应调制的定位画布

Longhui Yuan

专题命中 个性化与一致性 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 AnyPhoto通过定位画布和身份自适应调制实现多人身份保持生成,提升可控性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04784 2026-03-17 cs.CV 79%

PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling

PaCo-RL:通过成对奖励建模推进强化学习用于一致图像生成

Bowen Ping, Chengyou Jia, Minnan Luo, Changliang Xia, Xin Shen, Zhuohang Dang, Hangwei Qian

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出PaCo-RL框架,结合专门的 consistency 奖励模型与高效强化学习算法,提升图像生成中的一致性与稳定性,实验表明其在视觉一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15415 2026-03-17 cs.CV 57%

AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation

AnyCrowd:实例隔离的身份-姿态绑定用于任意多角色动画

Zhenyu Xie, Ji Xia, Michael Kampffmeyer, Panwen Hu, Zehua Ma, Yujian Zheng, Jing Wang, Zheng Chong, Xujie Zhang, Xianhang Cheng, Xiaodan Liang, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) University of Tromsø (UiT) – The Arctic University of Norway, Norway(特罗姆瑟大学(UiT)——挪威北极大学,挪威) Shenzhen campus of Sun Yet-sen University, China(孙中山大学深圳校区,中国)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AnyCrowd框架,通过实例隔离潜在表示和三阶段解耦注意力机制,解决多角色动画中身份与姿态绑定不一致的问题,提升生成视频的可控性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13984 2026-03-17 cs.CV cs.AI 57%

CSD-VAR: Content-Style Decomposition in Visual Autoregressive Models

CSD-VAR:视觉自回归模型中的内容-风格分解

Quang-Binh Nguyen, Minh Luu, Quang Nguyen, Anh Tran, Khoi Nguyen

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CSD-VAR方法,通过视觉自回归模型的逐尺度生成过程提升内容-风格分离,引入三种创新:尺度感知交替优化策略、基于SVD的校正方法和增强键值记忆以提升内容保真度。

Comments Accepted to ICCV 2025; Project page: https://nqbinhcs.github.io/csd-var-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14592 2026-03-17 cs.LG cs.CR 50%

A Multi-Scale Graph Learning Framework with Temporal Consistency Constraints for Financial Fraud Detection in Transaction Networks under Non-Stationary Conditions

具有时间一致性约束的多尺度图学习框架用于交易网络中非平稳条件下的金融欺诈检测

Yiming Lei, Qiannan Shen, Junhao Song

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出STC-MixHop框架,结合多尺度传播与轻量时间一致性建模,用于动态交易网络中的异常检测。通过多尺度邻居扩散编码、时空注意力模块和自监督预训练策略,提升欺诈检测性能,尤其在高不平衡数据中表现优异。

Comments 39 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 4 篇

2511.20629 2026-03-17 cs.CV cs.AI cs.LG 77%

MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿

Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。

Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13497 2026-03-17 cs.CV cs.LG 74%

Synthetic Melanoma Image Generation and Evaluation Using Generative Adversarial Networks

利用生成对抗网络合成黑色素瘤图像及其评估

Pei-Yu Lin, Yidan Shen, Neville Mathew, Renjie Hu, Siyu Huang, Courtney M. Queen, Cameron E. West, Ana Ciurea, George Zouridakis

机构 * Department of Engineering Technology, University of Houston(休斯顿大学工程技术系) Department of Electrical and Computer Engineering, University of Houston(休斯顿大学电气与计算机工程系) Department of Information Science Technology, University of Houston(休斯顿大学信息科学与技术系) School of Computing, Clemson University(克莱姆斯大学计算学院) Department of Public Health, Texas Tech University(德克萨斯技术大学公共卫生系) Department of Dermatology and Pathology, Texas Tech University(德克萨斯技术大学皮肤科与病理学系) Department of Dermatology, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心皮肤科) Department of Biomedical Engineering, University of Houston(休斯顿大学生物医学工程系)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文通过比较四种GAN架构,生成高分辨率黑色素瘤图像,发现StyleGAN2在定量性能和感知质量上表现最佳,且能有效缓解黑色素瘤数据集中的类别不平衡问题。

Comments 18 pages, 7 figures. already accepted to MDPI bioengineering

Journal ref Bioengineering 2026, 13, 245

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13228 2026-03-17 cs.LG cs.AI cs.CV cs.RO 57%

PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization

PhysMoDPO:基于物理的类人运动与偏好优化

Yangsong Zhang, Anujith Muraleedharan, Rikhat Akizhanov, Abdul Ahad Butt, Gül Varol, Pascal Fua, Fabio Pizzati, Ivan Laptev

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工学院,IP巴黎,古斯塔夫·埃菲尔大学,国家科学研究中心) École polytechnique fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 PhysMoDPO通过整合完整身体控制器和偏好优化框架,提升生成运动在物理真实性和任务性能上的表现,适用于文本到运动和空间控制任务。

Comments Project page: https://mael-zys.github.io/PhysMoDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13507 2026-03-17 cs.CV 57%

MIRAGE: Model-agnostic Industrial Realistic Anomaly Generation and Evaluation for Visual Anomaly Detection

MIRAGE:模型无关的工业真实异常生成与评估用于视觉异常检测

Jinwei Hu, Francesco Borsatti, Arianna Stropeni, Davide Dalle Pezze, Manuel Barusco, Gian Antonio Susto

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 MIRAGE提出了一种无需训练和真实异常数据的自动化流程,通过API调用生成模型生成真实异常图像并生成像素级掩码,结合CLIP质量过滤器和轻量级双分支语义变化检测模块,评估生成图像的质量和异常分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 8 篇

2603.13960 2026-03-17 cs.CV 79%

IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillation

IMS3: 破解扩散式数据集蒸馏中的分布聚合

Chenru Wang, Yunyi Chen, Zijun Yang, Joey Tianyi Zhou, Chi Zhang

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出IMS3方法,通过Inversion-Matching和Selective Subgroup Sampling提升数据集的判别性和泛化能力,解决扩散模型生成样本分布不均的问题。

Comments CVPR26 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV 70%

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15279 2026-03-17 cs.LG cs.CV 57%

Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling

通过改进的数据-噪声耦合实现流基生成模型的更快推理

Aram Davtyan, Leello Tadesse Dadi, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LOOM-CFM方法,通过优化 minibatch OT 跨 minibatch 的 assignments,提升流基生成模型在样本速度与质量间的平衡,支持高分辨率潜在空间合成和蒸馏初始化。

Comments Patched from ICLR2025. Code: https://github.com/araachie/loom-cfm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13438 2026-03-17 cs.CV cs.AI 57%

Draft-and-Target Sampling for Video Generation Policy

视频生成策略的草稿与目标采样

Qikang Zhang, Yingjie Lei, Wei Liu, Daochang Liu

机构 * South China Normal University(华南师范大学) University of Western Australia(西澳大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无训练的扩散推理范式,通过自play去噪方法提升视频生成效率,实验表明在三个基准上实现2.1倍加速,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏