arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-14 至 2026-08-14 共收录 54 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 84%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13112 2026-08-14 cs.CV 新提交 70%

Towards Physics-Faithful Generation of Scientific Diagrams

面向物理保真的科学图表生成

Minghui Zhang, Jinxin Shi, Yifan Chang, Liangliang Zhao, Yuandong Pu, Qian Yu, Ming Hu, Hanxiao Zhang, Yun Gu, Yirong Chen, Yu Qiao, Bo Zhang, Xiangchao Yan, Bin Fu, Yihao Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对现有文本到图像生成模型生成的科学图表存在物理错误的问题,提出Princigram生成器,通过结构化物理思维链实现物理保真的科学图表生成,在相关基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13541 2026-08-14 cs.CV cs.GR 新提交 62%

SCULPT: Subtractive Composition for 3D Part Generation

SCULPT:用于3D部件生成的减法组合方法

Sikuang Li, Chen Yang, Jiemin Fang, Jiazhong Cen, Yuhe Wei, Jichen Pang, Wei Shen, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 SCULPT是一种3D部件生成框架,通过减法组合方式生成部件,解决了现有方法的边界问题,在PartObjaverse上实现了最优几何性能,还能完成细粒度纹理部件分解。

Comments Project page: https://sculpt-part.github.io/ Code: https://github.com/sculpt-part/SCULPT

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.12876 2026-08-14 cs.CV cs.AI 新提交 57%

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据

Yicheng Bao, Xiahui Guo, Xuhong Wang, Xin Tan

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 41 篇

2608.12328 2026-08-14 cs.CL 新提交 89%

LoRA-Diffusion: Parameter-Efficient Fine-Tuning via Low-Rank Trajectory Decomposition

LoRA-Diffusion:基于低秩轨迹分解的参数高效微调方法

Iman Khazrak, Narges Nejad, Mohammadhossein Homaei, Mostafa M. Rezaee, Robert C. Green

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出 LoRA-Diffusion,将低秩分解应用于扩散式语言模型的去噪轨迹而非权重,引入轨迹级适配器等技术,在 SST-2 等数据集上取得优异性能,为扩散式语言模型提供参数高效微调框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13079 2026-08-14 cs.LG 新提交 87%

Learning Discrete Decisions for MIPs with Constraint-Aware Diffusion

基于约束感知扩散的混合整数规划离散决策学习

Vincenzo Di Vito, Mehdi Taghizadeh, Deepjyoti Deka, Kaarthik Sundar, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) MIT(麻省理工学院) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究提出Constrained Graph Diffusion(CGD)框架,结合图扩散模型与可行性投影算子求解混合整数规划,在两类任务上较基线方法提升可行性与质量,且最高加速425倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13455 2026-08-14 cs.CV 新提交 83%

Evaluation of Clinically Steerable Retinal Image Generation from Foundation Model Latent Spaces

基于基础模型潜在空间的临床可操控视网膜图像生成评估

Zuzanna A. Wakefield-Skórniewska, Bartłomiej W. Papież

机构 * Nuffield Department of Population Health, University of Oxford(牛津大学纳菲尔德人口健康系) University of Oxford(牛津大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究评估了四种视网膜基础模型的可控图像生成能力,发现其在自身框架内生成的视网膜图像优于传统潜在扩散,但与真实图像存在表征差距,需进一步对齐。

Comments MICCAI 2026 Workshop SASHIMI Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13043 2026-08-14 cs.AI cs.CV cs.LG 新提交 83%

From Local Mismatch to Global Impact: Optimizing Cache Reuse Policy for Efficient Diffusion

从局部失配到全局影响:优化缓存重用策略以实现高效扩散模型

Xichen Ye, Yifan Wu, Zhikang Xie, Xiangyu Yue, Cheng Jin, Weizhong Zhang

机构 * Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型缓存策略与生成质量失配问题,提出GCache双层优化框架,在Wan2.1模型上实现2.17倍加速且LPIPS降至0.0316,性能优于现有缓存策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13457 2026-08-14 cs.LG 新提交 82%

Symmetry-Breaking De Novo Crystal Generation via Markovian Jump Diffusion

基于马尔可夫跳跃扩散的对称性破缺从头晶体生成

Van Khoa Nguyen, Alexandros Kalousis

机构 * HES-SO Geneva(日内瓦高等教育学院) University of Geneva(日内瓦大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对现有晶体生成模型难以捕捉全局对称性的问题,提出SbCD模型,通过马尔可夫跳跃扩散过程实现对称性破缺,在MP20和MPTS-52数据集上表现优于保对称性模型,为晶体生成建模提供新方案。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13255 2026-08-14 cs.CV cs.AI 新提交 79%

GeoCache: Training-Free Acceleration of Multi-View Texture Diffusion via Geometric Delta Transport

GeoCache:通过几何增量传输实现多视图纹理扩散的无训练加速

Haotang Li, Zhenyu Qi, Shaohan Henry Wang, Kebin Peng, Yutong Zhao, Zi Wang, Bo Liu, Huanrui Yang, Sen He

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无训练插件GeoCache,通过传输锚点视图的几何对齐更新实现多视图纹理扩散加速,在三个基准数据集上实现优于时间缓存和步骤缩减的速度-保真度权衡,2倍以上加速时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12583 2026-08-14 q-fin.CP 新提交 78%

Diffusion Models in Finance: A Survey

金融中的扩散模型:一项综述

Zhuohan Wang, Carmine Ventre

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该综述聚焦金融领域的扩散族生成模型,按金融数据类型分类梳理相关研究,是首个针对金融数据扩散族模型的专门综述,还开源了相关代码仓库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13524 2026-08-14 cs.LG 新提交 78%

DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

DARTree:基于自回归草稿树的推测式扩散解码

Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DARTree是无需训练的推测式解码方法,将AR修正头从链扩展至树,在7个数学、代码、聊天基准的4种模型-温度配置下,实现最高平均接受长度与加速比,达9.73倍无损加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12436 2026-08-14 cs.LG cs.MA cs.NI 新提交 78%

Multi-AUV Ad-hoc network-based Target Tracking: A Value Gradient Guidance Multi-Agent Diffusion Reinforcement Learning Approach

基于多AUV自组织网络的目标跟踪:一种值梯度引导多智能体扩散强化学习方法

Jiaao Ma, Chuan Lin, Guangjie Han, Shengchao Zhu, Qian Zhu, Ying Liu, Zhenyu Wang

机构 * Software College, Northeastern University(东北大学软件学院) Hohai University(河海大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对多AUV自组织网络目标跟踪的训练不稳定、跟踪性能差问题,提出VGG-MADiffRL算法与MDCA架构,实现了更快收敛、更高跟踪精度与平稳训练动态,具有工程应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13520 2026-08-14 cs.LG cs.AI cs.IT math.IT math.ST stat.ML stat.TH 新提交 78%

The data geometry of masking diffusion: Certified-optimal schedules via unmasking growth complexity

掩码扩散的数据几何:通过去掩蔽增长复杂度实现可验证最优调度

Martin J. Wainwright

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究引入去掩蔽增长复杂度(UGC)度量,推导了离散采样掩码扩散的可验证最优调度,得到适配数据几何的采样器,其迭代复杂度接近神谕过程,且在维度相关收益上优于粗调度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13203 2026-08-14 math.OC 新提交 78%

Positive stabilization of a pure diffusion system

纯扩散系统的正镇定

Violaine Piengeon, Joseph J. Winkin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对带点观测的边界控制扩散系统,解析研究了三类正相关问题,提出原创观测器反馈镇定策略,对其空间离散化形式做严格对比并推导了易实现的解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12381 2026-08-14 math.AP 新提交 78%

Regularity of Solutions to One-Dimensional Degenerate Diffusion Equations with Reactions

带反应项的一维退化扩散方程解的正则性

Bendong Lou, Junfan Lu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对含反应项的一维退化扩散方程,建立了解与自由边界的系统正则性理论,强化了自由边界运动速度的已有结论,并将多孔介质方程的经典正则性性质推广至更广的方程类。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12808 2026-08-14 physics.comp-ph 新提交 78%

A discrete duality finite volume method with harmonic average for semiconductor drift-diffusion equations

用于半导体漂移-扩散方程的带调和平均的离散对偶有限体积方法

Shuya Liu, Zhicheng Liu, Bo Lin, Chijie Zhuang, Qingyuan Shi, Weizhu Bao, Rong Zeng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对半导体漂移-扩散方程,提出整合调和平均稳定化的离散对偶有限体积方法(DDFV-HA),该方法在低质量网格上比经典FVSG方法更可靠精确,适配复杂不规则域的半导体模拟需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12498 2026-08-14 physics.plasm-ph physics.flu-dyn 新提交 78%

Evaluation of the Ambipolar Diffusion Approximation in Partially Ionized Rarefied Hypersonic Flows

部分电离稀薄高超声速流动中双极扩散近似的评估

Marisa Petrusky, Iain D. Boyd

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过氩气的高超声速流动动力学模拟,评估双极扩散近似在稀薄高超声速流动中的有效性,提出了等离子体扩散区域识别及该近似应用的新准则。

Comments The following article has been submitted to Physics of Plasmas. After it is published, it will be found at https://publishing.aip.org/resources/librarians/products/journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13332 2026-08-14 math.AP math-ph math.MP math.PR 新提交 78%

Global classical solutions by transport noise for reaction-diffusion systems with entropy dissipation

带输运噪声的反应扩散系统的全局经典解,具有熵耗散特性

Antonio Agresti, Michael Kniely, Bao Quoc Tang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对确定性框架下反应扩散系统全局经典解存在性的开放问题,该文证明适当输运噪声可使复杂平衡化学反应网络生成时间全局的唯一强解,还能按指定速率增强空间涨落耗散,证明结合了多种分析方法。

Comments 57 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13123 2026-08-14 physics.comp-ph cond-mat.stat-mech 新提交 78%

Using Diffusion Models to Estimate Uncertainties in Analytic Continuation

利用扩散模型估计解析延拓中的不确定性

Sagi Meir, Daniel Freedman, Barak Hirshberg

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出基于扩散模型的解析延拓框架,可量化解析延拓的不确定性,还能评估逆问题固有难度,在液态仲氢模拟数据应用中取得了良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12562 2026-08-14 physics.chem-ph cond-mat.stat-mech physics.comp-ph 新提交 78%

Diffusion and Solvation Dynamics of Ions in Water: Beyond the Brownian Approximation

水中离子的扩散与溶剂化动力学:超越布朗近似

Ian C. Bourg, Minh Thê Hoang Ngoc, Thomas R. Underwood, Carlos Vega

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究探究多种碱金属、碱土金属及氯离子的耦合动力学,发现其振动功率谱的晃动频率对同位素质量有不同敏感性,或可作为离子溶剂化及类霍夫迈斯特效应的特征。

Comments 27 pages total, including 4 pages of Supplementary Information; 7 figures (6 main, 1 supplementary) and 7 tables (including 5 supplementary)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13540 2026-08-14 cond-mat.supr-con cond-mat.mtrl-sci physics.acc-ph 新提交 78%

Insight into SRF cavity performance from simulations of Nb's surface oxide dissolution and diffusion

从铌表面氧化物的溶解与扩散模拟探究SRF腔性能

Ryan M. L. McFadden, Rowan Becker, Tobias Junginger

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过模拟Nb表面氧化物的溶解与扩散,揭示氧掺杂对Nb迈斯纳屏蔽电流的影响,建立了氧扩散剖面与SRF腔超导性能的定量关联框架。

Comments 17 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13205 2026-08-14 cs.CV 新提交 74%

HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Xuanlang Dai, Shengyuan Ding, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Dahua Lin, Xingang Pan

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(奥多比研究院) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(InnoHK下属CPII机构)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。

Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12344 2026-08-14 cs.CL cs.CY stat.AP 新提交 71%

Predicting consumer-technology ownership without a diffusion history

基于扩散历史预测消费技术拥有情况

Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling

专题命中 扩散模型 :diffusion(title)

AI总结 该研究利用人类及Anthropic Claude Opus 4.7、OpenAI GPT-5.5两款语言模型对消费技术的属性评分,通过符号约束惩罚回归预测技术拥有率,其效果优于上市年限基准模型,还对2025-2026年新品做了2027年拥有率预测。

Comments 31 pages, 4 figures, supplementary material included (Tables S1-S6, Figure S1), data and code at https://osf.io/dr5ct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12416 2026-08-14 cs.RO 新提交 67%

RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

RoboSynChallenge:通过泛化合成操作技能掌握真实世界灵巧操作

Runyi Zhao, Ruixin Wu, Chengkun Li, Hongrui Zhang, Ang Li, Ruixing Jin, Yueci Deng, Yingying Guo, Lihe Ding, Shaocong Dong, Tianfan Xue, Yanjun Gao, Yudong Luo, Pascal Poupart, Simo Wu, Kui Jia, Wei-shi Zheng, Guiliang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce(德克斯力公司) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) University of Colorado Anschutz(科罗拉多大学安舒茨医学中心) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute (SLAI)(深圳环区研究所)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 RoboSynChallenge竞赛推出统一基准,结合合成数据与真实评估,提供多类基准策略,旨在推动开发泛化性强、数据高效的机器人操作系统,助力通用机器人智能发展。

Comments NeurIPS 2026 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13460 2026-08-14 cs.CV 新提交 57%

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

SNM-VFI:对称非线性运动引导的生成式视频帧插值

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

机构 * Qualcomm(高通公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。

Comments ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13037 2026-08-14 cs.CV 新提交 57%

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

基于推理时无梯度优化的空间接地文本到视频生成

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) Obvious Research

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。

Comments Final Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13028 2026-08-14 cs.CV cs.RO 新提交 57%

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

用于改进人机物体交接预测的RGB-D视频生成

Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12997 2026-08-14 cs.CV 新提交 57%

PixSDS: Why Latent SDS Makes Noisy Pixels

PixSDS:潜在SDS为何会产生带噪像素

Vsevolod Skorokhodov

机构 * EPFL(洛桑联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对潜在SDS生成3D时的像素漂移问题,提出轻量级VAE一致性梯度修复方法PixSDS,减少结构化伪影并保留语义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12780 2026-08-14 cs.CV 新提交 57%

SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention

SCOPE:用于稀疏视频注意力的在线分头Top-K估计的子空间聚类

Qi Zhao, Qirui Li, Hanlin Tang, Yiduo Li, Zhen Guo, Cuifeng Shen, Chao Xu, Zhaosheng Chi, Xiaojin Lu, Kan Liu, Tao Lan, Lin Qu, Xi Li

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SCOPE是一种无训练稀疏注意力框架,通过子空间聚类与在线分头Top-k估计解决视频DiTs的高成本问题,在6种配置中优于基线,实现1.99倍加速且保持28.46 dB PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏