扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。
论文在FLUX上报告最高6.34倍推理加速,在Qwen-Image-Edit与FLUX.1-Kontext-dev上将FLOPs减少近9倍;与蒸馏模型组合后,最高加速达到14.76倍。数字来自作者指定的模型、分辨率、采样步数和质量设置,不能直接套到所有生成服务。
低分辨率起步,关键区域先升级
动态分辨率采样先在较小潜在网格上完成早期去噪,随后提高分辨率补充细节。已有方法在切换时要么统一上采样,要么仅看局部结构或某一步的统计量。前者浪费计算,后者容易错过与提示词相关、但局部变化并不突出的区域。
AViTS给每个Token计算两类重要性。空间分数来自潜在特征对文本的注意力,用来判断某一区域是否承载提示词要求的主体或属性;时间分数来自相邻扩散步骤间的特征变化,用来识别仍在快速调整、尚未收敛的区域。两个分数融合后决定哪些Token立即进入高分辨率处理,其他Token暂时保留低分辨率表示。
论文示意图比较统一上采样与选择性上采样,并展示关键区域优先细化的生成结果。
这套策略不是永久删除低分Token。分辨率转换发生时,被选中的Token获得更精细表示,暂缓部分仍能在后续阶段参与计算。设计目标是把昂贵的高分辨率运算推迟到它真正产生细节收益的时候。
一套评分同时服务文生图与图像编辑
论文把AViTS接入FLUX、Qwen-Image-Edit和FLUX.1-Kontext-dev。文生图要守住提示词中的主体、关系和局部属性;图像编辑还要区分修改区域与应该保留的原图区域。仅按纹理强弱选择Token,容易把算力投向背景细节,文本注意力为选择过程增加了任务目标。
论文对比图展示不同动态分辨率配置生成的画面,用于观察选择性上采样后主体与局部细节是否保留。
时间维度同样重要。某个Token在单一步骤看起来平稳,并不代表整个去噪过程都已确定;AViTS追踪跨步骤特征变化,减少一次偶然低分造成的误判。空间语义与时间动态结合,构成论文所称的时空重要性感知选择。
6.34倍、近9倍和14.76倍分别指什么
在FLUX实验中,作者报告最高6.34倍加速。Qwen-Image-Edit和FLUX.1-Kontext-dev的结果采用FLOPs衡量,减少幅度接近9倍。两类数字的口径不同:端到端加速会受到显存读写、调度和硬件利用率影响,FLOPs减少则描述理论计算量,不能混为同一个运行时指标。
AViTS框架同时计算Token与文本的空间关联、跨时间步的变化,再执行选择性上采样。
AViTS与蒸馏、量化和特征缓存的作用位置不同。蒸馏减少去噪步骤,量化降低单次运算成本,缓存复用中间特征;AViTS减少进入高分辨率阶段的Token数量。论文将它与蒸馏模型叠加后得到最高14.76倍加速,说明多种优化可以组合,但最终画质仍需按同一提示词、随机种子和评价流程比较。
作者使用定量指标与视觉样例检查质量—效率折中。高倍率结果并不表示像素级无损:选择阈值越激进,越可能漏掉细小文字、边缘或提示词中的弱显著对象。论文的贡献是让这项取舍由时空分数控制,而不是假设所有位置同等重要。
从论文加速走向生成服务
部署到在线生成系统时,AViTS适合与现有蒸馏或缓存流水线并行评估。服务方可以按延迟预算设置Token保留比例,并对人物手部、文字、商品边缘和局部编辑区域建立单独质量回归,避免平均指标掩盖关键失败。
兼容性实验说明选择性上采样可以和蒸馏等优化组合,收益取决于具体模型与配置。
下一步还要观察真实硬件上的吞吐、首图延迟和显存峰值。若动态Token数量造成批处理形状频繁变化,理论FLOPs节省未必全部转化为服务吞吐。论文已给出跨文生图与编辑模型的结果,工程验证应把同画质下的端到端成本作为主指标。