Tuning ergodicity breaking: Anomalous diffusion under asymptotic power-law forcing
调节遍历性破缺:渐近幂律强迫下的反常扩散
专题命中 扩散模型 :diffusion(title)
AI总结 研究通过广义朗之万方程中的标度参数η,揭示了渐近幂律外力驱动下系统的热化、遍历性破缺和失控增长三种动力学相,并发现涨落-耗散定理与外力无关。
Comments 5 pages, 2 figures
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
调节遍历性破缺:渐近幂律强迫下的反常扩散
专题命中 扩散模型 :diffusion(title)
AI总结 研究通过广义朗之万方程中的标度参数η,揭示了渐近幂律外力驱动下系统的热化、遍历性破缺和失控增长三种动力学相,并发现涨落-耗散定理与外力无关。
Comments 5 pages, 2 figures
VoidPadding: 让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 专注于语义终止
机构 * Tsinghua University(清华大学)
专题命中 扩散模型 :diffusion(title)
AI总结 提出VoidPadding方法,通过引入[VOID]令牌处理填充,将[EOS]从双重角色中解放,实现大块解码下的早期停止和自适应响应扩展,在数学推理和代码生成任务上平均提升17.84分,并减少55.7%的NFE。
Comments Minor related-work revisions; results unchanged
DF-ExpEnse: 扩散滤波探索用于高效样本微调
机构 * Stanford University(斯坦福大学) ; Brown University(布朗大学)
专题命中 扩散模型 :diffusion(title)
AI总结 提出DF-ExpEnse探索技术,利用生成控制策略的多模态建模能力和评论家集成,在微调中高效收集在线经验,提升样本效率。
Comments ICML 2026
具有最大值型收益的斜反射扩散的测度值障碍问题
专题命中 扩散模型 :diffusion(title)
AI总结 针对非负象限中具有非光滑最大值型收益的斜反射最优停止问题,提出测度值势论形式的障碍问题公式,推导反射Itô-Tanaka恒等式,并证明验证定理。
马尔可夫噪声下线性特征时序差分学习的扩散近似
机构 * Technical University of Munich (TUM), Munich, Germany(慕尼黑技术大学) ; University of Basel, Basel, Switzerland(巴塞尔大学) ; Boston University, Boston, USA(波士顿大学)
专题命中 扩散模型 :diffusion(title)
AI总结 针对线性TD(0)在马尔可夫噪声下的随机波动,提出随机微分方程近似模型,揭示投影Bellman算子收缩动力学与马尔可夫采样影响的区别,解释常数步长误差下限。
平滑KL重加权:基于信噪比的扩散训练的原则性解释与匹配规则
专题命中 扩散模型 :diffusion(title)
AI总结 提出平滑KL重加权方法,从扩散散度推导出闭式权重,建立与Min-SNR家族的匹配规则,在CIFAR-10和CelebA-64上验证,最终FID相当但迭代效率因数据集而异。
语音遇见ELF:用于语音识别和翻译的音频条件连续目标扩散
机构 * Tianjin University(天津大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nankai University(南开大学)
专题命中 扩散模型 :diffusion(title)
AI总结 提出ELF-S2T,一种基于预训练ELF骨干的音频条件连续目标生成模型,通过音频强制训练和分类器自由引导,在LibriSpeech和CoVoST2上实现竞争性ASR和S2TT性能,并揭示识别与翻译错误均源于连续潜空间中的近距离混淆。
超越文本条件:面向视频生成的MLLM-DiT融合系统研究
机构 * Chinese Academy of Sciences(中国科学院) ; Microsoft Research(微软研究院) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学)
专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。
合成数据生成在数据稀缺的专业领域中的局限性
机构 * University of Pennsylvania(宾夕法尼亚大学) ; The Hong Kong Polytechnic University (PolyU)(香港理工大学)
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 该研究针对数据稀缺的专业视觉领域,评估两类生成式稀疏数据扩展方法的分类性能,发现其无法持续优于非生成式基线,且存在记忆坍缩等失败模式。
生成器偏移下AI生成艺术检测器的鲁棒性
机构 * San Jose State University(圣何塞州立大学)
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 该研究针对生成器偏移问题,在SD3.5m数据集上评估了五个AI艺术检测器的鲁棒性,发现模型在跨生成器场景下泛化能力不足,CLIP ViT-L/14表现最优,为分层防御检测器的开发提供了依据。
Comments To appear as a chapter in the book "Artificial Intelligence for Cyber Defense in Emerging Threats", to be published by Springer by early 2027
PEAK:基于k稀疏自编码器(kSAEs)的精确且持久的概念擦除
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本研究针对文本到图像扩散模型的概念擦除难题,提出基于k稀疏自编码器的PEAK框架,实现了精确持久的概念擦除,在I2P基准上大幅降低了冒犯性内容检测量与攻击成功率,同时保留了生成质量。
保留更多细节:缓解真实世界图像超分辨率中的内容漂移
机构 * Xiaomi Corporation(小米公司)
专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 针对真实世界图像超分辨率中因低质量输入导致的内容漂移问题,提出双路径架构的新型单步扩散模型FSP-Diff,在标准基准上优于现有单步扩散方法。
Comments Accepted to ACM MM 2026. This is the author's accepted version. The definitive version is published in the Proceedings of ACM MM 2026
可持续扩展的脑MRI基础模型
机构 * University of Cambridge(剑桥大学) ; University of Málaga(马拉加大学)
专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。
先校正再扩散:去噪轨迹展开前解耦概念
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 针对文本到图像扩散模型多概念生成时的遗漏或合并错误,提出无训练框架RTD,通过SOD和IGR校正初始概念分配,在AE-Bench上实现组合保真度与效率的显著提升
MoRAE:面向文本到动作生成的流友好型自监督隐变量
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 MoRAE针对文本到动作生成中直接采用图像生成RAE范式的失败,解决了动作空间的两个特有瓶颈,使Flow-Matching DiT实现了最先进的文本到动作生成性能。
Two2Four:基于人类动作的生成式四足动物操控
专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.GR
AI总结 该研究提出Two2Four框架,采用两阶段生成扩散模型,可从人类动作生成可控逼真四足动物动作,用于动画和虚拟制作,效果优于现有重定向方法。
TIGA:针对黑盒AIGC检测器的轨迹注入生成攻击
机构 * School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院) ; Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) ; School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(四川大学计算机学院机器学习与工业智能工程研究中心) ; PCA Laboratory, Key Laboratory of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院高维信息智能感知与系统教育部重点实验室PCA实验室) ; Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) ; School of Engineering, Edith Cowan University(伊迪斯科文大学工程学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 针对黑盒AIGC检测器,TIGA提出无需源图像和训练的框架,通过操纵DDIM轨迹、聚合梯度及方向搜索估计目标响应,实现强大黑盒攻击性能、可转移性及高鲁棒性,且无需源图像或扩散模型再训练。
Comments 14 pages, 5 figures
ScaleResfusion:基于残差向量场的残差整流流
机构 * Nankai University(南开大学) ; University of Macau(澳门大学) ; Csiro Data 61(联邦科学与工业研究组织数据61部) ; Beihang University(北京航空航天大学)
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 研究旨在解决现实世界图像恢复问题,提出ScaleResfusion框架,核心是残差整流流,从低质量图像出发学习残差向量场,结合知识蒸馏降低采样成本,实验证明其高效且性能优,为图像恢复提供实用可扩展方法。
擦除还是不擦除:基于保留感知自适应排序子空间扩展的无训练鲁棒概念擦除
机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 研究针对文本到图像扩散模型的概念擦除技术面临的鲁棒性与效用权衡问题,提出无训练框架PARSE,通过自适应发现擦除与保留概念、编辑交叉注意力值空间及迭代搜索触发因素来实现鲁棒概念擦除,引入BEUS评估,实验证明其有效性。
Twins:使用焦点损失学习预测统一表示
机构 * Tencent-Hunyuan(腾讯混元)
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 研究统一多模态模型潜在空间不匹配问题,提出Twins统一连续令牌空间。因联合建模有优化不平衡,采用焦点回归目标解决,在ImageNet上有gFID增益,在多模态理解基准测试中表现好,还提高了重建保真度。
Comments ICML 2026. Code: https://github.com/Tencent-Hunyuan/Twins
SlerpFlow:用于整流流反演的球形轨迹校正
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 研究针对基于整流流的图像生成中反演难题,提出SlerpFlow方法,基于流形假设,整合球形线性插值校正流速度方向,缓存校正速度,实现高精度反演,提升重建保真度与编辑语义对齐,无需额外训练。
Comments 16 pages. Accepted at ICML 2026
带符号整流流:负性控制生成
机构 * UT Austin(德克萨斯大学奥斯汀分校)
专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 研究提出带符号整流流(Signed RF),通过推广整流流,基于带符号测度构建生成模型,能将概率集中在正区域并排除负区域。分析其连续性方程并给出解释,推动实用算法,在多应用中提升性能,改进了保真度 - 多样性权衡等。
用于图像重光照的一致特征传输
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; MT Lab, Meitu Inc.(美图公司MT实验室) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 研究图像重光照问题,提出一致特征传输(CFT)方法,基于整流流通过轨迹级监督联合建模噪声到图像生成及光照一致的源到目标传输,构建数据集实验验证,该方法能改进重光照并推广到其他编辑任务。
DNA:用于生成图像源追踪的双阶段原生归因
机构 * University of Science and Technology of China(中国科学技术大学) ; Hefei University of Technology(合肥工业大学)
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 针对图像生成中家族内变体源追踪难题,提出双阶段原生归因(DNA)框架。粗粒度用 AEDR 筛选,细粒度用 NPC 归因。构建 DNA-30K 基准,实验表明 DNA 准确率高,优于基线,为图像源追踪提供有效方法。
Comments 18 pages
用弗雷歇距离损失改进医学图像生成模型
机构 * Yale University(耶鲁大学)
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 研究针对扩散生成模型难以捕捉异质性肿瘤复杂形态特征的问题,提出用弗雷歇距离损失微调模型,通过在多数据集上集成该损失,提升了下游分割网络性能,证明其是改进医学图像生成模型临床工作流程的有效正则化方法。
用于快速和高保真虚拟试穿的结构-细节解耦自回归生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Wuhan Institute of Technology(武汉工程大学) ; Xiaomi EV(小米汽车)
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 研究虚拟试穿问题,提出STAR-VTON框架,通过解耦潜在空间结构合成与像素空间细节恢复,结合匹配信息细化器,实现高效高保真虚拟试穿,其中VAR-VTON效率高,像素空间细化器能有效恢复细节。
Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习
机构 * LIRIS(里昂图像与信息系统实验室) ; Ecole Centrale de Lyon(里昂中央理工学院)
专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。
TILDE:基于倾斜的概念遗忘分布擦除
机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校) ; Sony AI(索尼人工智能公司) ; Sony Group Corporation(索尼集团公司)
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 文本到图像扩散模型的概念遗忘研究中,提出TILDE方法,将概念遗忘视为分布对齐问题,通过能量倾斜的无锚点目标抑制概念图像,用残差∇-GFlowNet训练实例化,实验显示其在多方面实现强大遗忘效果,提升保留率和分布保真度。
RADIANCE:使用IP-适配器进行相对自适应去噪以增强新颖概念
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 针对文本到图像扩散模型合成罕见概念的问题,提出无训练框架RADIANCE,通过三个模块组件增强预训练主干,经实验验证其能提升合成效果。
Comments Accepted to ECCV 2026. Camera-ready version
视频生成模型是内在的光照估计器
机构 * Peking University(北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; OpenBayes Information Technology Co., Ltd.(北京智谱华章科技有限公司)
专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 研究从单张自然视频恢复动态环境图的问题,核心方法是将光照估计重构为引导视频修复任务,贡献是提出V-LITE框架,能生成连贯HDR环境图,证明视频扩散模型可估计物理场景光照。
Comments Project Page: https://caiziqi.com/research/vlite/