Probing and steering biology across Boltz-1s trunk-diffusion boundary
探测与操控Boltz-1主干-扩散边界处的生物学特性
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究以Boltz-1为对象,分析其主干与扩散模块的生物学信息传递差异,验证线性可解码方向的操控性,发布相关资源。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
探测与操控Boltz-1主干-扩散边界处的生物学特性
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究以Boltz-1为对象,分析其主干与扩散模块的生物学信息传递差异,验证线性可解码方向的操控性,发布相关资源。
动态扩散有限元方法的条件唯一性与最优能量范数收敛性
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文针对动态扩散有限元格式,推导其离散解的条件唯一性与最优一阶能量范数收敛估计,数值实验验证了理论结果,拓展了该格式的数学理解。
Comments 35 pages, 5 figures
用于未知流形生成建模的内在混合隐式扩散模型
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究提出ILDM框架,将概率降维与未知流形几何感知扩散结合,通过混合扩散与近似去噪得分匹配方法,在三类数据集上实现生成质量提升,降低了FID和LPIPS分数。
掩码扩散实现连贯节拍跟踪
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对节拍跟踪神经网络的无效输出问题,提出经三项改进的掩码扩散方法,减少不稳定行为并提升了节拍跟踪性能。
Comments Accepted at the 27th International Society for Music Information Retrieval Conference (ISMIR), 2026
探索更多以解决更多问题:通过基于熵的引导提升文本扩散模型的多样性
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)
AI总结 本研究提出无训练的SAKE引导方法,通过核Gram矩阵的二阶Rényi熵动态调整文本扩散模型的采样分布,实现更优的保真度与多样性平衡,提升了代码、数学等推理任务的多样本性能。
超越双向承诺:重新评估扩散语言模型的鲁棒性
机构 * Microsoft(微软公司)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究评估了扩散语言模型的鲁棒性,发现其虽能抵御部分对抗攻击但易受自然噪声影响,存在过度自信问题,脆弱性源于解码器路由故障,需将鲁棒性整合入迭代解码循环。
基于解耦时间深度扩散变换器的内存高效音频合成
机构 * Apple(苹果公司)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。
Comments 11 pages, ICASSP
DSTAR:通过减少空间和时间冗余加速扩散变换器
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)
AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。
Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
AutoAnchor:以交叉注意力作为流形替代的稳定扩散去学习
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)
AI总结 研究文本到图像模型中扩散去学习的不稳定问题,提出AutoAnchor两阶段框架,利用交叉注意力一致性损失自动合成流形近端锚点,有效实现稳健无偏去学习,提升目标概念去除率和非目标效用,还可集成到现有方法中提高性能。
扩散模型中不存在良性过拟合
机构 * INRIA - École Normale Supérieure - PSL Research University - CNRS(INRIA-巴黎高等师范学院-PSL研究大学-CNRS) ; École Polytechnique - CMAP - IP Paris(巴黎高等理工学院-CMAP-IP巴黎)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)
AI总结 该研究证明扩散模型不存在良性过拟合与双下降现象,其泛化由分数时间平滑性、早停等特有机制主导,区别于传统深度学习的泛化规律。
ART 用于扩散采样:连续时间控制与 Actor-Critic 学习
机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系) ; Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系) ; Data Science Institute, Columbia University(哥伦比亚大学数据科学研究所)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)
AI总结 提出自适应重参数化时间 (ART) 方法,将扩散采样的时间步分配建模为连续时间控制问题,并通过强化学习求解,以自适应学习采样时间表,提升样本质量。
Comments 36 pages, 14 figures, 8 tables
扩散变压器的质量感知调制
机构 * Carleton University(卡尔顿大学)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)
AI总结 提出质量表示模块(QRM),通过轻量级变压器学习质量感知向量,调整DiT中的自适应层归一化调制,提升生成图像质量,无需改变采样流程。
Prob-BBDM:用于MRI序列图像到图像翻译的概率布朗桥扩散模型
机构 * University of Poitiers, CNRS, XLIM, France(波尔多大学,法国国家科学研究中心,XLIM,法国) ; University of Poitiers, CNRS, Laboratory of Applied Mathematics, France(波尔多大学,法国国家科学研究中心,应用数学实验室,法国) ; Poitiers University Hospital(波尔多大学医院) ; I3M common laboratory CNRS-Siemens Healthinners, Poitiers University Hospital and University of Poitiers, France(I3M共同实验室,法国国家科学研究中心-西门子医疗,波尔多大学医院和波尔多大学,法国)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)
AI总结 提出基于概率布朗桥扩散模型(Prob-BBDM)的MRI序列图像翻译方法,通过变分编码器引导扩散机制,在BraTS 2021数据集上实现高效高质量合成,仅需4步扩散,SSIM达88.46%,PSNR达26.09 dB。
Journal ref Computerized Medical Imaging and Graphics, 2026, 130, pp.102745
通过生成扩散模型实现单提示审查规避
专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)
AI总结 提出FlowPaint框架,利用扩散模型的语义编辑能力,将审查流量重塑为良性模式,用户仅需自然语言指令即可对抗多种审查范式。
Comments 20 pages, 4 figures, 7 tables. Preprint, under review
MakeupMirror:在用于化妆迁移的扩散模型中改进面部属性保持
机构 * Amazon(亚马逊)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 提出MakeupMirror扩散模型,通过ControlNet几何条件、区域特定迁移控制、肤色调制和Langevin采样器,在保持面部特征和肤色的同时实现高质量化妆迁移,相比Stable-Makeup提升面部识别相似度60%、降低肤色差异50%。
RISE: 面向高效边缘-设备协同扩散模型服务的接力推理与在线调度
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)
AI总结 提出RISE方法,通过训练无关的接力机制利用模型家族共享潜空间,将边缘大模型与设备小模型结合,并采用上下文感知调度器优化质量与延迟权衡。
Comments to be published in IEEE ICWS 2026
多轮反射掩码激发掩码扩散模型中的推理能力
机构 * University of Maryland(马里兰大学) ; Virginia Tech(弗吉尼亚理工大学) ; Intuit ; UC Davis(加州大学戴维斯分校) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)
AI总结 提出反射掩码(RM)方法,通过轻量级后训练使掩码扩散模型具备多轮掩码与去噪能力,实现迭代局部修正,无需架构改变,在文本生成、数独和图像编辑等任务中优于基线。
Comments 22 pages, 6 figures, 5 tables
任务感知的环境增强:通过屏蔽条件扩散实现可靠导航
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。
基于频谱分箱和子域条件扩散的高超声速边界层多尺度重构
机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) ; College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) ; Mathematics and Computer Science Division, Argonne National Laboratory(阿贡国家实验室数学与计算机科学部)
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)
AI总结 提出多尺度概率重构框架,通过条件扩散模型从顶部壁面有限观测推断近壁状态,采用软重叠修复策略和边界频谱损失实现高超声速库埃特流全场重构。
Comments 33 pages, 28 figures
改进反向扩散采样在分类器引导扩散模型中的低密度区域探索
机构 * University of Allahabad(阿拔斯大学)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)
AI总结 提出一种无需额外训练的采样时间密度感知方法,通过修改分类器梯度引导轨迹朝向低置信区域并引导采样朝向预测真实图像,以增强扩散模型对低密度区域的探索。
中心凹成像几何CT架构与种子扩散模型实现全局超分辨率重建
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)
AI总结 提出中心凹成像几何CT架构,集成局部高分辨率数据到低分辨率主导的采集方案,并开发扩散概率超分辨率重建框架,实现全场高分辨率CT图像重建。
Comments 24pages,10figures
通过视频表示正则化缓解复合误差
机构 * Peking University(北京大学)
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。
Qwen-Image-2.0-RL 技术报告
专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)
AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。
Comments 16 pages, 6 figures, 1 table
从名人到普通人:4chan上AI裸化内容、技术与社区动态的特征分析
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 本研究通过分析4chan上的24,105个AI裸化内容,发现目标从名人转向普通人(占55.8%),开源模型(如Stable Diffusion)主导生成,少数活跃生产者驱动社区生态。
Comments 22 pages, 13 figures, 2 tables
以秘密-隐写图像的差异性为设计轴:基于扩散模型的可逆无载体图像隐写术
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 该研究提出InvCISD可逆扩散框架,耦合秘密与参考图像潜在表示,降低秘密-隐写图像视觉相似性,提升隐写质量,为CIS抗隐写分析研究提供方向。
S-Avatar:基于单张图像的扩散引导高斯头部化身
机构 * KAIST(韩国科学技术院) ; KAIST KI-ITC ARRC(韩国科学技术院KI-ITC ARRC)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 S-Avatar通过三阶段流水线,结合扩散引导3DGS生成与FLAME控制,从单张图像生成高逼真3D头部化身,提升了3D一致性,在新视点和表情生成上优于现有方法,适用于VR/AR应用。
Comments 15 pages, 12 figures
MMOE:通过高效专家设计使扩散变压器现代化
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。
Comments 13 pages, 5 figures
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Sun Yat-Sen University(中山大学) ; Technical University of Munich(慕尼黑工业大学) ; Heilbronn Data Science Center(海尔布隆数据科学中心) ; Munich Data Institute(慕尼黑数据研究所)
专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。
Steady-Forcing: 长时程自然视频扩散中空间持久性与运动连续性的平衡
机构 * Department of Computer Science and Engineering, Sogang University(西江大学计算机科学与工程系) ; Department of Artificial Intelligence, Sogang University(西江大学人工智能系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 提出Steady-Forcing框架,通过视觉锚点、运动记忆和蒸馏等技术,在长时程固定相机自然视频生成中平衡背景稳定与运动连续性,优于现有方法。
Comments Project page: https://minar09.github.io/steadyforcing/
Flex4DHuman:面向4D人体重建的灵活多视角视频扩散模型
机构 * University of Washington(华盛顿大学) ; World Labs
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 提出Flex4DHuman,一种基于相对相机位姿条件化的多视角视频扩散模型,无需显式几何先验即可将单目或稀疏多视角视频转换为密集多视角视频,并用于4D高斯溅射重建。
Comments Project Page: https://andy-cheng.github.io/Flex4DHuman/