Dynamical Regimes of Discrete Diffusion Models
离散扩散模型的动力学区域
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了离散扩散模型的动力学行为,通过统计力学方法分析了其在二类Ising变量数据上的反向动力学,发现物种化和崩溃转变分别对应二级相变和凝结转变,理论预测通过数值模拟得到验证。
Comments 36 pages, 7 figures
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
离散扩散模型的动力学区域
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了离散扩散模型的动力学行为,通过统计力学方法分析了其在二类Ising变量数据上的反向动力学,发现物种化和崩溃转变分别对应二级相变和凝结转变,理论预测通过数值模拟得到验证。
Comments 36 pages, 7 figures
一个异质非局部对流-扩散系统
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了非局部对流-扩散方程组在异质种群上的局部和全局适定性,通过半群理论和压缩映射原理获得弱解的局部适定性及正则性,利用Nash不等式和初始数据小性条件分别建立正则核和非正则核的全局界。
HYGENE: 一种基于扩散的超图生成方法
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 提出一种基于扩散过程的超图生成方法HYGENE,通过渐进局部扩展和去噪扩散过程,从单对连接节点逐步构建目标超图,首次将深度学习应用于超图生成。
Comments arXiv admin note: text overlap with arXiv:2312.11529 by other authors
利用重离子碰撞中的dijet观测喷流扩散尾
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究通过比较PbPb和pp碰撞中的dijet-Hadron相关性,观测到喷流扩散尾的存在,揭示了喷流在高温等离子体中的能量沉积效应。
Comments Replaced with the published version. Added the journal reference and the DOI. All the figures and tables, including additional supplementary figures, can be found at http://cms-results.web.cern.ch/cms-results/public-results/publications/HIN-25-012 (CMS Public Pages)
Journal ref Phys. Rev. Lett. 137 (2026) 071902
DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作
机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) ; School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) ; Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) ; State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率
Comments 25 pages, 8 figures. Project Page: https://baai-humanoid.github.io/DECO-webpage/
专题命中 扩散模型 :diffusion(title,abstract)
Comments 13 pages, 11 figures, 3 tables
Journal ref Quantum Sci. Technol. 11 (3), 035047 (2026)
扩散模型在味模型中的应用:以$S_4^\prime$模味模型为例
机构 * Department of Physics, Kyushu University(九州大学物理系)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 利用扩散模型(一种生成式人工智能)提出一种数值方法,通过实验约束搜索味模型参数,并以$S_4^\prime$模味模型为例,构建神经网络再现夸克质量、CKM矩阵和Jarlskog不变量,发现新的现象学感兴趣参数区域,并确认自发CP破坏。
Comments 23 pages, 5 figures, v2: published version
Journal ref Prog. Theor. Exp. Phys. 2026 (2026) 5, 053B08
CLONE: 基于3DGS的闭环可微优化框架用于单图像法线估计
机构 * School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机科学学院,中国无锡) ; School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,中国香港)
专题命中 扩散模型 :diffusion(title);分类 cs.CV
AI总结 提出CLONE框架,通过3D高斯泼溅参数化场景并利用协方差特征分解得到连续可微法线,结合可微光照模型和一步确定性扩散精化网络,在统一重投影目标下联合优化,实现无需真值法线监督的几何一致性单图像法线估计。
能量引导的流匹配(Energy-Guided Flow Matching)
专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出能量引导的流匹配(EG-FM),通过移动端点显式建模从粗到细的生成轨迹,无需额外适配,在ImageNet类条件图像生成及文本到图像生成任务中均取得优异性能。
Comments 19 pages, Code:https://github.com/ysng123/EG-FM
AnyTalk:利用视频生成模型实现任意角色的语音动画
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 AnyTalk是一种无需动画数据、利用视频扩散模型的新方法,可生成任意角色的3D语音动画,还能蒸馏出实时版本,降低了人工与数据需求。
Comments accepted to TVCG, Project page at https://serin-yoon.github.io/projects/anytalk/
Omni-LiveAvatar:分钟级实时流式视听联动数字人生成
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。
GestureLSM:基于隐式捷径的时空建模语音同步手势生成
机构 * University of Rochester(罗切斯特大学) ; University of Tokyo(东京大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 GestureLSM通过时空建模与改进的流匹配方法,在BEAT2数据集上实现了最优语音同步手势生成,同时大幅缩短推理时间,可用于增强数字人和具身智能体。
Comments Accepted to ICCV 2025. Project Page: https://andypinxinliu.github.io/GestureLSM
CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景
专题命中 扩散模型 :diffusion(abstract);分类 cs.MM
AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。
Comments Accepted to ACM MM 2026
利用3D生成AI从烟雾病患者的基线MRI合成乙酰唑胺给药后脑血流量图
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本研究提出CAE3D模型,可从烟雾病患者基线MRI合成乙酰唑胺后脑血流量图,在多指标上优于对比方法,为ACZ禁忌患者的血流动力学评估提供可行方案。
Comments 25 pages. Accepted at Machine Learning for Healthcare (MLHC 2026). To appear in Proceedings of Machine Learning Research (PMLR), volume 340
用于教学视频中推理时流程规划的对比能量场(CEFITO)
机构 * TU Darmstadt(达姆施塔特工业大学) ; TU Munich(慕尼黑工业大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对现有流程规划方法缺乏任务逻辑约束的问题,提出CEFITO方法,将流程规划构建为任务约束优化问题,在两个基准上取得最先进准确率。
Comments To appear at GCPR 2026 (oral paper). Project page: https://visinf.github.io/cefito
用于乌克兰战区受损农田卫星分析的合成数据增强方法
机构 * Ukrainian Catholic University(乌克兰天主教大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本研究针对乌克兰受损农田卫星分析的标注数据稀缺问题,采用类别条件GAN与DDPM生成合成农田样本,结合真实数据训练视觉Transformer,使分类性能显著提升,验证了合成卫星图像在数据稀缺地理空间应用的潜力。
DriveCache:面向驾驶世界模型推理的动作感知缓存
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。
Comments 9 pages, 7 figures, 4 tables
为文本-音频-视频模型添加带单个零初始化层的语音克隆功能
机构 * Kandinsky Lab(坎丁斯基实验室)
专题命中 扩散模型 :diffusion(abstract);分类 cs.MM
AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。
RigidBench:评估视频生成模型中的刚体物理效果
机构 * University of Cambridge(剑桥大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。
Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156
基于自适应秩聚类滤波器的图像去噪方法
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出自适应秩聚类滤波器,经Otsu聚类、模糊融合处理像素强度,在混合噪声场景下对图像去噪的鲁棒性优于多种基线滤波算法。
Comments 18 pages; 8 figures
FMReward:基于人类偏好的音频驱动三维面部动画对齐与评估框架
机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) ; USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学 USC-文化创意产业学院) ; Institut Universitaire de France (IUF)(法国大学研究院) ; University of Nantes(南特大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文构建首个音频驱动三维面部动画人类偏好数据集FMPair,提出FMReward奖励模型与FMFL微调算法,可更好对齐人类偏好,提升该类动画的感知质量。
Comments Accepted for publication in IEEE TVCG, 2026
HOIMask:面向用于人机交互生成的生成式掩码建模
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Fuzhou University(福州大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 HOIMask作为首个用于离散空间HOI运动建模的生成式掩码框架,通过HOI VQ编码、Transformer架构及接触感知重构引导,生成的HOI运动优于现有扩散方法。
Comments ECCV 2026
从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Celia Research HK ; City University of Hong Kong(香港城市大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。
均衡强迫:无需噪声条件的自适应视频生成
机构 * UC San Diego(加州大学圣地亚哥分校) ; MIT(麻省理工学院) ; Harvard University(哈佛大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出无需噪声条件的均衡强迫(EqF)框架,解耦去噪场学习与采样,实现自适应闭环推理,提升自回归视频生成的质量与一致性,性能优于传统噪声条件方法。
Comments Project page: https://equilibriumforcing.github.io/
基于卫星图像与大气场的潜式整流流热带气旋预报
机构 * Khulna University of Engineering & Technology(库尔纳工程技术大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本研究提出单步潜式整流流模型,联合预报热带气旋的卫星图像与大气场,采样速度快、预报精度高,路径误差较基线降低,为热带气旋预报提供高效方案。
Comments 9 pages, 2 figures, 6 tables
WaveDiT: 面向高效3D脑MRI合成的分布感知小波流匹配
机构 * Politecnico di Bari(巴里理工大学) ; Sapienza University of Rome(罗马大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出WaveDiT,一种在3D Haar离散小波变换系数空间中运行的条件流匹配框架,通过分解时空注意力与基于高阶小波统计的带状异方差不确定性建模,实现单GPU上全分辨率3D脑MRI高效合成,在分布对齐和下游任务中优于现有方法。
Comments Provisionally accepted at MICCAI 2026
停止去噪你的模糊
机构 * Indian Institute of Technology Tirupati, India.(印度泰尔普蒂印度理工学院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出ConvDiff框架,用卷积替代加性噪声构建模糊退化轨迹,实现基于扩散模型的图像去模糊,弥合模糊数学原理与扩散算法设计的差距。
Comments Accepted at IEEE International Conference on Image Processing (ICIP) 2026. 7 pages, 3 figures
Journal ref 2026 IEEE International Conference on Image Processing (ICIP)
GeoRect4D:几何兼容的生成性矩形化用于动态稀疏视角3D重建
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出GeoRect4D框架,通过闭环优化结合显式3D一致性与生成性细化,解决动态稀疏视角3D重建中的几何崩溃和漂移问题,提升重建精度与时间一致性。
使用CLIP进行合成图像检测:理解和评估预测线索
机构 * Institute for Data Science I4DS(数据科学研究所) ; University of Applied Sciences FHNW(应用科学大学) ; FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。
Comments 10 figures; 25 pages
当比率下降:或有可转换债券的动态方法
专题命中 扩散模型 :diffusion(abstract)
AI总结 本研究针对或有可转换债券,构建纳入监管自由裁量权、幂转换方案等创新的双变量跳扩散模型,经案例验证可提升定价对冲表现并支持短期预测。
Comments 44 pages, 2 tables, 2 figures