Smoothed-KL Reweighting: A Principled Account and Matching Rule for SNR-Based Diffusion Training
平滑KL重加权:基于信噪比的扩散训练的原则性解释与匹配规则
专题命中 扩散模型 :diffusion(title)
AI总结 提出平滑KL重加权方法,从扩散散度推导出闭式权重,建立与Min-SNR家族的匹配规则,在CIFAR-10和CelebA-64上验证,最终FID相当但迭代效率因数据集而异。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
平滑KL重加权:基于信噪比的扩散训练的原则性解释与匹配规则
专题命中 扩散模型 :diffusion(title)
AI总结 提出平滑KL重加权方法,从扩散散度推导出闭式权重,建立与Min-SNR家族的匹配规则,在CIFAR-10和CelebA-64上验证,最终FID相当但迭代效率因数据集而异。
生成动力学中相变的几何:投影焦散视角
机构 * Institute for the Advanced Study of Human Biology, Institute for Advanced Study, Kyoto University(京都大学高等研究院人类生物学高等研究所) ; Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)
AI总结 本文通过投影焦散几何解释生成动力学中的相变行为,提出临界边界检测器(CBD)诊断分数方向不稳定性,定位模式承诺并支持敏感区域控制。
世界追踪:超越可见表面的生成式像素对齐几何
机构 * World Labs ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 提出世界追踪(World Tracing),一种生成式像素对齐几何表示,通过扩散变压器预测有序点栈,同时重建可见表面和生成遮挡几何,在多个基准上超越深度预测和图像到3D方法。
Comments World Labs Technical Report; Page: https://haoz19.github.io/world-tracing-page/
MPMWorlds: 用于推断和外推物理动力学的物质点法模拟
机构 * Cornell University(康奈尔大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 通过构建2D物质点法(MPM)模拟数据集,研究从视频推断物理动力学并外推时间演化的能力,比较代码生成与视频扩散方法的优劣。
Comments 16 pages, 13 figures. Project page: https://zzigak.github.io/mpmworlds/
NavWAM:用于目标条件视觉导航的导航世界动作模型
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(国立信息学研究所) ; AIRoA ; ATR
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。
Comments Project page: https://dachii-azm.github.io/navwam/
OmniDirector: 无需配对数据的通用多镜头相机克隆
机构 * Kuaishou Technology(快手科技) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。
Comments 12 pages, 8 figures
VideoMDM: 从2D监督走向3D人体运动生成
机构 * Technion(以色列理工学院) ; NVIDIA(英伟达)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出VideoMDM框架,利用单目视频的2D姿态通过扩散模型学习3D运动先验,使用深度加权的2D重投影损失近似3D监督,在HumanML3D上接近全3D监督性能。
Comments https://videomdm.github.io/
TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法
机构 * Tsinghua University(清华大学) ; D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。
Comments 17 pages, 8 figures
Proto-LeakNet:面向合成人脸图像中信号泄漏感知的归因方法
机构 * Department of Mathematics and Computer Science(数学与计算机科学系) ; University of Catania(卡塔尼亚大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出Proto-LeakNet,利用扩散模型中的信号泄漏痕迹,结合闭集分类与密度开集评估,实现可解释的生成器归因,在闭集上训练后对未见生成器也有效。
Comments 44 pages, 27 figures, 11 tables
启发式投资组合优化(HPO)的数学原理
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出启发式投资组合优化(HPO)框架,将Markowitz解投影到稳定规则类,通过隐含收益原理推导启发式最优性集,并建立与强化学习投资组合优化(RLPO)的联系,提供可测试的统计条件。
稳定恢复流形:持续学习中可恢复性的几何原理
机构 * ResNet-18 ; Split CIFAR-100
专题命中 扩散模型 :diffusion(abstract)
AI总结 通过分析Split CIFAR-100上ResNet-18的顺序学习,发现遗忘知识在表示重组后仍可紧凑解码,提出稳定恢复流形假说,表明灾难性遗忘主要是可访问性和流形对齐问题。
Comments 9 pages, 8 figures, 8 tables
通过块验证加速推测性扩散
机构 * KTH(皇家理工学院) ; Google Research(谷歌研究) ; Google DeepMind(谷歌DeepMind)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出一种针对扩散模型的推测性采样方案,通过块验证提高草稿接受率,无需训练的Free Drafter实现高达6.3%的加速。
基于自回归策略的实时执行
机构 * Korea Institute of Science and Technology(韩国科学技术研究院) ; Seoul National University(首尔大学) ; Google Research(谷歌研究院)
专题命中 扩散模型 :diffusion(abstract)
AI总结 通过异步推理和约束解码实现自回归策略的实时执行,在保证低延迟的同时提升任务完成速度,实验表明其性能优于流匹配策略。
物理系统概率仿真的可靠性
机构 * The Alan Turing Institute(艾伦·图灵研究所) ; Autodesk Research(欧特克研究院) ; PhysicsX ; Orbital ; University of Sheffield(谢菲尔德大学) ; University College London(伦敦大学学院)
专题命中 扩散模型 :diffusion(abstract)
AI总结 比较生成模型与CRPS训练集成在物理系统概率仿真中的可靠性,发现CRPS集成在覆盖率和推理速度上更优。
EmbodiSteer: 用关节空间引导的具身无关视觉运动策略实现零样本跨具身部署
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Beijing Key Laboratory of Embodied Intelligence Systems(北京具身智能系统重点实验室) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出EmbodiSteer框架,通过前向运动学和雅可比更新将推理时的扩散采样提升到目标机器人关节空间,并加入全身碰撞感知引导,实现零样本、具身感知的部署,在模拟和物理机器人上显著降低碰撞率并提高任务成功率。
Comments The first two authors contribute equally
基于智能体的形态交替模式演化模型
专题命中 扩散模型 :diffusion(abstract)
AI总结 通过多智能体模拟,研究形态交替(如go/went)的涌现机制,发现无标度社交网络和随机采纳策略能产生更真实的形态模式。
Comments 51 + 37 pages. 31 Figures
EWAM:一种用于具身智能闭环在线自适应的增强世界动作模型
机构 * Astronex Robotics ; Nanjing University of Information Science and Technology(南京信息工程大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出EWAM架构,基于冻结的Cosmos3骨干网络,通过四个轻量级神经层实现零样本在线自适应,无需微调或额外演示数据,显著减少新任务布局的部署数据需求。
Net-Ev$^2$:网络事件演化的生成式模拟器
机构 * NYU Shanghai(上海纽约大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出Net-Ev$^2$,一种结合事件线索与网络拓扑的生成式模拟器,通过结构引导掩码预训练和拓扑感知扩散过程模拟网络事件演化,在多个道路网络数据集上达到最优性能。
Comments Accepted by KDD 2026 Research Track
Journal ref In Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
随机化最优切换问题与相关镜像下降流
专题命中 扩散模型 :diffusion(abstract)
AI总结 针对最优切换问题,提出随机化框架并引入KL散度正则化,证明正则化值函数是椭圆HJB系统的唯一光滑解,给出最优Gibbs策略的显式形式,并建立镜像下降流算法及收敛误差界。
一种用于随机数生成的量子算法
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出一种量子随机数生成算法,通过量子傅里叶变换、受控相位旋转和Grover扩散算子实现二次加速,混合时间达到O(√(n log n)),并在IBM超导硬件上验证。
面向复合材料非接触工业检测的光热相干层析成像广义虚拟波理论
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出广义虚拟波光热层析框架,将扩散-波变换推广到任意边界激励,通过ADMM或截断SVD求解逆问题,实现热扩散场到波场的转换,提升复合材料缺陷检测的深度定位和层析重建质量。
QGP中黏性修正的可观测依赖性:Chapman-Enskog理论中的重夸克和双轻子
专题命中 扩散模型 :diffusion(abstract)
AI总结 首次使用梯度展开至二阶的黏性修正计算重夸克输运和热双轻子产生,发现Chapman-Enskog修正显著抑制拖曳力并影响动量扩散,且不同可观测量对动量空间不同区域敏感。
Comments 18 pages, 11 figures
使用标量自由能的状态依赖朗之万动力学的几何表述
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文通过引入标量自由能并将扩散张量作为构型空间的度量,提出了几何一致的朗之万方程,明确了坐标协变性,并展示了在坐标变换、几何约束和投影等例子中的一致性。
通过光学成像和贝叶斯推断解析钙钛矿太阳能电池降解的起源
专题命中 扩散模型 :diffusion(abstract)
AI总结 结合光致发光成像与漂移扩散模拟,利用贝叶斯推断生成重组参数图,区分降解发生在空穴/电子传输层界面或体相,并验证氨基硅烷钝化处理抑制界面降解。
锂金属电池中Li-Mg负极的条件调幅分解
专题命中 扩散模型 :diffusion(abstract)
AI总结 发现Li-Mg负极中形成有序B2相与β-BCC相发生条件调幅分解,产生均匀互连的富锂β-BCC和贫锂B2相,前者提供快速锂扩散路径,抑制高电流密度下枝晶形成。
纳米Ni/Al多层膜中的层级互扩散动力学
专题命中 扩散模型 :diffusion(abstract)
AI总结 结合快速差示扫描量热法和扫描透射电镜,揭示了纳米Ni/Al多层膜中层级互扩散动力学:低温下Ni沿Al晶界扩散,高温下从晶界向晶内扩散,晶界是控制反应起始的关键微结构参数。
通过真实到仿真到真实触觉策略学习的盲操作灵巧抓取
机构 * ShanghaiTech University(上海科技大学) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出一种结合Real2Sim触觉校准、布局感知触觉编码器和触觉条件扩散策略的框架,实现仅依赖触觉的灵巧手盲抓取,在真实机器人上对20个物体达到27%成功率。
Comments 23 pages, 6 figures
原位STEM直接纳米尺度观察亚共晶Al-Cu合金的熔化和溶质再分布
专题命中 扩散模型 :diffusion(abstract)
AI总结 利用原位STEM加热技术,纳米尺度观察亚共晶Al-Cu合金的熔化过程,发现晶界优先形成共晶液相,Al2Cu相先熔化,液态Cu长距离再分布导致富Al边缘和Cu富集。
深度双样本检验的反事实解释
机构 * Hasso-Plattner-Institute, University of Potsdam(波茨坦大学洪堡-劳恩堡研究所) ; Hasso Plattner Institute for Digital Health at Mount Sinai Icahn School of Medicine at Mount Sinai(辛辛那提医学院洪堡数字健康研究所)
专题命中 扩散模型 :diffusion(abstract)
AI总结 针对深度双样本检验,提出基于扩散自编码器和MMD优化的反事实解释框架,生成样本级编辑以揭示驱动假设拒绝的特征。
Comments 17 pages
基于插入生成的变分学习
机构 * University of Cambridge(剑桥大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出插入过程(IP)模型,通过排列变分推断联合学习插入位置、内容和终止条件,支持变长生成并提升非自回归序列建模质量。