Accelerating Black Hole Image Generation via Latent Space Diffusion Models
通过潜在空间扩散模型加速黑洞图像生成
专题命中 扩散模型 :diffusion(title,abstract);image generation(title)
AI总结 本文提出一种基于潜在空间的扩散模型,通过物理条件生成高保真黑洞图像,显著提升生成效率和图像质量,减少计算成本四倍以上。
Comments 11 pages, 6 figures
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
通过潜在空间扩散模型加速黑洞图像生成
专题命中 扩散模型 :diffusion(title,abstract);image generation(title)
AI总结 本文提出一种基于潜在空间的扩散模型,通过物理条件生成高保真黑洞图像,显著提升生成效率和图像质量,减少计算成本四倍以上。
Comments 11 pages, 6 figures
DiT-IC:面向高效图像压缩的对齐扩散变换器
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出DiT-IC,通过三种对齐机制在紧凑的潜在空间中实现高效图像压缩,显著提升解码速度和降低内存使用,实现状态领先的感知质量。
基于潜扩散模型的地质体参数化与数据同化
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文提出利用潜扩散模型对基于岩性地质体进行参数化与数据同化,通过变分自编码器和U-Net实现降维与去噪,生成与参考模型一致的地质体实现。
Journal ref 10.1016/j.cageo.2024.105755
分形的实用化:去噪扩散作为分段迭代函数系统
机构 * Department of Mathematics & Data Science(数学与数据科学系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文通过分段迭代函数系统框架,揭示扩散模型的去噪动态,并提出三种可计算的几何量,解释了扩散模型的双阶段行为,同时推导出三个最优设计准则。
通过大规模预训练和目标特定微调加速中风MRI
机构 * Chandra Family Department of Electrical and Computer Engineering(查克拉家族电气与计算机工程系) ; Department of Imaging Physics(成像物理系) ; Dell Medical School Department of Neurology(德莱尔医学院神经学系) ; Dell Medical School Department of Neurosurgery(德莱尔医学院神经外科系) ; Dell Medical School Department of Diagnostic Medicine(德莱尔医学院诊断医学系) ; Oden Institute for Computational Engineering and Sciences(奥登计算工程与科学研究院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种高效策略,利用扩散概率生成模型在有限数据下加速MRI重建,通过大规模预训练和目标特定微调实现临床中风MRI的快速扫描。
MaDiS:驯服掩码扩散语言模型用于手语生成
机构 * Imperial College London(伦敦帝国学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出MaDiS,一种基于掩码扩散的语言模型,用于手语生成,通过双向依赖捕捉和高效并行多令牌生成,提升生成效率和质量,同时引入三级交叉模态预训练方案和混合部分嵌入层,实现多层级手语表示。
多尺度结构引导的潜在扩散模型用于多模态MRI翻译
机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,沈阳,中国) ; Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,沈阳,中国) ; National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,沈阳,中国) ; Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学阿米人工智能研究所,埃德蒙顿,阿尔伯塔,加拿大) ; AiShiWeiLai AI Research, Beijing, China(人工智能研究(北京)有限公司,北京,中国)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出MSG-LDM框架,通过多尺度特征空间分离风格与结构信息,提升多模态MRI翻译的结构一致性与纹理细节。
Omni-Video 2:基于MLLM条件扩散模型的统一视频生成与编辑扩展
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出Omni-Video 2,通过连接预训练多模态大语言模型与视频扩散模型,实现视频生成与编辑的统一。核心方法是利用MLLM生成明确的目标描述以指导生成过程,并通过轻量适配器高效注入多模态条件token,提升复杂编辑任务性能。
Comments Technical Report, Project: https://howellyoung-s.github.io/Omni-Video2-project/
通过几何引导的集扩散增强新视角合成
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出SetDiff框架,结合3D先验、坐标映射和姿态感知的Plucker射线嵌入,提升多视角扩散模型在处理可变参考和目标视角时的鲁棒性和视觉保真度。
Comments Paper and supplementary materials
DiffProxy:通过扩散生成的密集代理进行多视图人体网格恢复
机构 * PCA Lab(PCA实验室) ; Nanjing University of Science and Technology(南京理工大学) ; School of Intelligent Science and Technology(智能科学与技术学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffProxy利用预训练扩散模型生成密集像素到表面对应关系,通过多条件代理生成器和手部细化技术,实现高精度人体网格恢复,无需真实数据训练。
Comments Page: https://wrk226.github.io/DiffProxy.html, Code: https://github.com/wrk226/DiffProxy
MoVieDrive:基于多模态多视角视频扩散变换器的城市场景合成
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Toronto(多伦多大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出MoVieDrive,通过多模态多视角视频扩散变换器生成城市驾驶场景视频,实现多模态数据生成与可控生成。
Comments CVPR 2026 Findings Track
在有限预算下加速扩散模型训练:基于凝聚的视角
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出D2C框架,通过选择和附加两阶段方法,从大规模数据集中凝聚出小数据集,从而在有限资源下加速扩散模型训练并保持生成质量。
Comments CVPR 2026 camera-ready version. Introduces D2C, a framework for efficient diffusion model training
强化学习用于扩散过程的折扣和ergodic控制
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出量化Q学习算法,用于连续时间扩散过程的折扣与ergodic控制,证明其在近优策略下几乎必然收敛,并在温和条件下保证近优性速率。
Comments 29 pages
CORE: 用于扩散语言模型的上下文鲁棒重掩码
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 CORE通过上下文鲁棒重掩码方法改进扩散模型解码,通过检测上下文敏感性token提升生成稳定性,在推理阶段实现高效修正,优于现有基线方法。
Comments Project Page: https://ucf-crcv.github.io/core/
从光扩散到光催化速率:强散射多孔板的紧凑标度律
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出了一种紧凑的分析框架,统一了纳米粒子负载光催化板中的多重散射、边界损失、光化学效率和表面动力学过程,通过有限板扩散模型推导出辐照场的闭式表达式,并结合光化学量子效率和一级表面动力学,得到体积和面积速率常数的依赖关系。
Comments 25 pages, 4 figures
Journal ref Journal of Quantitative Spectroscopy & Radiative Transfer 352 (2026) 109819
超越模仿:用于自适应扩散导航策略的强化学习微调
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; A*STAR, Singapore(A*STAR,新加坡) ; National University of Singapore, Singapore(新加坡国立大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出一种针对扩散导航的强化学习微调框架,通过Group Relative Policy Optimization提升策略适应性,在Isaac Sim中提升成功率和SPL,减少碰撞,展示出更强的零样本迁移能力和安全泛化能力。
具有物理约束的扩散模型用于三维湍流数据合成
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出一种融合物理约束的扩散模型,用于生成三维湍流速度场,解决了高维、多尺度和强间断性的问题,展示了其在中等分辨率下的稳定性和统计准确性。
Comments 14 pages, 9 figures. Submitted to a journal
条件扩散模型中组合泛化性的局部机制
机构 * Apple(苹果公司)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了条件扩散模型在长度泛化中的能力,发现局部条件分数与组合结构存在等价关系,并通过实验验证了局部条件分数对泛化能力的影响。
Comments 10 pages, 5 figures
去噪扩散变分推断:将扩散模型作为表达性变分后验
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出DDVI,一种基于扩散模型的黑盒变分推断算法,通过迭代优化潜在空间后验,提升深度潜在变量模型的推理与学习性能。
Comments published at AAAI 2025; the first two authors contribute equally to this work; code available at https://github.com/topwasu/DDVI
OmniForcing:释放实时联合音频视觉生成
机构 * JD Explore Academy(京东探索学院) ; Fudan University(复旦大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出OmniForcing框架,通过因果蒸馏将双向扩散模型转化为高保真流式自回归生成器,解决双流架构中的训练不稳定问题,实现25FPS的实时生成性能。
Comments 14 pages
让您的图像随您的动作移动!-- 隐式多对象多动作转移
机构 * Tianjin University(天津大学) ; University of New South Wales(新南威尔士大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Hainan University(海南大学) ; University of Auckland(奥克兰大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出FlexiMMT框架,实现多对象多动作的隐式图像到视频转换,通过解耦注意力机制和改进的掩码传播机制,实现精确且高质量的多对象动作迁移。
Comments 15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/
训练短,推理长:无训练 horizon 延伸用于自回归视频生成
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出FLEX框架,通过频率感知RoPE调制和抗相位噪声采样,解决自回归视频扩散模型在延伸horizon时的 extrapolation失败问题,实现6倍延伸性能提升。
Comments 19 pages, 15 figures
CognitionCapturerPro:通过多模态信息和非对称对齐实现从EEG/MEG的高保真视觉解码
机构 * Visual Information Processing Laboratory, School of Electronic Engineering, Xidian University(电子科技大学信息处理实验室,电子工程学院) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出CognitionCapturerPro框架,通过整合EEG与多模态先验信息,提升EEG视觉重建的保真度与检索准确率,改进Top-1和Top-5准确率达25.9%和10.6%。
Mobile-VTON: 高保真设备端虚拟试衣
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Mobile-VTON,一种基于设备端的高保真虚拟试衣框架,通过模块化架构和隐私保护技术,在无需云端支持的情况下实现高质量试衣效果。
Comments The project page is available at: https://zhenchenwan.github.io/Mobile-VTON/
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
GA-Drive:用于自由视角驾驶场景生成的几何-外观解耦建模
机构 * MMLab, CUHK(CUHK的MMLab) ; CASIA ; Shanghai Jiaotong University(上海交通大学) ; SenseTime Research(商汤科技研究院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 GA-Drive通过几何-外观解耦和扩散生成技术,生成可编辑的高保真驾驶场景,提升自动驾驶训练和评估的效率与效果。
EMGauss:通过动态高斯建模在体积电子显微镜中实现连续切片到三维重建
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 EMGauss通过动态高斯建模方法,解决体积电子显微镜中切片到三维重建的异质性限制,提升插值质量并实现连续切片合成。
Comments Accepted by CVPR 2026. Project page: https://raynehe.github.io/EMGauss/
Omni-Video:统一视频理解与生成的普及
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Omni-Video框架,通过改进多模态大语言模型生成连续视觉线索,结合轻量架构和高效训练方案,实现视频理解、生成与编辑的统一模型。
Comments Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/
Mocap-2-to-3:多视角提升用于单目运动恢复的2D预训练
机构 * Beijing Institute of Technology(北京理工大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(国家一般人工智能重点实验室,BIGAI) ; Deep Glint ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; Shandong Agricultural University(山东农业大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Mocap-2-to-3框架,通过多视角合成过程和分阶段训练提升单目运动恢复的精度与泛化能力,实现更精确的物理空间定位。
Comments Project page: https://wangzhumei.github.io/mocap-2-to-3/
通过NIMBUS将JWST硅酸盐云观测连接到系外行星云微物理
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究利用NIMBUS和Virga模型分析四个系外行星的云结构,发现高海拔存在纳米级硅酸盐颗粒,其形成过程受高效沉降和生长效率限制,通过多波段观测约束粘附系数,为未来云研究提供方向。
Comments 23 pages, 16 figures, accepted for publication in ApJ
通过物理建模快速识别移动污染源
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出一种结合advection-diffusion模型和稀疏性先验信息的算法,用于快速定位和量化时间变化的污染源,并通过风洞实验校准三维流动模型,以提升数字孪生环境中的实时决策支持能力。