Global Tensor Field Formulation of the Fokker-Planck Equation on Riemannian Manifolds
黎曼流形上的福克-普朗克方程全局张量场公式
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出一种基于张量场的全局坐标无关福克-普朗克方程形式,通过利叶导数和散度定理推导出其伴随算子,建立几何化的方程表达,同时引入扩散张量场以推广欧几里得扩散矩阵,提供一种直观且简洁的几何解释。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
黎曼流形上的福克-普朗克方程全局张量场公式
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出一种基于张量场的全局坐标无关福克-普朗克方程形式,通过利叶导数和散度定理推导出其伴随算子,建立几何化的方程表达,同时引入扩散张量场以推广欧几里得扩散矩阵,提供一种直观且简洁的几何解释。
SIREN残差误差作为纳维-斯托克斯方程的正则性诊断
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文利用SIREN残差误差检测纳维-斯托克斯方程解的正则性损失,通过分析误差集中现象验证了在粘度降低时的奇异点定位,并确定了临界粘度。
Comments 9 pages, 5 figures
通过扩散基离散运动分词器弥合语义与运动条件
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出三阶段框架,结合连续扩散模型与离散分词生成器,通过MoTok分词器实现语义与运动控制的结合,提升运动生成的可控性与保真度。
Comments Project Page: https://rheallyc.github.io/projects/motok GitHub: https://github.com/rheallyc/MoTok
LGESynthNet:用于改进心脏LGE-MRI成像瘢痕分割的受控瘢痕合成
机构 * Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新部) ; Al in Healthcare and Medicine, Klinikum rechts der Isar, Technical University of Munich(医疗与医学AI,慕尼黑工业大学右侧医院) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract)
AI总结 本文提出LGESynthNet,一种基于潜在扩散模型的可控合成框架,通过奖励模型、提示模块和生物医学文本编码器,利用少量标注数据生成高质量瘢痕图像,提升后续分割和检测性能。
Comments Accepted at MICCAI STACOM workshop 2025
SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐
机构 * Baidu(百度) ; Tsinghua University(清华大学) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。
Comments 24 pages, 12 figures
R&D: 在语义分割中平衡可靠性与多样性以合成数据增强
机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息科技学院) ; Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出一种整合可控扩散模型的合成数据增强方法,通过类感知提示和视觉先验融合提升图像质量,有效提升语义分割性能,尤其在数据稀缺场景中表现优异。
Journal ref Computational Collective Intelligence, ICCCI 2025, Lecture Notes in Computer Science 16139 (2026) 433-448
LICA:图形设计研究的分层图像组成标注
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。
Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成
机构 * Virginia Tech(弗吉尼亚理工学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。
Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/
最优双线性控制受限于三维化学排斥模型及其潜在生产
专题命中 可控生成 :diffusion(abstract)
AI总结 本文研究了带有潜在生产、逻辑反应和双线性控制的三维抛物型化学排斥模型,证明了在特定控制函数下全局弱解的存在性,并探讨了正则性条件对最优双线性控制问题的影响。
均场控制屏障函数用于随机多智能体系统
专题命中 可控生成 :diffusion(abstract)
AI总结 本文提出均场控制屏障函数,用于保障随机多智能体系统安全,通过稳定性分析和数值模拟验证了其有效性。
基于离散时间观测与异步切换的周期性间断反馈控制对高非线性混合随机微分延迟方程的稳定性研究
专题命中 可控生成 :diffusion(abstract)
AI总结 本文研究高非线性混合随机微分延迟方程的矩指数稳定性,设计基于离散时间观测与异步切换的周期性间断控制器,确定观测周期上界和控制宽度下界,证明控制系统的指数稳定性及收敛速度。
Comments 22 pages
边缘端具身基础模型:部署约束及缓解策略综述
机构 * University of South Florida(佛罗里达州立大学) ; Florida International University(佛罗里达国际大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Nottingham Trent University(诺丁汉特伦特大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 可控生成 :diffusion(abstract)
AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。
MeInTime:弥合年龄差距的恒定身份面部修复
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院) ; Minzu University of China(民族大学) ; Xiaomi Corporation(小米公司)
专题命中 图像修复 :diffusion(abstract);分类 cs.CV
AI总结 MeInTime提出一种基于扩散的面部修复方法,通过引入年龄提示和新的注意力机制,实现跨年龄的恒定身份修复,提升了身份保真度和年龄一致性。
利用模拟训练数据通过深度学习恢复MPI系统矩阵
专题命中 图像修复 :inpainting(abstract)
AI总结 本文研究了基于物理的模拟系统矩阵是否能训练深度学习模型用于系统矩阵恢复任务,如去噪、加速校准、上采样和修补,证明了模型在真实数据中的泛化能力。
Remove360: 3D高斯散射中物体移除后残差的基准测试
机构 * CTU in Prague, Czech Republic(布拉格CTU,捷克共和国)
专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV
AI总结 本文提出Remove360数据集和评估框架,用于量化3D高斯散射中物体移除后的语义残差,揭示几何移除与语义擦除之间的差距,强调隐私保护移除方法的必要性。
SOL-ExecBench:面向真实世界GPU内核的光速基准测试,针对硬件极限
机构 * NVIDIA
专题命中 图像生成评测 :diffusion(abstract)
AI总结 SOL-ExecBench通过235个CUDA内核优化问题,针对NVIDIA Blackwell GPU的硬件极限,提出基于Speed-of-Light(SOL)的基准测试方法,评估内核优化效果。
Soft-Di[M]O: 通过软嵌入提升一步离散图像生成
机构 * LIX, École Polytechnique, CNRS, IPP(IX实验室,巴黎高等理工学院,法国国家科学研究中心,IPP) ; Inria at Univ. Grenoble Alpes, CNRS, LJK(里尔大学,法国国家科学研究中心,LJK)
专题命中 效率与蒸馏 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
AI总结 本文提出Soft-Di[M]O框架,通过引入软嵌入解决一步生成器中离散token阻断梯度的问题,实现端到端训练并支持GAN精炼、可微奖励微调和TTEO。
Comments ICLR 2026
Q-Drift:扩散模型采样中的量化感知漂移校正
机构 * Department of Computer Science and Engineering, Seoul National University, Seoul, South Korea(计算机科学与工程系,首尔国立大学,韩国首尔) ; School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,瑞士洛桑联邦理工学院) ; Meta Reality Labs, Redmond, USA(Meta现实实验室,美国西雅图)
专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出Q-Drift,一种在采样端校正量化噪声的方法,通过将量化误差视为隐含的随机扰动,提升扩散模型生成质量,实验显示在多种模型和方法上均有效。
Comments 29 pages, 6 figures
6Bit-Diffusion:视频扩散模型推理时的混合精度量化
机构 * Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。
高效视频扩散与稀疏信息传输用于视频压缩
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出Diff-SIT方法,通过稀疏时序编码模块和单步视频扩散模型提升视频压缩的感知质量和时间一致性,尤其在超低比特率下表现优异。
OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡
机构 * Nanjing University(南京大学) ; Nanyang Technological University(南洋理工大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。
Comments ICLR 2026
UEPS:鲁棒且高效的MRI重建
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) ; School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University, China(生物医学工程学院,深圳大学医学院,深圳大学,中国) ; University of Chinese Academy of Sciences, China(中国科学院大学,中国) ; Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology, China(计算机科学与人工智能学院,深圳先进技术大学,中国) ; State Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统国家重点实验室,中国科学院,中国)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出UEPS框架,通过消除CSM依赖、渐进分辨率和稀疏注意力机制,提升MRI重建的鲁棒性和效率,在多种临床转移测试中表现优异。
Comments The document contains the main paper and additional experimental details in the supplementary material. Open-source code can be found at: https://github.com/HongShangGroup/UEPS
OT-MeanFlow3D: 通过最优传输与Meanflow弥合,实现高效的3D点云生成
机构 * Department of Computer Science, Vanderbilt University(范德比尔特大学计算机科学系) ; Toyota InfoTech Labs(丰田信息技术实验室) ; Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) ; Department of Mathematics, Purdue University(普渡大学数学系)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 本文提出OT-MeanFlow3D框架,通过整合最优传输采样,提升3D点云生成与修复的效率与准确性,实验表明其在ShapeNet上优于现有基线模型。