arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-26 至 2026-05-26 共收录 128 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 128 篇

2605.24065 2026-05-26 cs.CV 90%

fMRI-Diffusion: Generating fMRI Time Series Via a Temporal Transformer Diffusion Model for Major Depressive Disorder Diagnosis

fMRI-Diffusion: 用于重度抑郁症诊断的基于时间Transformer扩散模型的fMRI时间序列生成

Muhammad Asif Hasan, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 提出fMRI-Diffusion框架,通过时间Transformer扩散模型合成ROI级fMRI时间序列而非功能连接矩阵,以保留时间信息并提升小样本下MDD诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07333 2026-05-26 cs.CV cs.AI 88%

Fusion Embedding for Pose-Guided Person Image Synthesis with Diffusion Model

基于扩散模型的姿态引导人物图像合成的融合嵌入

Donghwna Lee, Kirok Kim, Jisu Lee, Kyungha Min, Wooju Kim

机构 * Department of Industrial Engineering(工业工程系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 提出FPDM框架,通过对比学习显式对齐融合源-姿态嵌入与目标图像嵌入,并作为条件信号生成,解决姿态引导人物图像合成中纹理保真度和一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24792 2026-05-26 cs.CV cs.AI 87%

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

用于胃肠内窥镜的参数高效视觉语言模型:医学图像生成与临床视觉问答

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman

机构 * Computer Science Department, Morgan State University(莫尔甘州大学计算机科学系) International Organization for Migration (IOM)(国际移民组织) Electrical & Computer Engineering Department, Morgan State University(莫尔甘州大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 提出双流水线参数高效微调模型,结合Florence-2和LoRA Stable Diffusion,分别解决临床视觉问答和隐私保护合成数据生成问题,在Kvasir-VQA数据集上取得高ROUGE和BLEU分数,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20424 2026-05-26 cs.CR 86%

Attacks on Approximate Caches in Text-to-Image Diffusion Models

文本到图像扩散模型中的近似缓存攻击

Desen Sun, Shuncheng Jie, Sihang Liu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文针对文本到图像扩散模型中的近似缓存优化,提出了远程隐蔽信道、提示词窃取和投毒三种攻击方法,揭示了其严重的安全漏洞。

Comments Accepted by Usenix Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25191 2026-05-26 cs.CV 85%

Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference

在推理时将图像引导注入文本条件扩散模型

Agata Żywot, Iason Skylitsis, Thijmen Nijdam, Zoe Tzifa-Kratira, Derck Prinzhorn, Konrad Szewczyk, Aritra Bhowmik

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出视觉概念融合(VCF),一种无需重新训练即可在推理时同时以图像和文本为条件进行双重引导的方法,通过对齐CLIP图像特征与文本嵌入空间实现视觉概念注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25123 2026-05-26 cs.LG cs.AI cs.CL cs.CV stat.ML 85%

Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo

扩散模型的推理时对齐:基于信任区域迭代扭曲序贯蒙特卡洛方法

Weixin Wang, Yu Yang, Wei Deng, Pan Xu

机构 * Duke University(杜克大学) Morgan Stanley(摩根大通)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出信任区域迭代扭曲序贯蒙特卡洛(TRI-TSMC)框架,通过迭代学习扭曲函数来改进扩散模型推理时的对齐,在文本生成和文本到图像生成任务上优于现有方法。

Comments 34 pages, 6 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24631 2026-05-26 cs.LG cs.AI cs.CV 85%

Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion

超越生成先验:JEPA引导扩散的少数采样

Sol Park, Soobin Um

机构 * Department of Artificial Intelligence, Kookmin University, Seoul, South Korea(人工智能系,韩国全州大学,首尔)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种基于世界模型JEPA引导的扩散采样框架,通过近似策略实现高效计算,在无条件、类别条件和文本到图像生成中提升少数样本的保真度和语义有效性。

Comments ICML 2026, 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25210 2026-05-26 cs.LG cs.AI stat.ML 85%

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

扩散模型的多目标学习:半监督学习下的统计理论

Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26032 2026-05-26 cs.CV cond-mat.stat-mech cs.AI cs.LG 83%

Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution

一切尺度:具有连续超分辨率的尺度不变扩散

Zixin Jessie Chen, Zhuo Chen, Archer Wang, Jeff Gore, William T. Freeman, Congyue Deng, Marin Soljačić

机构 * Department of Physics, Massachusetts Institute of Technology(麻省理工学院物理系) Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基础相互作用研究所) Institute for Data, Systems and Society, Massachusetts Institute of Technology(麻省理工学院数据、系统与社会研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出SKILD模型,通过尺度不变扩散统一图像生成与连续超分辨率,仅改变起始时间步即可实现不同任务。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25765 2026-05-26 cs.CV cs.AI cs.LG 83%

Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models

通过交叉注意力激活投影实现扩散模型的概念遗忘

Saemi Moon, Suhyeon Jun, Seoyeon Lee, Dongwoo Kim

机构 * CSE, POSTECH(POSTECH计算机科学系) GSAI, POSTECH(POSTECH通用人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出PURE方法,利用交叉注意力激活空间构建遗忘和保留基,通过线性投影编辑权重,在保持保留概念的同时有效消除目标概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25022 2026-05-26 cs.CV cs.AI 83%

D3S2: Diffusion-Guided Dataset Distillation for Semantic Segmentation

D3S2: 扩散引导的语义分割数据集蒸馏

Wenjie Zheng, Haoji Hu, Jiali Lu, Xingze Zou, Jing Wang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对语义分割数据集蒸馏中的长尾类别不平衡、像素级对齐和高计算成本问题,提出两阶段框架D3S2,通过类别平衡掩码选择和扩散引导图像合成生成紧凑训练集,在极低压缩率下显著提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07485 2026-05-26 astro-ph.GA 82%

A Guided Unconditional Diffusion Model to Synthesize and Inpaint Radio Galaxies from FIRST, MGCLS and Radio Zoo

一种引导无条件扩散模型,用于从FIRST、MGCLS和Radio Zoo合成和修复射电星系

Rémi Poitevineau, Emma Tolley, Verlon Etsebeth

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出一种掩码引导的扩散概率模型,用于生成和修复逼真的射电星系图像,以重建不完整观测并提升源表征和形态分类等下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01184 2026-05-26 cs.LG 82%

Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models

扩散与流模型中温度采样的时间分数重缩放

Yanbo Xu, Yu Wu, Sungjae Park, Zhizhuo Zhou, Shubham Tulsiani

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学系,卡内基梅隆大学,匹兹堡,美国) Department of Computer Science, Stanford University, California, USA(计算机科学系,斯坦福大学,加利福尼亚,美国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出一种无需微调或改变训练策略的方法,通过重缩放噪声数据的得分函数来调控扩散和流模型的采样多样性,实现局部温度控制,并在图像生成、姿态估计、深度预测、机器人操作和蛋白质设计等任务中验证了有效性。

Comments Accepted at ICML 2026. Project page: https://temporalscorerescaling.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24566 2026-05-26 cs.CV cs.GR cs.LG 81%

EMA: Effort Metric Attention for Anatomical Effort-Guided Human Motion Diffusion

EMA: 面向解剖学努力引导的人体运动扩散的努力度量注意力

Joshua Siy, Huakun Liu, Yutaro Hirao, Monica Perusquia-Hernandez, Hideaki Uchiyama, Kiyoshi Kiyokawa

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出基于努力度量注意力(EMA)的强度控制框架,通过数值努力信号调节运动扩散模型,实现细粒度、区域化的运动强度控制,并验证了与LMA描述符的单调对齐。

Comments Accepted at IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25941 2026-05-26 cs.CV 79%

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

概念擦除应发生在何处:文本到视频扩散模型中的概念-层对齐

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * The School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074, China(人工智能与自动化学院,华中科技大学,武汉430074,中国) Department of Computer Science and Engineering, University of Nevada, Reno, NV, USA(计算机科学与工程系,内华达大学里诺分校,内华达州,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过识别概念-层拓扑对齐瓶颈,提出基于可分离性优化的CLEAR框架,在文本到视频扩散模型中实现精确的概念擦除并保持生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22894 2026-05-26 cs.GR cs.LG cs.RO 79%

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

SCRIPT: 面向语言驱动的物理仿真人体控制的可扩展扩散策略与多阶段训练

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 提出SCRIPT框架,通过联合动作-状态-文本扩散Transformer和多阶段训练(监督模仿预训练+混合奖励强化学习后训练),实现语言指令驱动的物理仿真人体控制,在文本对齐、运动质量和物理真实性上超越现有方法。

Comments Project page: https://zhanglele12138.github.io/SCRIPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15264 2026-05-26 cs.CV 79%

DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion

DriveGen3D: 通过高效视频扩散提升前馈驾驶场景生成

Weijie Wang, Jiagang Zhu, Zeyu Zhang, Xiaofeng Wang, Zheng Zhu, Guosheng Zhao, Chaojun Ni, Haoxiao Wang, Guan Huang, Xinze Chen, Yukun Zhou, Wenkang Qin, Duochao Shi, Haoyun Li, Yicheng Xiao, Donny Y. Chen, Jiwen Lu

机构 * Zhejiang University(浙江大学) GigaAI Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Monash University(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DriveGen3D框架,结合快速视频扩散Transformer(FastDrive-DiT)和前馈3D重建模块(FastRecon3D),实现高质量、可控的动态3D驾驶场景生成,在长视频和3D一致性上达到最优。

Comments ICME 2026 Oral, Project Page: https://lhmd.top/drivegen3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24959 2026-05-26 cs.CV 79%

Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy

三步条件扩散光场显微三维重建

Qihong Zhao, Shaokang Yan, Zhimin Qiao, Jinjia Wang, Bo Xiong

机构 * Yanshan University(雁山大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对光场显微成像中传统算法分辨率低、伪影重、计算成本高,以及现有学习方法重建精度和泛化能力不足的问题,提出一种基于三步条件扩散的高保真三维重建方法,通过确定性三步采样和轻量条件U-Net实现快速准确重建,并引入类间检测模块增强稳定性。

Comments 10 pages, 6 figures. Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24870 2026-05-26 cs.CV 79%

Trajectory-Consistent Calibration for Cache-Accelerated Diffusion Models

轨迹一致校准用于缓存加速扩散模型

Mingyu Liang, Dingkun Xu, Jingwei Xu

机构 * Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对缓存加速扩散模型中表示偏差导致生成质量下降的问题,提出无训练的轨迹一致校准方法,通过离线迭代校准缓存表示,在PixArt-alpha和DiT-XL/2上持续改善FID。

Comments 23 pages, 8 figures, 8 tables. Code is available at https://github.com/NJUDeepEngine/TCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24674 2026-05-26 cs.CV 79%

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

推理对齐:扩散Transformer在视频编辑中的隐式推理

Yan Li, Lin Liu, Xiaopeng Zhang, Qi Tian

机构 * The Hongkong University of Science and Technology(香港科技大学) Huawei Inc.(华为公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对指令式视频编辑中条件信号未分化及交叉注意力监督不足的问题,提出RVEDiT框架,通过粒度路由令牌条件和参考锚定注意力对齐实现粗到细编辑与内部推理正则化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24630 2026-05-26 cs.CV 79%

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion

DexSIM: 具有统一因果视频扩散的实时灵巧仿真

Adam Lee

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DexSIM框架,通过两阶段训练(双向视频扩散和自回归滚动训练)实现实时、长时一致的灵巧操作仿真,在像素相似度、运动保真度和手部投影精度上超越基线。

Comments World Model @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05791 2026-05-26 physics.med-ph cs.CV cs.LG math.PR 79%

Fast and Robust Diffusion Posterior Sampling for MR Image Reconstruction Using the Preconditioned Unadjusted Langevin Algorithm

使用预条件未调整朗之万算法实现快速且鲁棒的MR图像重建扩散后验采样

Moritz Blumenthal, Tina Holliber, Jonathan I. Tamir, Martin Uecker

机构 * Institute of Biomedical Imaging, Graz University of Technology, Graz, Austria Department of Radiology, Boston Children's Hospital, Harvard Medical School, Boston, USA Chandra Family Department of Electrical Engineering, University of Texas at Austin, USA Department of Diagnostic Medicine, Dell Medical School, University of Texas at Austin, USA

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对MR图像重建中扩散后验采样速度慢和参数调优问题,提出基于预条件未调整朗之万算法的精确似然方法,实现快速收敛且无需调参的鲁棒采样。

Comments Submitted to Magnetic Resonance in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07343 2026-05-26 cs.GR cs.AI eess.IV 79%

Local MAP Sampling for Diffusion Models

扩散模型的局部MAP采样

Shaorong Zhang, Rob Brekelmans, Greg Ver Steeg

机构 * University of California, Riverside, CA, US(加州大学河滨分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 提出局部MAP采样(LMAPS)框架,通过沿扩散轨迹迭代求解局部MAP子问题,统一了优化方法与概率采样,在图像恢复和科学任务中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02730 2026-05-26 cs.LG cs.CV 79%

Dale meets Langevin: A Multiplicative Denoising Diffusion Model

Dale meets Langevin: 乘法去噪扩散模型

Nishanth Shetty, Madhava Prasath, Chandra Sekhar Seelamantula

机构 * Department of Electrical Engineering(电子工程系) Indian Institute of Science(印度科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出以几何布朗运动为前向噪声过程的乘法分数生成模型,推导反向时间SDE并设计两种乘法采样器,引入Hyvärinen分数和乘法去噪分数匹配目标,在图像数据集上验证生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01557 2026-05-26 cs.CV 79%

Real-Time Hardware-Free HIFU Interference Suppression via Teacher-Student Diffusion Framework

基于教师-学生扩散框架的实时无硬件HIFU干扰抑制

Dejia Cai, Ali Abdollahi, Xi Wang, Kun Yang, Zhaohui Guo, Xiaowei Zhou, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) State Key Laboratory of Ultrasound Engineering in Medicine, Chongqing Medical University, Chongqing 400016, China(重庆医科大学超声医学工程国家重点实验室) School of Microelectronics, Tianjin University, Tianjin 300072, China(天津大学微电子学院) Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学化学与生物工程系) Division of Life Science, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学生命科学系) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology, Futian, Shenzhen, China(香港科技大学深圳-香港协同创新研究院) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学神经系统疾病国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需专用硬件同步的图像域扩散框架mHC-Diff,通过教师-学生蒸馏实现实时高保真HIFU干扰抑制,在临床数据集上达到26.65 dB PSNR和~20 FPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24402 2026-05-26 cs.CV 79%

Dual Prototype-Conditioned Diffusion Model for Scalable Multi-Class Unsupervised Anomaly Detection in Large Category Spaces

面向大规模类别空间的可扩展多类无监督异常检测的双原型条件扩散模型

Yaoxuan Feng, Yuxin Li, Weijiang Lv, Zixuan Zhao, Yubiao Wang, Wenchao Chen, Bo Chen, Hongwei Liu

机构 * National Key Laboratory of Radar Signal Processing(雷达信号处理国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DPDiff-AD,一种通过局部和全局原型建模异构正态分布并利用扩散重建实现可扩展多类异常检测的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24192 2026-05-26 cs.LG cs.AI cs.CV 79%

Filtered Posterior Mean Collections: A Unified Framework for Analytical Models of Diffusion Generalization

滤波后验均值集合:扩散泛化分析模型的统一框架

Matthew Niedoba, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出滤波后验均值集合(FPMC)统一框架,通过查询精度向量、响应权重和源分布建模扩散模型去噪函数的泛化行为,并通过软松弛和源分布增强提升现有方法性能。

Comments 27 Pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24176 2026-05-26 cs.CV 79%

Loki: Representation over Architecture for Diffusion-Based Portrait Animation

Loki:基于表示而非架构的扩散肖像动画

Pouyan Navard, Sernam Lim

机构 * The Ohio State University(俄亥俄州立大学) University of Central Florida(中央佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Loki方法,通过使用参数化人脸模型解耦身份与表情/姿态,并利用轻量级键值注入保持身份,在减少参数和训练数据的同时提升扩散肖像动画的驱动跟随性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20273 2026-05-26 cs.DC cs.CV 79%

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

SwiftFusion: 面向GPU上扩散Transformer分布式推理的可扩展序列并行

Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

机构 * University of Toronto \&\ Institute Amazon University of Toronto \& Vector Institute \& NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散Transformer推理中序列并行方法的通信和同步瓶颈,提出拓扑感知的StreamFusion引擎,通过Torus Attention和单边通信实现平均1.35倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19021 2026-05-26 cs.LG 79%

Deep Neural Sheaf Diffusion

深度神经层扩散

Rémi Bourgerie, Šarūnas Girdzijauskas, Viktoria Fodor

机构 * School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology, Stockholm, Sweden(电气工程与计算机科学学院,皇家理工学院,斯德哥尔摩,瑞典)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对图神经网络深层堆叠导致表示崩溃的问题,提出用层邻接算子替代层拉普拉斯算子,结合归一化、奇非线性函数和门控机制,在合成和真实数据集上显著提升深层网络性能。

Comments Accepted at the ICML 2026 Workshop on Graph Foundation Models (GFM@ICML 2026). Code available at https://github.com/remibourgerie/deep-neural-sheaf-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏