arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1688 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1299 篇

2506.18164 2026-08-04 cs.CV 版本更新 79%

CDG-MAE: Cross-view Masked Modeling using Diffusion Generated Views

CDG-MAE:基于扩散生成视图的跨视图掩码建模

Varun Belagali, Pierre Marza, Srikar Yellapragada, Zilinghan Li, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Stergios Christodoulidis, Maria Vakalopoulou, Dimitris Samaras

机构 * Stony Brook University(石溪大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎-萨克雷大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学) Archimedes/Athena RC

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CDG-MAE是一种基于MAE的自监督方法,通过图像条件扩散模型生成多样化合成视图并采用多锚掩码策略,缩小了与基于视频的MAE方法的差距,同时保持仅图像MAE的数据优势。

Comments Accepted to TMLR 2026, Github link: https://github.com/cvlab-stonybrook/CDG-MAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17303 2026-08-03 cs.CV 版本更新 79%

EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance

EMAG: 无训练的自修正扩散采样与指数移动平均引导

Ankit Yadav, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) The University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EMAG通过无训练机制改进扩散模型的引导技术,生成更困难的负样本以提升生成质量和人类偏好分数。

Comments 63 pages (Accepted at ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20255 2026-08-03 cs.CV 版本更新 79%

AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models

AniCrafter:基于视频扩散模型中化身-背景条件的逼真以人为中心动画定制

Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出AniCrafter模型,通过在视频扩散模型中引入化身-背景条件机制,解决现有角色动画方法在开放域场景中效果受限的问题,其性能优于现有最先进方法,可生成通用且可感知遮挡的动画结果。

Comments Homepage: https://myniuuu.github.io/AniCrafter ; Codes: https://github.com/MyNiuuu/AniCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24731 2026-07-31 cs.CV cs.AI cs.LG 版本更新 79%

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

重新思考策略性扩散蒸馏中的无分类器引导

Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴的通义千问业务部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究策略性扩散蒸馏在无分类器引导下的表现,指出现有方法存在负分支不对称问题,引入正向匹配方法,通过分支感知分别约束正预测和条件方向,应用于视频控制实现更有效知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27075 2026-07-31 cs.CV 版本更新 79%

BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration

SoftCap: 扩散Transformer加速的软预算控制

Yuhang Zhang, Junxiang Qiu, Huixia Ben, Zhenhua Tang, Lin Liu, Shuo Wang, Yanbin Hao

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Anhui University of Science and Technology(安徽理工大学) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需训练的软预算控制层SoftCap,通过轨迹漂移观测器和软预算PI控制器动态调整全步触发阈值,在保持计算预算软上限的同时提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18801 2026-07-31 cs.CV 版本更新 79%

PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

PartDiffuser:通过离散扩散实现部件级3D网格生成

Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang

机构 * Beihang University(北航) Communication University of China(中国通信大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11325 2026-07-31 cs.CV 版本更新 79%

ReDiff: Reliability-Guided Diffusion for Trustworthy Ultra-Low-Field to High-Field MRI Synthesis

迈向可信的选择性生成:用于超低场到高场MRI合成的可靠性引导扩散

Zhenxuan Zhang, Peiyuan Jing, Ruicheng Yuan, Liwei Hu, Anbang Wang, Fanwen Wang, Yinzhe Wu, Kh Tohidul Islam, Zhaolin Chen, Zi Wang, Peter Lally, Guang Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDiff框架,通过可靠性引导的采样策略和多候选选择方案,提升MRI合成的鲁棒性和解剖学一致性,减少伪影并提高结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13656 2026-07-29 cs.CV 版本更新 79%

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

FreeLit:通过物理引导扩散实现无配对室内重光照

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对室内场景重光照难题,提出FreeLit无配对框架,利用物理引导光照先验及重光照引导的固有稳定策略,结合面向可控性的评估指标,实现稳定、物理一致且可控的重光照,提升低光照场景下的鲁棒性,无需配对监督。

Comments Updated to the ACM Multimedia 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06173 2026-07-28 cs.CV 版本更新 79%

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan:弥合移动视频扩散的质量差距

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13826 2026-07-27 eess.IV cs.CV 版本更新 79%

Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction

使用扩散模型进行心脏容积重建的潜在插值学习

Niklas Bubeck, Suprosanna Shit, Chen Chen, Can Zhao, Pengfei Guo, Dong Yang, Georg Zitzlsberger, Daguang Xu, Bernhard Kainz, Daniel Rueckert, Jiazhen Pan

机构 * School of Computation, Information and Technology, Technical University Munich(技术大学慕尼黑计算信息学院) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学生物医学工程研究所) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) NVIDIA(英伟达) Department of Computing, Imperial College London(伦敦帝国学院计算机系) Department AIBE of Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡大学AIBE系) School of Medicine, Klinikum Rechts der Isar, Technical University of Munich(慕尼黑技术大学医学院,莱纳特医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对心脏磁共振成像二维切片采集稀疏致容积信息不完整、现有重建方法有局限的问题,提出CaLID框架,创新采用基于扩散模型的插值方案、潜在空间高效计算法,仅用稀疏二维图像输入达SOTA,扩展到二维加时间数据,提升了重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20302 2026-07-27 cs.CV 版本更新 79%

TDiR: Transformer based Diffusion for Image Restoration Tasks

TDiR:基于Transformer的扩散用于图像恢复任务

Abbas Anwar, Ibrahim Radwan, Ali Arshad Nasir, Mudassir Masood, Saeed Anwar

机构 * Department of Computer Vision(计算机视觉系) FutureDataMinds Electrical Engineering Dept(电气工程系) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿产大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Western Australia(西澳大学) School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对图像在复杂环境下的退化问题,开发基于Transformer的扩散模型用于图像恢复。该模型在水下增强、去噪、去雨三项任务中经五个基准测试,并与18种先进技术对比,结果显示其性能优越,有效提升了退化图像质量,拓宽了相关下游任务应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11658 2026-07-24 cs.CV 版本更新 79%

EmoSpace: Immersive Affective Image Generation Guided by Fine-Grained Emotion Prototypes

EmoSpace: 细粒度情绪原型学习用于沉浸式情感内容生成

Bingyuan Wang, Xingbei Chen, Zongyang Qiu, Lin-Ping Yuan, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 EmoSpace通过视觉-语言对齐学习动态情绪原型,实现沉浸式情感内容生成的细粒度控制与多样化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17612 2026-07-23 cs.CV 版本更新 79%

Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution

用于逼真图像超分辨率的稀有感知离散扩散与空间一致解码

Ao Li, Yapeng Du, Yi Xin, Lei Zhu, Le Zhang, Guangtao Zhai, Ce Zhu, Xiaohong Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对图像超分辨率,提出DiMOO-SR框架。训练时用逆频率采样处理稀有令牌,推理时用空间一致性排名提高结构连贯性。实验表明该框架仅需少量并行解码步骤就能实现有竞争力的感知质量,凸显离散扩散在图像超分辨率中的潜力。

Comments 5 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 79%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05509 2026-07-20 cs.CV 版本更新 79%

Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models

与流形相切:为扩散模型发现黎曼度量

Shinnosuke Saito, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的黎曼度量,通过分数函数雅可比的谱结构区分流形切线与法线方向,从而在噪声空间中促进路径保持流形切线性,提升扩散模型的生成质量与文本-图像对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09238 2026-07-17 cs.CV 版本更新 79%

Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method

知识嵌入与超网络引导的少样本变电站电表缺陷图像生成方法

Jackie Alex, Justin Petter

机构 * St. Petersburg College(斯波尔丁学院)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对变电站电表缺陷图像标注样本稀缺问题,提出将知识嵌入、超网络引导条件控制集成到稳定扩散管道的方法,能逼真可控合成缺陷图像,优于现有基线,提升下游检测器mAP等,为工业检测提供数据合成方案。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20153 2026-07-17 cs.CV 版本更新 79%

CoDi -- an exemplar-conditioned diffusion model for low-shot counting

CoDi——一种用于少样本计数的示例条件扩散模型

Grega Šuštar, Jer Pelhan, Alan Lukežič, Matej Kristan

机构 * Faculty of Computer and Information Science, University of Ljubljana(计算机与信息科学学院,卢布尔雅那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究少样本目标计数问题,提出基于潜在扩散的CoDi模型,其核心是基于示例的条件模块,能生成高质量密度图。在FSC和MCAC基准测试中表现出色,分别在少样本等场景及整体上大幅超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10999 2026-07-17 cs.CV 版本更新 79%

Conditioning Residuals for Diffusion Models via Representation Feedback

通过表示反馈对扩散模型的残差进行条件设定

Weilai Xiang, Hongyu Yang, Di Huang, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型中能否利用固有路径路由内部推断语义,提出条件残差这一轻量级反馈机制,通过反馈紧凑特征摘要提供自适应指导,实验显示其提升了生成性能及下游任务表现,还揭示了训练动态和特征结构的改进。

Comments Substantially revised and retitled. Code available at https://github.com/FutureXiang/ddae_plus_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新 79%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12785 2026-07-16 cs.CV 版本更新 79%

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

ExtraGS:通过扩散引导的3D高斯点渲染增强内窥镜视图外推

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

机构 * The School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, and the Shanghai Key Laboratory of Navigation and Location-Based Services(上海交通大学自动化与智能感知学院以及上海市导航与位置服务重点实验室) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对传统内窥镜视野局限及神经渲染外推有伪影问题,提出ExtraGS框架,通过不确定性引导虚拟相机采样、扩散模型细化视图及置信加权微调策略,增强内窥镜视图外推,在新视图合成中达先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28419 2026-07-16 cs.CV cs.AI 版本更新 79%

MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentation

MedDiffuseMix: 通过显著性感知的扩散医学图像数据增强保留诊断证据

Teerath Kumar, Raja Vavekanand, Muhammad Turab

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MedDiffuseMix框架,利用分类器显著性图引导扩散混合,主要增强低显著性背景区域,保留诊断关键区域,在四个医学图像数据集上提升分类性能。

Comments Under review Signal Image and Video Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 79%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01841 2026-07-15 cs.CV 版本更新 79%

Leveraging Prior Knowledge of Diffusion Model for Person Search

利用扩散模型的先验知识进行行人搜索

Giyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom

机构 * GSAIM, Chung-Ang University(Chung-Ang大学图像信息研究所) IPAI, Seoul National University(首尔国立大学图像感知研究所) Department of Mathematical Sciences and RIMS, Seoul National University(首尔国立大学数学科学系和RIMS)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对行人搜索中现有方法的不足,提出DiffPS框架,利用预训练扩散模型,消除子任务优化冲突,通过分析扩散先验属性设计三个专门模块,在CUHK-SYSU和PRW数据集上取得新的最优成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09122 2026-07-15 cs.CV 版本更新 79%

LVMark: Robust Watermark for Latent Video Diffusion Models

LVMark:用于潜在视频扩散模型的鲁棒水印

Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim

机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10094 2026-07-15 cs.CV cs.LG 版本更新 79%

Beyond Perceptual Distance: Discrepancy Assessment on Deep Representation for Out-of-Distribution Detection with Diffusion Model

超越感知距离:基于扩散模型的分布外检测深度表示差异评估

Kun Fang, Zuopeng Yang, Haibo Hu, Xiaolin Huang, Jie Yang, Qinghua Tao

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) The Intsig Information Co., Ltd., Shanghai, China(上海Intsig信息有限公司) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散模型的分布外检测差异评估,提出以分类器相关方式评估,利用其表示空间量化特征级和logit级差异,设计优化策略构成DDR框架,实验表明DDR在ImageNet-1K数据集上检测性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新 79%

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00786 2026-07-14 cs.CV 版本更新 79%

Zero-Shot Paragraph-level Handwriting Imitation with Latent Diffusion Models

基于潜在扩散模型的零样本段落级手写模仿

Martin Mayr, Marcel Dreier, Florian Kordon, Mathias Seuret, Jochen Zöllner, Fei Wu, Andreas Maier, Vincent Christlein

机构 * Planet AI GmbH

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于潜在扩散模型的零样本段落级手写模仿方法,通过改进模型、增强注意力机制等,能处理未见风格,提高手写生成真实感,在综合评估中表现优异,还公开代码支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14584 2026-07-10 cs.CV 版本更新 79%

Anatomically Guided Latent Diffusion for Brain MRI Progression Modeling

用于脑 MRI 进展建模的解剖学引导潜在扩散

Cheng Wan, Bahram Jafrasteh, Ehsan Adeli, Miaomiao Zhang, Qingyu Zhao

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔医学院) Stanford University(斯坦福大学) University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确建模脑 MRI 进展,提出解剖学引导潜在扩散模型 AG-LDM,通过融合多因素简化训练流程,经实验验证其在图像质量、误差降低及特征捕捉等方面表现优异,是可靠的脑 MRI 进展建模框架。

Comments 24 pages, 7 figures, 7 tables. Code available at https://github.com/JornyWan/AG-LDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17077 2026-07-09 cs.LG cs.AI cs.CV 版本更新 79%

ContrastiveCFG: Guiding Diffusion Sampling by Contrasting Positive and Negative Concepts

对比CFG:通过对比正负概念引导扩散采样

Jinho Chang, Changsun Lee, Hyungjin Chung, Jong Chul Ye

机构 * EverEx

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在条件扩散模型采样中,针对简单否定CFG引导存在的问题,提出用对比损失实现对给定条件引导的新方法,能在多样场景下有效注入或去除给定概念并保持样本质量。

Comments 20 pages, 11 figures. Poster in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏