arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-19 至 2026-05-19 共收录 214 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 161 篇

2603.20216 2026-05-19 cs.CL cs.AI cs.LG 82%

Locally Coherent Parallel Decoding in Diffusion Language Models

局部相干并行解码在扩散语言模型中

Michael Hersche, Nicolas Menet, Ronan Tanios, Abbas Rahimi

机构 * IBM Research - Zurich(IBM瑞士研究实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出CoDiLA方法,通过引入小型辅助自回归模型来解决扩散语言模型在并行解码中的相干性问题,从而在代码生成任务中实现更高的准确性和速度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19189 2026-05-19 cs.LG 82%

DyDiff: Long-Horizon Rollout via Dynamics Diffusion for Offline Reinforcement Learning

DyDiff: 通过动力学扩散实现离线强化学习中的长周期 rollout

Hanye Zhao, Xiaoshen Han, Zhengbang Zhu, Minghuan Liu, Yong Yu, De-Chuan Zhan, Weinan Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) Department of Computer Science, Nanjing University, Nanjing 210093, China(南京大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DyDiff,一种通过动力学扩散模型实现离线强化学习中长周期轨迹生成的方法,通过迭代注入学习策略信息,解决行为策略与学习策略不一致的问题,提升长周期rollout的准确性。

Comments 18 pages, 10 figures, 9 tables. The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52028-5}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16829 2026-05-19 cs.CL cs.PL 82%

Constrained Code Generation with Discrete Diffusion

带有离散扩散的约束代码生成

Lize Shao, Michael Cardei, Zichen Xie, Ferdinando Fioretto, Wenxi Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种无需训练的神经符号推理框架CDC,通过将约束满足直接整合到反向去噪过程中,提升代码生成中功能正确性、安全性和语法的约束满足能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16520 2026-05-19 cs.LG 82%

Global Convergence of Sampling-Based Nonconvex Optimization through Diffusion-Style Smoothing

通过扩散风格平滑实现采样基于非凸优化的全局收敛

Zeji Yi, Chaoyi Pan, Guanya Shi, Guannan Qu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过平滑视角分析采样优化,揭示平滑在逃逸局部极小值中的作用,并提出DIDA算法实现全局收敛。

Comments 57 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16259 2026-05-19 cs.LG cs.AI cs.DC 82%

Systematic Optimization of Real-Time Diffusion Model Inference on Apple M3 Ultra

苹果M3 Ultra上的实时扩散模型推断系统优化

Yoichi Ochiai

机构 * University of Tsukuba, Faculty of Library, Information and Media Science(筑波大学图书馆、信息与媒体科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文针对苹果M3 Ultra平台系统性优化扩散模型实时推断,通过多种技术结合实现22.7 FPS的实时图像转换,揭示了与NVIDIA GPU不同的优化特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17102 2026-05-19 cs.GR cs.CV 81%

VoxScene: Anchor-Conditioned Voxel Diffusion for Indoor Scene Arrangement

VoxScene: 基于锚点的体素扩散用于室内场景布置

Haotian Mao, Yuhan Huang, Jiatao Lin, Yang Zhao, Hui Wang, Yiheng Zhang, Yuwang Wang, Chenliang Zhou, Yan Zhang, Fangcheng Zhong, Xubo Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Cambridge(剑桥大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出VoxScene,一种基于锚点的体素扩散框架,用于3D场景合成。通过引入显式的、以物体为中心的体素表示,解决了现有方法在处理密集环境时的物理碰撞和结构纠缠问题,实现了高保真体素网格的生成,提升了场景布置的物理合理性和形状多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18719 2026-05-19 cs.CV 79%

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

SafeDiffusion-R1: 在线奖励引导用于安全扩散后训练

Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种在线强化学习框架,通过在负样本和正样本文本提示上进行后训练,利用组相对策略优化(GRPO)解决数据稀缺和模型退化问题,引入了引导奖励机制以提高扩散模型的安全性,实验表明其在减少不适当内容和提升生成质量方面表现优异。

Comments Page 28, Image 20, Table 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18190 2026-05-19 cs.LG cs.CV 79%

Dual-Rate Diffusion: Accelerating diffusion models with an interleaved heavy-light network

双速率扩散:通过交错重-轻网络加速扩散模型

Grigory Bartosh, David Ruhe, Emiel Hoogeboom, Jonathan Heek, Thomas Mensink, Tim Salimans

机构 * Google DeepMind Amsterdam(谷歌深Mind阿姆斯特丹) Amsterdam University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双速率扩散方法,通过交错执行高容量上下文编码器和轻量解噪模型,加速扩散模型推理,同时保持样本质量,在ImageNet基准上实现性能与计算成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14330 2026-05-19 cs.CV cs.LG 79%

LURE: Latent Space Unblocking for Multi-Concept Reawakening in Diffusion Models

LURE: 用于扩散模型多概念重新唤醒的潜在空间解阻

Mengyu Sun, Ziyuan Yang, Andrew Beng Jin Teoh, Junxu Liu, Haibo Hu, Yi Zhang

机构 * Sichuan University(四川大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LURE方法,通过重建潜在空间和引导采样轨迹,实现多概念的高保真重新唤醒,解决了现有方法在多概念场景下的梯度冲突和特征纠缠问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18991 2026-05-19 cs.CV 79%

Fast Kernel-Space Diffusion for Remote Sensing Pansharpening

快速核空间扩散用于遥感全色锐化

Hancong Jin, Zihan Cao, Liang-jian Deng, Jingjing Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出KSDiff框架,通过整合低秩核心张量生成器和统一因子生成器,利用结构感知的多头注意力机制生成增强全局上下文的卷积核,以提升全色锐化质量并加速推理,实验表明其在性能和效率上均优于现有方法。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17850 2026-05-19 stat.ML cs.CV cs.LG cs.NA math.NA math.PR 79%

Simple Approximation and Derivative Free Inference-Time Scaling for Diffusion Models via Sequential Monte Carlo on Path Measures

通过路径测度的序列蒙特卡洛实现扩散模型的简单近似与无导数推理时间缩放

Chenyang Wang, Weizhong Wang, Yinuo Ren, Jose Blanchet, Yiping Lu

机构 * School of Mathematical Sciences, Peking University, Beijing, China School of Mathematical Sciences, Fudan University, Shanghai, China Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Management Science \& Engineering, Stanford University, Stanford, CA, United States

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出URGE算法,一种无需梯度的推理时间缩放方法,通过路径重要性重加权提升扩散模型样本质量,同时在合成测试和扩散模型基准中表现出色,且实现简单且无梯度依赖。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17527 2026-05-19 cs.CV 79%

Designing streetscapes from street-view imagery using diffusion models

利用扩散模型从街景图像中设计街道景观

Yuzhou Chen, Yuebing Liang, Lingqian Hu, Kailai Sun, Qingqi Song, Chang Zhao, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(城市与区域规划系,佛罗里达大学) Singapore-MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工联合研究中心(SMART)) Department of Landscape Architecture and Urban Planning, Texas A&M University(景观建筑与城市规划系,德克萨斯大学安德森分校) Department of Agronomy, University of Florida(农业系,佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种生成多模态AI框架,通过目标视觉指标生成替代的街道景观,提升了城市规划和设计中的视觉探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02198 2026-05-19 cs.CV 79%

SlimDiffSR: Toward Lightweight and Efficient Remote Sensing Image Super-Resolution via Diffusion Model Distillation

SlimDiffSR: 向轻量高效遥感图像超分辨率迈进:通过扩散模型蒸馏

Ce Wang, Zhenyu Hu, Wanjie Sun

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SlimDiffSR,一种轻量高效的基于扩散模型的遥感图像超分辨率框架,通过引入不确定性引导的时间步分配策略和结构化剪枝策略,提升模型效率和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12755 2026-05-19 cs.CV 79%

Towards reconstructing experimental sparse-view X-ray CT data with diffusion models

向稀疏视角X射线CT数据重建迈进:基于扩散模型

Nelas J. Thomsen, Xinyuan Wang, Felix Lucka, Ezgi Demircan-Tureyen

机构 * 1 Martin-Luther-University Halle-Wittenberg, Institute of Physics, Halle, Germany 2 Centrum Wiskunde \& Informatica, Computational Imaging Group, Amsterdam, The Netherlands

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了如何利用扩散模型重建稀疏视角X射线CT数据,探讨了训练数据不匹配(域偏移)和正向模型不匹配对实验数据应用的影响,发现域偏移在不同程度上影响模型性能,而正向模型不匹配可通过退火似然权重调度缓解。

Comments 5 pages + references, 4 figures, 2 tables, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11130 2026-05-19 cs.LG cs.CV 79%

Meltdown: Circuits and Bifurcations in Point-Cloud-Conditioned 3D Diffusion Transformers

Meltdown: 点云条件化3D扩散变换器中的电路与分叉

Maximilian Plattner, Fabian Paischer, Johannes Brandstetter, Arturs Berzins

机构 * Institute for Machine Learning, JKU Linz(机器学习研究所,林茨大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究探讨了点云条件化3D扩散变换器在输入变化下的失败模式,揭示了Meltdown现象,通过机制性案例研究展示了其成因,并提出了PowerRemap方法以抑制该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12598 2026-05-19 cs.CV 79%

Setting the Stage: Text-Driven Scene-Consistent Image Generation

设定舞台:基于文本的场景一致图像生成

Cong Xie, Che Wang, Yan Zhang, Ruiqi Yu, Han Zou, Zheng Pan, Zhenpeng Zhan

机构 * Global Business Unit, Baidu Inc.(百度公司全球业务部)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文研究了场景构建任务,通过结合参考场景图像和文本条件生成符合空间关系的演员图像,提出了一种新的数据构建管道和对应关系引导的注意力损失,以提高场景一致性和文本-图像一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06384 2026-05-19 eess.IV cs.CV 79%

Mitigating 3D Prostate Biparametric MRI Data Scarcity through Domain Adaptation using Locally-Trained Latent Diffusion Models for Prostate Cancer Detection

通过使用本地训练的潜在扩散模型进行领域适应以缓解3D前列腺双参数MRI数据稀缺问题

Emerson P. Grabke, Babak Taati, Masoom A. Haider

机构 * Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所) Lunenfeld-Tanenbaum Research Institute, Mount Sinai Hospital(圣心医院卢内尔-塔内本研究所) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(多伦多康复研究所、KITE研究所在大学健康网络) Joint Department of Medical Imaging, University of Toronto, Princess Margaret Hospital, and Sinai Health systems(多伦多大学联合医学影像部门、玛格丽特医院及辛纳医疗系统) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Faculty Affiliate of the Vector Institute, Toronto(向量研究所教职员工)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CCELLA++,一种新的潜在扩散模型流程,用于同时生成3D双参数前列腺MRI(bpMRI),包括轴向T2加权(AxT2)、高b值扩散系列(HighB)和表观扩散系数图(ADC),以克服数据稀缺问题。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18158 2026-05-19 cs.CV eess.IV 79%

Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion

语义解耦与组合用于具有高效LLM推理和生成扩散的通用图像编码

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院) Eastern Institute of Technology(东部技术研究院) University of Science and Technology of China(中国科学技术大学) Yokohama National University(Yokohama国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniCodec,一种基于语义解耦和组合生成的通用图像编码框架,通过高效LLM推理和生成扩散模型实现人类和机器需求的统一压缩,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17248 2026-05-19 cs.CV 79%

Image-to-Video Diffusion: From Foundations to Open Frontiers

图像到视频扩散:从基础到开放前沿

Xianlong Wang, Wenbo Pan, Shijia Zhou, Ke Li, Yuqi Wang, Zeyu Ye, Hangtao Zhang, Leo Yu Zhang, Xiaohua Jia

机构 * IEEE Publication Technology Group(IEEE出版技术组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了图像到视频扩散生成的核心问题,通过梳理任务定义、模型架构、数据集和评估指标,提出了一种基于架构和训练范式的分类方法,并总结了四个核心设计:条件编码、时间建模、噪声先验设计和空间时间上采样,探讨了代表性应用场景和主要开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17087 2026-05-19 cs.CV 79%

The Learnability Gap in Medical Latent Diffusion

医学潜在扩散中的可学习差距

Mischa Dombrowski, Felix Nützel, Bernhard Kainz

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了医学图像中潜在扩散模型在处理类别不平衡问题时的可学习差距,指出尽管预训练的自动编码器能有效编码判别特征,但其潜在表示的结构性使分类器难以学习,通过开发噪声条件潜在分类器和图像空间蒸馏技术,提高了效率并改善了潜在空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16990 2026-05-19 cs.CV 79%

DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing

DreamEdit3D: 多视角扩散模型的3D编辑个性化

Jinxin Ai, Matthias Nießner, Ziya Erkoç

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DreamEdit3D,通过自然语言实现多视角扩散模型的3D编辑个性化,通过提取语义组件并学习不同组件的token嵌入,实现多视角一致的高质量3D编辑。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16949 2026-05-19 cs.CV 79%

Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers

超越点对点匹配:为加速扩散变换器的结构表示对齐

Shaodong Xu, Zhendong Wang, Litong Gong, Zexian Li, Wengang Zhou, Tiezheng Ge, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出sREPA框架,通过显式结构约束来对齐特征图的相对几何关系,以提高生成质量并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16918 2026-05-19 cs.CV 79%

HighSync: High-Quality Lip Synchronization via Latent Diffusion Models

HighSync: 通过潜在扩散模型实现高质量唇部同步

Saeed Firouzi Daghigh, Majid Iranpour Mobarekeh, Mostafa Alavi, Mehdi Bagheri

机构 * Department of Computer Engineering and Information Technology, Payam Noor University(Payam Noor大学计算机工程与信息科技系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HighSync,一种端到端的扩散框架,用于生成与任意输入音频对齐的逼真说话人脸视频。该方法同时解决了图像质量和同步准确性之间的矛盾,是首个原生在512*512分辨率上运行的唇部同步模型,适用于电影和广播行业等专业生产环境。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16807 2026-05-19 cs.CV 79%

DecoRec: Decomposed 3D Scene Reconstruction from Single-View Images via Object-Level Diffusion

DecoRec: 通过物体级扩散进行单视图图像的分解3D场景重建

Yuhan Ping, Yuan Liu, Xiaoxiao Long, Peng Wang, Junhui Hou, Jianyi Zheng, Jia Pan, Xin Li, Cheng Lin

机构 * Department of Computer Science, the University of Hong Kong(香港大学计算机科学系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Faculty of Humanities and Arts, Macau University of Science and Technology(澳门科学理工学院人文艺术学院) Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science and Engineering, Macau University of Science and Technology(澳门科学理工学院计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DecoRec系统,通过物体级扩散方法实现单视图图像的分解3D场景重建,解决了现有方法在场景重建中出现的精度问题,并通过可微渲染和扩散引导细化技术提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14223 2026-05-19 cs.CV 79%

StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model

StreamingTalker: 基于音频的3D面部动画与自回归扩散模型

Yifan Yang, Zhi Cen, Sida Peng, Xiangwei Chen, Yifu Deng, Xinyu Zhu, Fan Jia, Xiaowei Zhou, Hujun Bao

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) College of Computer Science, Zhejiang University(浙江大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于自回归扩散模型的StreamingTalker,解决音频驱动3D面部动画中长音频处理延迟和超训练范围的问题,通过动态条件生成高质量实时面部动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20389 2026-05-19 eess.IV cs.CV 79%

High-Resolution Reference Image Assisted Volumetric Super-Resolution of Cardiac Diffusion Weighted Imaging

高分辨率参考图像辅助的心脏扩散加权成像体积分辨率提升

Yinzhe Wu, Jiahao Huang, Fanwen Wang, Pedro Ferreira, Andrew Scott, Sonia Nielles-Vallespin, Guang Yang

机构 * Department of Bioengineering, Imperial College London(帝国理工学院生物工程系) Cardiovascular Magnetic Resonance Unit, Royal Brompton Hospital(皇家布里托尼医院心血管磁共振单位) National Heart and Lung Institute, Imperial College London(帝国理工学院国家心脏和肺研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于深度学习的体积分辨率提升框架,利用高分辨率b0 DWI作为输入,提升心脏扩散加权成像的图像质量,并证明了该框架在未见b值下的泛化能力。

Comments Accepted by SPIE Medical Imaging 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16444 2026-05-19 cs.CV cs.AI 79%

Diffusion Attention Expert Model for Predicting and Semi-automatic Localizing STAS in Lung Cancer Histopathological Images

扩散注意力专家模型用于预测和半自动定位肺癌组织病理图像中的STAS

Liangrui Pan, Jiadi Luo, Yuxuan Xiao, Chenchen Nie, Xiaoshuai Wu, Songqing Fan, Ling Chu, Manqiu Li, Rongfang He, Zhenyu Zhao, Ruixing Wang, Shulin Liu, Yiyi Liang, Xiang Wang, Qingchun Liang, Shaoliang Peng

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Department of Pathology, The Second Xiangya Hospital, Central South University(中南大学湘雅医院病理科) Hunan Clinical Medical Research Center for Cancer Pathogenic Genes Testing and Diagnosis(湖南临床医学肿瘤基因检测与诊断研究中心) Department of Thoracic Surgery, The Second Xiangya Hospital, Central South University(中南大学湘雅医院胸外科) Department of pathology, Hunan Cancer Hospital, The Affiliated Cancer Hospital of Xiangya School of Medicine, Central South University(湖南肿瘤医院病理科) Department of Pathology, The Third Xiangya Hospital, Central South University(中南大学湘雅第三医院病理科) Department of Pathology, First People's Hospital of Pingjiang County(平江县第一人民医院病理科) Department of Pathology, the First Affiliated Hospital, Hengyang Medical School, University of South China(南华大学衡阳医学院第一附属医院病理科) Department of Radiology, The Second Xiangya Hospital of Central South University(中南大学湘雅医院放射科) Department of Radiology, Xiangya Hospital, Central South University(中南大学湘雅医院放射科) Oncology Department and State Key Laboratory of Systems Medicine for Cancer of Shanghai Cancer Institute, Renji Hospital, School of Medicine, Shanghai Jiaotong University(上海癌症研究院肿瘤科及上海交通大学医学院系统医学重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DAEM模型,通过多尺度特征学习和双分支架构提升STAS检测精度,实现对冷冻切片和石蜡切片的高AUC值检测,并利用肿瘤微环境特征实现STAS半自动定位。

Comments Accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16420 2026-05-19 cs.CV cs.LG 79%

Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance

基于扩散模型的图像到视频生成与轨迹引导的视频重建

Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电气与计算机工程系,希腊国家技术大学雅典分校) Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学锡罗斯分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练的图像到视频扩散模型,通过GPS轨迹引导生成无人机视频的缺失或丢失帧,无需领域特定微调,展示了在低纹理和小目标条件下视频重建的有效性。

Comments Accepted at the 1st Workshop on Multi-Sensor Trajectory Knowledge Discovery and Extraction (MuseKDE 2026), co-located with the 27th IEEE International Conference on Mobile Data Management (IEEE MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18530 2026-05-19 cs.CL cs.AI cs.LG stat.ML 78%

Continuous Diffusion Scales Competitively with Discrete Diffusion for Language

连续扩散在语言领域中能与离散扩散竞争性地扩展

Zhihan Yang, Wei Guo, Shuibai Zhang, Subham Sekhar Sahoo, Yongxin Chen, Arash Vahdat, Morteza Mardani, John Thickstun

机构 * NVIDIA & Cornell(NVIDIA与康奈尔大学) NVIDIA & Georgia Tech(NVIDIA与佐治亚理工学院) UW-Madison(威斯康星大学麦迪逊分校) MBZUAI-IFM(梅兰德大学-IFM) Cornell(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了连续扩散模型在语言建模中的扩展能力,通过改进Plaid模型构建RePlaid,证明连续扩散模型在计算效率和性能上可与离散模型竞争,并提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18521 2026-05-19 math.AP 78%

Nonlinear Kinetic Diffusion Equations with $p$-Growth

具有p增长的非线性动力学扩散方程

Helge Dietert, Lukas Niebel, Rico Zacher

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有p增长的非线性动力学扩散方程(sub-)解的局部有界性,关键在于推导了动能Gagliardo-Nirenberg不等式,通过估计函数的Lebesgue范数来控制其运输和扩散方向。

详情

展开后加载摘要…

URL PDF HTML 收藏