arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-01 至 2026-04-01 共收录 57 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 57 篇

2603.29029 2026-04-01 cs.CV cs.AI 83%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14157 2026-04-01 cs.CV cs.AI cs.LG 83%

When Test-Time Guidance Is Enough: Fast Image and Video Editing with Diffusion Guidance

测试时指导足矣:基于扩散指导的快速图像和视频编辑

Ahmed Ghorbel, Badr Moufad, Navid Bagheri Shouraki, Alain Oliviero Durmus, Thomas Hirtz, Eric Moulines, Jimmy Olsson, Yazid Janati

机构 * CMAP, Ecole Polytechnique(巴黎综合理工学院CMAP实验室) Institute of Foundation Models(基础模型研究所) MBZUAI(穆罕默德·本·扎耶德人工智能大学) EPITA(法国高等信息技术学院) Sorbonne University(索邦大学) Lagrange Mathematics and Computing Research Center(拉格朗日数学与计算研究中心) EPITA Research Lab(EPITA研究实验室) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过测试时指导实现高效的图像和视频编辑,理论分析并扩展了现有方法,证明测试时指导能与训练时方法媲美甚至超越。

Journal ref ICLR 2026, ReALM-GEN workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR 81%

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29239 2026-04-01 cs.CV 80%

Diffusion Mental Averages

扩散心理平均

Phonphrm Thawatdamrongkit, Sukit Seripanitkarn, Supasorn Suwajanakorn

机构 * VISTEC(泰国威斯泰克科学技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散心理平均(DMA),通过在扩散模型语义空间内平均生成样本,解决传统方法在生成相同提示下的模糊问题,实现一致且逼真的概念平均。

Comments CVPR 2026. Project page: https://diffusion-mental-averages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29569 2026-04-01 cs.GR 79%

AdaptDiff: Adaptive Guidance in Diffusion Models for Diverse and Identity-Consistent Face Synthesis (Student Abstract)

AdaptDiff: 差分模型中适应性引导以生成多样且身份一致的面部合成

Eduarda Caldeira, Tahar Chettaoui, Naser Damer, Fadi Boutros

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出动态加权方案,通过适应性引导抑制无关属性,提升生成面部的一致性和多样性。

Comments Accepted at AAAI 2026 Student Abstract and Poster Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 79%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19114 2026-04-01 cs.CV 79%

CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design

CreatiDesign: 一种统一的多条件扩散变换器用于创意图形设计

Hui Zhang, Dexiang Hong, Maoke Yang, Yutao Cheng, Zhao Zhang, Weidong Chen, Jie Shao, Xinglong Wu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) Bytedance Intelligent Creation(字节跳动智能创作) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CreatiDesign,一种统一的多条件扩散变换器,解决多条件控制问题,通过多模态注意力掩码机制和自动化数据集构建,提升图形设计生成的准确性和和谐度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16205 2026-04-01 cs.CV eess.IV 79%

Generative AI Enables Structural Brain Network Construction from fMRI via Symmetric Diffusion Learning

生成式AI通过对称扩散学习从fMRI构建结构脑网络

Qiankun Zuo, Bangjun Lei, Wanyu Qiu, Changhong Jing, Jin Hong, Shuqiang Wang

机构 * Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffGAN-F2S模型,通过统一框架从fMRI预测结构连接,利用对称扩散生成对抗网络和自适应学习生成高保真结构连接,测试表明其在结构连接预测上优于其他模型,并能识别重要脑区和连接,为多模态脑网络融合提供新方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29343 2026-04-01 cs.CV 79%

FOSCU: Feasibility of Synthetic MRI Generation via Duo-Diffusion Models for Enhancement of 3D U-Nets in Hepatic Segmentation

FOSCU:通过双扩散模型生成合成MRI的可行性,以增强肝部分割的3D U-Net

Youngung Han, Kyeonghun Kim, Seoyoung Ju, Yeonju Jean, Minkyung Cha, Seohyoung Park, Hyeonseok Jung, Nam-Joon Kim, Woo Kyoung Jeong, Ken Ying-Kai Liao, Hyuk-Jae Lee

机构 * Seoul National University(首尔国立大学) Sangmyung University(祥明大学) Ewha Womans University(梨花女子大学) Chung-Ang University(中央大学) Samsung Medical Center, Sungkyunkwan University School of Medicine(三星医学中心,成均馆大学医学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FOSCU,通过双扩散模型生成高分辨率合成MRI数据及分割标签,结合改进的3D U-Net训练流程,提升肝部分割的鲁棒性与图像真实性。

Comments 10 pages, 5 figures. Accepted at IEEE APCCAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15968 2026-04-01 cs.CV 79%

HyperAlign: Hypernetwork for Efficient Test-Time Alignment of Diffusion Models

HyperAlign:用于扩散模型高效测试时对齐的超网络

Xin Xie, Jiaxian Guo, Dong Gong

机构 * University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼新南威尔士大学)) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HyperAlign通过训练超网络实现扩散模型测试时对齐,平衡对齐质量与计算效率,提升语义一致性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24176 2026-04-01 cs.CV cs.LG 79%

Guiding a Diffusion Transformer with the Internal Dynamics of Itself

通过自身内部动态引导扩散变换器

Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) North China Institute of Computer Systems Engineering(华北计算机系统工程研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出内部引导策略,通过训练过程中中间层的辅助监督和采样时的中间层输出扩展,提升训练效率和生成质量,在ImageNet上取得显著效果。

Comments Accepted to CVPR 2026. Project Page: https://zhouxingyu13.github.io/Internal-Guidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11423 2026-04-01 cs.CV 79%

JoyStreamer-Flash: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion

JoyStreamer-Flash: 基于自回归扩散的实时和无限音频驱动化身生成

Chaochao Li, Ruikui Wang, Liangbo Zhou, Jinheng Feng, Huaishao Luo, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出JoyStreamer-Flash,一种能实现实时推断和无限长度视频生成的音频驱动自回归模型,通过渐进式步进 bootstrap、运动条件注入和无界RoPE via Cache-Resetting提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04466 2026-04-01 cs.CV 79%

Emotional Speech-driven 3D Body Animation via Disentangled Latent Diffusion

基于解耦潜在扩散的情感语音驱动3D人体动画

Kiran Chhatre, Radek Daněček, Nikos Athanasiou, Giorgio Becherini, Christopher Peters, Michael J. Black, Timo Bolkart

机构 * KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院) Max Planck Institute for Intelligent Systems, Germany(德国马克斯·普朗克智能系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AMUSE模型,通过解耦潜在向量实现情感语音驱动的3D人体动画生成,能控制情绪和风格,生成更符合语音内容且表现更真实的情绪动作序列。

Comments Conference on Computer Vision and Pattern Recognition (CVPR) 2024. Webpage: https://amuse.is.tue.mpg.de/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29822 2026-04-01 eess.SP 78%

Conditional Diffusion-Based Point Cloud Imaging for UAV Position and Attitude Sensing

基于条件扩散的点云成像用于无人机位置和姿态感知

Xinhong Dai, Yuan Gao, Hao Jiang, Xiaojun Yuan, Xin Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于条件扩散模型的点云成像方法,用于无人机位置和姿态感知,通过电磁点云提取无人机的空间信息和电磁特性,提升成像精度和姿态识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11161 2026-04-01 stat.ML cs.LG math.ST stat.TH 78%

Drift Estimation for Diffusion Processes Using Neural Networks Based on Discretely Observed Independent Paths

基于离散观测独立路径的扩散过程漂移估计

Yuzhen Zhao, Yating Liu, Marc Hoffmann

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于神经网络的非参数估计方法,用于估计扩散过程中在紧致域上的漂移函数,通过高频离散观测获得收敛率,并在高维情况下展示出优于B-样条方法的性能。

Comments Accepted for an oral presentation at the 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026, 40(34), 28778-28785

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02308 2026-04-01 cs.RO cs.LG 78%

Real-Time Operator Takeover for Visuomotor Diffusion Policy Training

视觉-运动扩散策略训练中的实时操作员接管

Marco Moletta, Michael C. Welle, Nils Ingelhag, Jesper Munkeby, Danica Kragic

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) INCAR Robotics AB(INCAR机器人公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出实时操作员接管框架,允许操作员无缝控制机器人运动,提升策略性能。通过针对性演示改进策略表现,并分析马哈拉诺布斯距离用于识别异常状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11338 2026-04-01 q-bio.MN 78%

A spontaneously patterning reaction diffusion network, containing an integrated activator inhibitor and substrate depletion mechanism, specifies trichoblast cell fate in Arabidopsis roots

一种自发形成图案的反应扩散网络,包含整合的激活-抑制和底物耗尽机制,指定拟南芥根部的三基细胞命运

Hayley Mills, George Janes, Anthony Bishopp, Natasha Savage

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过数学建模整合实验数据,揭示拟南芥根部表皮细胞命运由自发反应扩散网络调控,该网络整合激活-抑制和底物耗尽机制。

Comments main 28 pages. 6 supplementary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29469 2026-04-01 cs.HC cs.AI 78%

iPoster: Content-Aware Layout Generation for Interactive Poster Design via Graph-Enhanced Diffusion Models

iPoster:基于图增强扩散模型的交互式海报布局生成

Xudong Zhou, Jinyuan Liang, Qiuyi Guo, Guozheng Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 iPoster通过图增强扩散模型实现交互式海报布局生成,支持用户指定约束条件,生成符合要求的布局,并在实验中表现出卓越的布局质量和可控性。

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29434 2026-04-01 math.AP 78%

Reaction-Diffusion System Approximation to the Fast Diffusion Equation

反应-扩散系统近似用于快速扩散方程

Hideki Murakawa, Florian Salin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种针对奇异扩散问题的新型反应-扩散系统近似方法,通过反应松弛参数和时间导数正则化参数构建系统,证明了其well-posedness并推导了统一的先验估计,通过紧致性论证在三种不同渐进行为下证明了近似解收敛于目标奇异扩散方程的唯一弱解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29339 2026-04-01 cs.SD eess.AS 78%

LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space

LongCat-AudioDiT:在波形潜在空间中实现高保真的扩散文本到语音

Detai Xin, Shujie Hu, Chengzuo Yang, Chen Huang, Guoqiao Yu, Guanglu Wan, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LongCat-AudioDiT通过在波形潜在空间中直接操作,实现了高保真的文本到语音生成,无需复杂多阶段训练流程或高质量标注数据,展现出卓越的零样本语音克隆性能。

Comments Code and model weights are available at https://github.com/meituan-longcat/LongCat-AudioDiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19261 2026-04-01 cs.LG cs.AI cs.NE 78%

DGPO: RL-Steered Graph Diffusion for Neural Architecture Generation

DGPO:基于强化学习的图扩散用于神经架构生成

Aleksei Liuliakov, Luca Hermes, Barbara Hammer

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DGPO通过拓扑节点排序和位置编码扩展强化学习微调,用于生成有向无环图的神经架构搜索,验证结果表明其在NAS-Bench-201任务中达到最优性能,且模型能学习可转移的结构先验。

Comments Submitted to IJCNN 2026 (IEEE WCCI). 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18229 2026-04-01 physics.flu-dyn 78%

Performance of Flamelet Models with Epsilon Tracking for Diffusion Flame Simulations

火焰let模型与epsilon追踪在扩散火焰模拟中的性能

Sylvain L. Walsh, Yalu Zhu, Feng Liu, William A. Sirignano

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了传统火焰let进展变量模型在扩散火焰模拟中的物理一致性,并提出一种基于湍流动能耗散率ε的压缩性火焰let方法,通过分析湍流混合层中的耦合关系,改进了火焰let模型的物理一致性。

Comments Submitted to AIAA SciTech 2026 Forum

Journal ref AIAA SciTech 2026 Forum, Paper 2026-2908

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10848 2026-04-01 cs.CL cs.AI cs.LG 78%

Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles

通过SlowFast采样加速扩散大语言模型:三大黄金原则

Qingyan Wei, Yaojie Zhang, Zhiyuan Liu, Puyu Zeng, Yuxuan Wang, Biqing Qi, Dongrui Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学 EPIC 实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SlowFast采样策略,通过三大原则动态切换探索与加速解码阶段,提升扩散语言模型的生成速度与效率。

Comments 11 pages; 5 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07158 2026-04-01 cs.CR 78%

Real-Time Bit-Level Encryption of Full High-Definition Video Without Diffusion

全高清视频实时位级加密无需扩散

Dong Jiang, Hui-ran Luo, Zi-jian Cui, Xi-jue Zhao, Lin-sheng Huang, Liang-liang Lu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于异构并行计算的实时视频加密协议,通过SHA-256哈希实现位级加密,提升并行性与效率,实现实时高分辨率视频加密。

Journal ref Journal of Information Security and Applications 99, 104450 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29036 2026-04-01 cs.CV 70%

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

从第一人称行走游览视频生成无人类环境 walkthroughs

Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

机构 * Rice University(莱斯大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出一种生成算法,通过去除行走视频中的人和阴影效果,提升环境建模应用,使用半合成数据集训练Casper模型,实现高质量的无人类视频生成,进而构建三维/四维城市模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18782 2026-04-01 cs.CV cs.AI 70%

Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors

Points-to-3D: 基于点云先验的结构感知3D生成

Jiatong Xia, Zicheng Duan, Anton van den Hengel, Lingqiao Liu

机构 * Australian Institute for Machine Learning, University of Adelaide, Australia(澳大利亚阿德莱德大学澳大利亚机器学习研究所)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出Points-to-3D框架,利用点云先验生成可控的3D资产和场景,通过结构修复网络和分阶段采样策略提升几何精度和渲染质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12052 2026-04-01 cs.CV cs.GR 62%

A Text-to-3D Framework for Joint Generation of CG-Ready Humans and Compatible Garments

为生成兼容服装的CG-ready人类和服装联合生成的文本到3D框架

Zhiyao Sun, Yu-Hui Wen, Ho-Jui Fang, Sheng Ye, Matthieu Lin, Tian Lv, Yong-Jin Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Tailor框架,通过语义解析、几何感知服装生成和一致纹理合成,实现高保真定制3D人像和物理兼容服装,优于现有方法。

Comments Project page: https://human-tailor.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30043 2026-04-01 cs.CV 57%

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

视频模型早起推理:利用计划承诺解决迷宫

Kaleb Newman, Tyler Zhu, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29734 2026-04-01 cs.CV 57%

GRVS: a Generalizable and Recurrent Approach to Monocular Dynamic View Synthesis

GRVS:一种通用且递归的方法用于单目动态视图合成

Thomas Tanay, Mohammed Brahimi, Michal Nazarczuk, Qingwen Zhang, Sibi Catley-Chandar, Arthur Moreau, Zhensong Zhang, Eduardo Pérez-Pellitero

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GRVS方法,通过递归循环和动态输入平面扫描,实现高精度的单目动态视图合成,优于现有多种基于高斯点划和扩散的方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29449 2026-04-01 cs.CV cs.AI 57%

NeoNet: An End-to-End 3D MRI-Based Deep Learning Framework for Non-Invasive Prediction of Perineural Invasion via Generation-Driven Classification

NeoNet:一种端到端的3D MRI基于深度学习框架,用于通过生成驱动分类非侵袭性预测神经浸润

Youngung Han, Minkyung Cha, Kyeonghun Kim, Induk Um, Myeongbin Sho, Joo Young Bae, Jaewon Jung, Jung Hyeok Park, Seojun Lee, Nam-Joon Kim, Woo Kyoung Jeong, Won Jae Lee, Pa Hong, Ken Ying-Kai Liao, Hyuk-Jae Lee

机构 * Seoul National University(首尔大学) OUTTA Chung-Ang University(中央大学) Sookmyung Women's University(淑明女子大学) Samsung Medical Center, Sungkyunkwan University School of Medicine(三星医疗中心,成均馆大学医学院) Samsung Changwon Hospital, Sungkyunkwan University School of Medicine(三星昌原医院,成均馆大学医学院) NVIDIA AI Technology Center(英伟达人工智能技术中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出NeoNet框架,通过生成驱动分类方法预测胆管癌神经浸润,解决缺乏明确影像学标准的问题,实现最高AUC 0.7903的性能。

Comments 15 pages, 5 figures. Accepted for oral presentation at W3PHIAI Workshop, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏