arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2606.08411 2026-06-09 cs.CL 新提交 78%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08408 2026-06-09 cs.CL cs.AI 新提交 78%

TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering

TimpaTeks: 通过扩散语言模型引导实现自动原地文本序列修改

Ryandito Diandaru, Ikhlasul Akmal Hanif, Fadli Aulawi Al Ghiffari, Ahmed Elshabrawy, Alham Fikri Aji

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TimpaTeks方法,将激活引导扩展到扩散语言模型,实现原地文本修改以改变概念,在情感和概念引导任务上降低困惑度并保持句子结构。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-06-09 cs.CL 新提交 78%

Forward-Free Diffusion Language Models

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08334 2026-06-09 cond-mat.stat-mech 新提交 78%

Enhanced dumbbell diffusion in a periodic potential by the elevator effect

周期势中由电梯效应增强的哑铃扩散

B. A. Kiang, H. Schiessel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过分子动力学模拟,研究弹簧连接的双珠(哑铃)在一维周期势中的随机游走,发现当弹簧平衡距离与势周期不匹配且弹簧常数足够大时,扩散增强,类似于电梯效应。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07982 2026-06-09 cs.LG 新提交 78%

Overcoming the Limits of Finite Difference Method; Physics-Informed Neural Network for Noisy High-Dimensional Heat Diffusion

克服有限差分法的局限性:用于含噪高维热扩散的物理信息神经网络

Shreesh Bhattarai, Harish Chandra Bhandari

机构 * Kathmandu University(加德满都大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对高维含噪热扩散问题,提出物理信息神经网络(PINN)框架,在噪声和维度较高时显著优于有限差分法(FDM),实现精度与效率的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07835 2026-06-09 cs.LG 新提交 78%

Mitigating the Contractivity Trap in Diffusion ODEs via Stein Stabilization

通过Stein稳定化缓解扩散ODE中的收缩陷阱

Shigui Li, Delu Zeng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散模型确定性概率流ODE大步长推理中的收缩陷阱问题,提出SteinDiff框架,通过Stein导出的几何感知残差校正机制正则化求解器更新,无需参考样本即可提升生成质量。

Comments 32 pages, 12 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07356 2026-06-08 cs.SD cs.CL 新提交 78%

DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

DirectAudioEdit: 基于扩散预测对比的无反演文本引导音频编辑

Zhengkun Ge, Xiaoqian Liu, Haoran Zhang, Yuan Ge, Junxiang Zhang, Zhengtao Yu, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Kunming University of Science and Technology(昆明理工大学) NiuTrans Research, Shenyang, China(新译研究)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种无需训练和反演的文本引导音频编辑方法DirectAudioEdit,通过扩散预测对比构建编辑路径,在音乐和事件基准上降低FAD和KL指标15%以上,编辑速度提升高达64.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07293 2026-06-08 cs.SD cs.LG 新提交 78%

TargetSEC: Plug-and-Play In-the-Wild Speech Emotion Conversion via Arousal-Conditioned Latent Style Diffusion

TargetSEC: 基于唤醒度条件潜在风格扩散的即插即用野外语音情感转换

Constantin Alexander Auga

机构 * Hasso Plattner Institute / University of Potsdam(霍普特尔研究所 / 波茨坦大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TargetSEC,一种基于嵌入驱动的潜在扩散框架,通过连续情感条件生成情感风格嵌入,在紧凑潜在空间操作,实现高转换精度和语音质量。

Comments 5 pages, 2 figures, 2 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06618 2026-06-08 cs.RO cs.AI cs.LG 新提交 78%

ChronoForest: Closed-Loop Multi-Tree Diffusion Planning for Efficient Bridge Search and Route Composition

ChronoForest: 用于高效桥接搜索和路线组合的闭环多树扩散规划

Jungmin Seo, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对仅依赖短程离线轨迹进行长程路线规划的问题,提出ChronoForest系统,通过锚链树扩散规划器和在线多树协调器实现局部桥接搜索与全局路线重解,在OGBench和哈密顿路线组合基准上显著提升成功率和效率。

Comments 40 pages, 4 figures, 7 tables, 3 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06518 2026-06-08 cs.AI cs.LG 新提交 78%

DiBS: Diffusion-Informed Branch Selection

DiBS: 扩散模型引导的分支选择

Bo Liu, Yuan Xie, Yuan Gao, Xiaolong Luo, Peng Ye, Tao Chen, Fujun Han

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对数独求解中学习型求解器缺乏正确性保证而符号求解器存在长尾搜索的问题,提出扩散模型引导的分支选择方法DiBS,在保持符号求解器完备性的同时,利用扩散模型排序候选值,显著降低搜索成本。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07195 2026-06-08 math.NA cs.NA 新提交 78%

Adjoint-based Perfusion Estimation from Dynamic Contrast-Enhanced Ultrasound: Advection-Diffusion and Two-Compartment Models

基于伴随的动态对比增强超声灌注估计:对流扩散与两室模型

Sophie Externbrink, Ahmed El Kaffas, Dimitre Hristov, Sebastian Götschel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过伴随方法估计肿瘤血流速度和灌注参数,比较了对流扩散模型与生理上更合理的两室模型,并利用Tikhonov正则化和连续伴随方程进行高效梯度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07165 2026-06-08 physics.geo-ph 新提交 78%

Implicit Structural Modeling via Generative Diffusion Frameworks

基于生成扩散框架的隐式结构建模

Yimin Dou, Xinming Wu, Zhixiang Guo, Hui Gao, Buyu Deng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于扩散模型的隐式结构建模方法,通过仿真合成数据训练和条件注入,有效处理复杂断层系统,保持拓扑一致性和运动学合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01686 2026-08-04 cs.CV 新提交 77%

Generative AI and Foundation Models in Medical Image

医学影像中的生成式AI与基础模型

Masahiro Oda

机构 * Nagoya University(名古屋大学) Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);分类 cs.CV

AI总结 本文概述生成式AI相关的扩散模型、LLMs及基础模型,介绍其在医疗辅助中的应用,探讨基础模型的构建方法与医疗应用,并研究利用国家资源开发医疗辅助AI的路径。

Comments Review Article

Journal ref Radiological Physics and Technology, vol.18, pp.937-948, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22101 2026-07-27 cs.CV 新提交 77%

InnoText: A Unified Model for Visual Text Generation and Editing

InnoText:一种用于视觉文本生成和编辑的统一模型

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

机构 * JD.com, Inc.(京东公司) University of Chinese Academy of Sciences(中国科学院大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Beijing University of Technology(北京工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对视觉文本生成和编辑的挑战,提出基于DiT的统一框架InnoText,通过引入字体大小感知调制模块等策略,构建双语数据集,实现了在单个模型中进行文本生成和编辑,提升了生成精度和编辑质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16294 2026-07-21 cs.CV cs.AI 新提交 77%

A${}^2$BM: Alignment-Aware Bridge Matching for Image-to-Image Translation

A²BM:用于图像到图像翻译的对齐感知桥接匹配

Aimi Okabayashi, Georges Le Bellier, Nicolas Audebert, Charlotte Pelletier, Thomas Corpetti, Nicolas Courty

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image editing(abstract);分类 cs.CV

AI总结 研究图像到图像翻译中弱对齐数据问题,提出A²BM方法利用图像对对齐,在训练中纳入对齐分数区分真实对应,推理时控制翻译保真度,实验验证该方法比基线表现优,为弱对齐数据的图像翻译提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05649 2026-07-08 cs.CV cs.LG 新提交 77%

REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles

REVIVE:一种用于自动驾驶车辆中破坏行为检测与恢复的多模态框架

Abdullah Tariq Choudhry, Tapadhir Das

机构 * University of the Pacific(太平洋大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);inpainting(abstract);分类 cs.CV

AI总结 研究自动驾驶车辆中破坏行为导致的遮挡攻击问题,提出REVIVE多模态框架,集成多种检测与恢复方法,如二进制VOA检测、多类VOA模式识别等,实验表明该框架能有效恢复图像,提升目标检测指标,提供结构化恢复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02628 2026-07-07 cs.CV cs.LG 新提交 77%

SE-UNet: Singular Equivariant Imaging for Real-World Constrained Generation

SE-UNet:用于现实世界约束生成的奇异等变成像

Kanishk Awadhiya

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 介绍SE-UNet框架,将生成视为受几何等变性和奇异值门控约束的优化问题,有效规范解空间,实现CIFAR-10上零样本修复,超越DIP基线,为约束生成提供数据高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23267 2026-06-23 cs.CV cs.CY 新提交 77%

Safe Few-Step Generation via Velocity Editing

通过速度编辑实现安全少步生成

Yujin Choi, Jaehong Yoon

机构 * NTU Singapore(新加坡南洋理工大学) UNIST(蔚山科学技术院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 针对流匹配文本到图像生成中少采样步数下的安全问题,提出无训练的速度编辑方法VESFlow及其增强版VESFlow+,通过编辑速度场而非修改提示词来引导生成远离不安全内容,在保持良性提示保真度的同时显著降低攻击成功率。

Comments Project Page: https://uzn36.github.io/VESFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21736 2026-06-23 cs.CV 新提交 77%

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

对抗域提示调优与生成用于单域泛化

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出渐进式对抗提示调优框架,利用预训练扩散模型生成多样域风格图像,实现单域泛化,性能超越现有方法。

Comments 12 pages, 6 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11155 2026-06-10 cs.CV 新提交 77%

Mean Flow Distillation: Robust and Stable Distillation for Flow Matching Models

平均流蒸馏:面向流匹配模型的鲁棒稳定蒸馏方法

An Zhao, Shengyuan Zhang, Zhongjian Sun, Yixiang Zhou, Zejian Li, Ling Yang, Tianrun Chen, Lingyun Sun

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出平均流蒸馏(MFD)框架,通过时间低通滤波抑制优化噪声并保证轨迹一致性,实现流匹配模型的高保真单步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21135 2026-06-23 cs.CV cs.GR cs.RO 新提交 76%

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

Odoriko: 一种形状感知的多模态人体运动扩散框架

Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 扩散模型 :diffusion(title);分类 cs.CV、cs.GR

AI总结 提出首个统一的多模态运动生成框架Odoriko,通过扩散模型将主体生物形态信息融入运动合成,支持文本、音乐、视频输入,并在形态缺失时联合估计与生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14038 2026-08-17 cs.LG 新提交 75%

Adversarial Learning of Classifier-Free Guidance Schedules

无分类器引导调度的对抗学习

Ashwini Pokle, Alexandre Galashov, Arnaud Doucet, Mauricio Delbracio, Valentin De Bortoli

机构 * Google(谷歌公司) Google DeepMind(谷歌DeepMind) Gatsby UCL(盖茨比伦敦大学学院)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 本文提出一种对抗学习方法,将无分类器引导调度建模为密度比估计问题,训练判别器与轻量生成器,在文本到图像生成基准上优于启发式CFG调度及现有动态引导学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02487 2026-08-04 stat.ML cs.LG math.OC math.PR math.ST stat.TH 新提交 75%

Computational and Statistical Guarantees of the \textit{c}-Rectified flow

c-整流流的计算与统计保证

Leda Wang, Zhehao Xu, Qiang Liu, Harrison H. Zhou

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 该研究针对迭代整流流的计算与统计保证问题,提出c-整流流方法,证明其在合适假设下可收敛到最优传输耦合,并建立相关收敛保证与最优估计速率,为整流流提供理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19984 2026-07-03 cs.LG 新提交 75%

Kolmogorov-Arnold Reservoir Computing

Kolmogorov-Arnold 储层计算

Juntian Huang, Jürgen Kurths, Ying Tang

机构 * Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(电子科技大学基础与前沿科学研究所) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Department of Physics, Humboldt University Berlin(柏林洪堡大学物理系) Research Institute of Intelligent Complex Systems, Fudan University(复旦大学智能复杂系统研究所) School of Physics, University of Electronic Science and Technology of China(电子科技大学物理学院) Key Laboratory of Quantum Physics and Photonic Quantum Information, Ministry of Education, University of Electronic Science and Technology of China(电子科技大学教育部量子物理与光子量子信息重点实验室) Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China(电子科技大学四川省非经典信息科学基础学科研究中心)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 提出Kolmogorov-Arnold储层计算(KARC),用显式基函数展开替代储层,结合KAN的表达能力和储层计算的闭式训练,在偏微分方程等基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13205 2026-08-14 cs.CV 新提交 74%

HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Xuanlang Dai, Shengyuan Ding, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Dahua Lin, Xingang Pan

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(奥多比研究院) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(InnoHK下属CPII机构)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。

Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09452 2026-08-11 cs.CV cs.CR 新提交 74%

A Content-Aware Pure Permutation with Intrinsic Avalanche Effect: Breaking the Diffusion-Permutation Dichotomy

具有内在雪崩效应的内容感知纯置换:打破扩散-置换二分法

Zahra Ghoraeian, Mohammad-Reza Sadeghi, Samaneh Mashhadi

机构 * Amirkabir University of Technology (Tehran Polytechnic)(阿米尔卡比尔理工大学(德黑兰理工)) Iran University of Science and Technology(伊朗科技大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本文提出TCA算法,通过内容感知三角剖分实现纯像素置换,打破扩散-置换二分法,仅靠像素重定位即可产生差分敏感性,在50张图像实验中获NPCR=97.10%等优异安全性能。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08436 2026-08-11 cs.CV 新提交 74%

FreCast: Refining Radar Echo Intensity via Phase-Preserving Amplitude Residual Diffusion for Precipitation Nowcasting

FreCast:用于临近降水预报的保相振幅残差扩散雷达回波强度优化方法

Heping Fang, Zihuai Yin, Kaicheng Mao, Peiguang Zhang, Peng Yang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation(广东省类脑智能计算重点实验室)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 FreCast是一种两阶段雷达回波预测框架,以初始预报的空间结构为约束校正回波强度偏差,在三个数据集上提升了预报技能,更好保留雨带与强降水结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03057 2026-08-05 cs.CV 新提交 74%

TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

TASQ:用于扩散模型的时间自适应比特稀疏化量化

Seokho Han, Dongwei Wang, Jinhee Kim, Yiran Chen, Kang Eun Jeon, Huanrui Yang, Jong Hwan Ko

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 针对扩散模型静态量化的计算开销问题,提出TASQ方法,结合时间精度引擎,在保持质量的同时显著降低执行周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05392 2026-07-07 cs.CV 新提交 74%

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

SynCity 3000:引导式构建场景级3D扩散模型

Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 针对3D场景训练数据稀缺问题,该框架将图像转3D生成器改造为卷积算子,依托新合成数据引擎微调,可生成全局连贯、支持细粒度布局控制的任意规模3D场景。

Comments Project Page: https://research.paulengstler.com/syncity-3k/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31603 2026-07-01 cs.CV cs.AI cs.LG 新提交 74%

Preserve the Hard, Regenerate the Rest: Uncertainty-Guided Synthetic Training Data Augmentation with Diffusion Models

保留困难部分,重新生成其余部分:基于不确定性引导的扩散模型合成训练数据增强

Nikolai Röhrich, Julian Gleißner, Ahmed H. A. Ibrahim, Silvan Mertes, Tobias Huber

机构 * XITASO GmbH(XITASO 有限公司) Zuse School of Excellence in Reliable AI(Zuse 卓越可靠人工智能学院) Technische Hochschule Ingolstadt(因戈尔施塔特应用技术大学) Technische Hochschule Augsburg(奥格斯堡应用技术大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 针对语义分割中数据稀疏和区域多样性问题,提出不确定性引导的上下文增强策略,通过预测熵识别不确定区域并仅修复上下文,在保持标签有效性的同时最大化像素信息量,在Cityscapes等数据集上显著提升mIoU。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏