arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-01 至 2026-06-01 共收录 103 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2412.03876 2026-06-01 cs.CV 89%

Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization

通过推理时提示-噪声优化保障文本到图像生成

Jiangweizhi Peng, Zhiwei Tang, Gaowen Liu, Charles Fleming, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的推理时优化方法(PNO),通过联合优化连续提示嵌入和注入噪声轨迹,抑制不安全图像生成,达到最先进性能并抵抗对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31212 2026-06-01 cs.CV cs.AI cs.CL 83%

Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education

基准测试与增强文本到图像模型以生成早期算术教育中的视觉表示

Junling Wang, Boqi Chen, Heejin Do, Mubashara Akhtar, April Yi Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) ETH AI Center(ETH人工智能中心)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对早期算术教育中的方程到视觉生成任务,构建了E2V-Bench基准并评估了现有T2I模型,发现其在计数和关系结构上存在严重错误,进而探索了基准引导的增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-06-01 cs.CR 78%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29198 2026-06-01 cs.CV 70%

Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

引导对比令牌信用分配用于离散策略优化

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yuta Kyuragi, Aditya Grover

机构 * UCLA Panasonic AI Research(松下人工智能研究) NVIDIA(英伟达)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对组优势强化学习方法中令牌级信用分配缺失的问题,提出引导对比策略优化(GCPO),通过正负提示下的对比预测分配令牌级优势,在文本到图像生成和思维链推理任务上优于GRPO和DAPO。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31302 2026-06-01 eess.IV cs.CV eess.SP 57%

MoE-dqINR: A Unified Mixture-of-Experts Implicit Neural Representation Framework for Scan-Specific Dynamic and Quantitative MRI Reconstruction

MoE-dqINR:用于特定扫描动态和定量MRI重建的统一混合专家隐式神经表示框架

Yinzhe Wu, Fanwen Wang, Zhenxuan Zhang, Zi Wang, Chengyan Wang, Guang Yang

机构 * Department of Bioengineering and I-X, Imperial College London(生物工程系和I-X,帝国理工学院伦敦分校) Cardiovascular Research Centre, Royal Brompton Hospital(心脏血管研究中心,皇家布隆特医院) National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,伦敦国王学院) Shanghai Pudong Hospital and Human Phenome Institute, Fudan University(上海浦东医院和人类表型研究所,复旦大学) International Human Phenome Institute (Shanghai), Shanghai, China(国际人类表型研究所(上海),上海,中国)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MoE-dqINR框架,通过共享空间专家和状态条件路由路径,实现高效、统一的特定扫描多线圈动态和定量MRI重建,优化时间约30秒。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2605.31145 2026-06-01 cs.CV cs.AI cs.LG 57%

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization

FOCUS: 通过视觉支持约束和策略优化强制上下文目标定位

Mohammed Asad Karim, Vinay Kumar Verma

机构 * Amazon, Seattle, USA(亚马逊(美国西雅图))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出一种两阶段训练框架,通过优化支持框与查询图像间的上下文注意力并结合GRPO强化学习,实现无类别监督的类别无关上下文目标定位,7B模型性能超越72B模型。

Comments Accepted at ICML 2026. * Equal Contributions

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 82 篇

2605.22050 2026-06-01 cs.CV 87%

Broken Memories: Detecting and Mitigating Memorization in Diffusion Models with Degraded Generations

破碎的记忆:通过退化生成检测和缓解扩散模型中的记忆化

Yuanmin Huang, Mi Zhang, Chen Chen, Feifei Li, Geng Hong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(东华大学)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文首次发现扩散模型中的记忆化会导致内部数值不稳定性并表现为视觉“破碎”伪影,基于此提出了一种基于潜变量更新范数的经验稳定区域来量化稳定行为,并设计了一个即时的逐步骤检测与自适应缓解框架,在不改变提示或引导的情况下抑制记忆化,在Stable Diffusion 1.4上实现了AUC>0.999的检测性能和0.0%的记忆化率。

Comments KDD 2026, extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30987 2026-06-01 cs.CV 83%

Benchmarking Single-Step Inpainting Methods for Multi-Object 3D Gaussian Splatting Scenes

多对象3D高斯泼溅场景的单步修复方法基准测试

Finn Dröge, Cecilia Curreli, Abhishek Saroha, Daniel Cremers

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 扩散模型 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对3D高斯泼溅场景中的对象移除与修复任务,比较了2D修复器在3D一致性上的表现,发现基于重建的修复器优于生成扩散模型,且从头初始化场景比微调现有场景效果更好,同时引入了一个带真实数据的新多对象场景。

Comments Accepted as an extended abstract to the CVEU Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01581 2026-06-01 cs.RO 82%

Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control

Hyper-DP3: 面向视觉运动控制的3D扩散策略的频率感知规模调整

Jinhao Zhang, Zhexuan Zhou, Huizhe Li, Yichen Lai, Wenlong Xia, Haoming Song, Youmin Gong, Jie Mei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对机器人操作中扩散策略的高计算成本问题,从频域角度分析动作轨迹的平滑性,提出轻量级3D扩散策略Hyper-DP3,使用扩散混合器解码器和两步DDIM推理,以极低参数和延迟实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31596 2026-06-01 cs.CV cs.LG 79%

KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems

KLIP:通过逆问题中扩散先验的KL散度进行局部分布偏移检测

Alireza Kheirandish, Jihoon Hong, Sara Fridovich-Keil

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于KL散度的OOD检测指标,无需校准数据或偏移分布知识,可检测并定位图像中的局部分布偏移。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31590 2026-06-01 cs.CV cs.AI 79%

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation

TunerDiT: 无需训练的多事件视频生成扩散变压器渐进式引导

Ruotong Liao, Guowen Huang, Qing Cheng, Guangyao Zhai, Lei Zhang, Xun Xiao, Thomas Seidl, Daniel Cremers, Volker Tresp

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) MCML University of Hamburg(汉堡大学) Huawei European Research Institute(华为欧洲研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对长视频多事件生成难题,提出无需额外训练的TunerDiT方法,通过事件分区掩码和跨事件提示融合实现渐进式引导,在8项指标上达到最优。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31115 2026-06-01 cs.CV 79%

Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

Polyphony: 基于扩散的双手动作分割,采用交替视觉Transformer和语义条件

Hao Zheng, Hu Wang, Tiantian Zheng, Prajjwal Bhattarai, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Polyphony三阶段方法,通过交替训练双手视觉Transformer、语义特征条件化和扩散分割,解决双手动作分割中的手间依赖、视觉不对称和语义模糊问题,在多个数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31057 2026-06-01 cs.CV cs.LG 79%

LVSA: Training-Free Sparse Attention for Long Video Diffusion

LVSA:长视频扩散的无训练稀疏注意力

Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu

机构 * Distributed Parallel Technology Laboratory, Paris Research Center, Huawei Technologies France(华为法国巴黎研究中心分布式并行技术实验室) AI Framework and Data Technology Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人工智能框架与数据技术实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需训练、模型无关的块稀疏注意力方法LVSA,通过结构化窗口模式与旋转全局锚点结合,在降低长视频扩散推理计算成本的同时消除固定网格偏差,支持超训练时域的视频生成。

Comments 10 pages, 5 figures, 4 tables. Code: https://github.com/JiusiServe/LongVideoSparseAttention

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30940 2026-06-01 eess.AS cs.MM cs.SD 79%

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

面向流式同步空间音频生成的自回归扩散Transformer

Ke Lei, Yu Zhang, Changhao Pan, Xueyi Pu, Wenxiang Guo, Ruiqi Li, Zhou Zhao

机构 * Zhejiang University, China(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出SwanSphere统一流式框架,通过因果自回归扩散Transformer、空间视频-音频对比学习及多目标在线直接偏好优化,实现从全景视频和文本提示生成高保真空间音频,并开发自动化标注管道缓解数据稀缺。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30631 2026-06-01 cs.CV cs.AI cs.LG 79%

Controllable Lung Nodule Synthesis via Histogram-Regularized Latent Diffusion Models

基于直方图正则化潜扩散模型的可控肺结节合成

Arunkumar Kannan, Yanbo Zhang, Han Liu, Michael Baumgartner, Jianing Wang, Alexander Hertel, Bogdan Georgescu, Sasa Grbic

机构 * Johns Hopkins University(约翰霍普金斯大学) Department of Radiology and Nuclear Medicine, University Medical Center Mannheim, Heidelberg University(放射学与核医学科,曼海姆大学医学中心,海德堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种直方图正则化潜扩散模型,通过结合亚型、空间掩码和HU直方图条件以及可微特征空间直方图正则化项,在3D CT体积中合成肺结节,以准确建模结节特异性强度分布,提高视觉真实感和亚型一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30431 2026-06-01 cs.CV 79%

DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

DTG-Restore: 无需训练的视频超分辨率扩散精炼

Hidir Yesiltepe, Koutilya PNVR, Gaurav Pathak, Navaneeth Bodla, Bharat Singh, Pinar Yanardag, Jinrong Xie

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出解耦时间引导(DTG)方法,通过时间解耦条件与无条件分支,无需训练即可增强扭曲低分辨率视频,提升结构保真度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30409 2026-06-01 cs.CV cs.AI 79%

SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer

SANA-Streaming: 基于混合扩散Transformer的实时流式视频编辑

Yuyang Zhao, Yicheng Pan, Qiyuan He, Jincheng Yu, Junsong Chen, Tian Ye, Haozhe Liu, Enze Xie, Song Han

机构 * NVIDIA MIT(麻省理工学院) THU(清华大学) NUS(新加坡国立大学) HKU(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出系统-算法协同设计的SANA-Streaming框架,通过混合扩散Transformer架构、循环反向正则化训练策略和高效系统协同设计,在消费级GPU上实现高分辨率实时流式视频编辑,达到1280×704分辨率24 FPS的端到端性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21379 2026-06-01 cs.CV cs.AI 79%

SAEmnesia: Erasing Concepts in Diffusion Models with Supervised Sparse Autoencoders

SAEmnesia:基于监督稀疏自编码器的扩散模型概念擦除

Enrico Cassano, Riccardo Renzulli, Marco Nurisso, Mirko Zaffaroni, Alan Perotti, Marco Grangetto

机构 * University of Turin, Italy(意大利都灵大学) Intesa Sanpaolo AI Research, Italy(意大利Intesa Sanpaolo人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出监督稀疏自编码器框架SAEmnesia,通过强制一对一概念-神经元映射实现特征集中化,从而高效、精准地擦除扩散模型中的概念。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06161 2026-06-01 cs.CV 79%

Sinkhorn Normalization of Diffusion Kernels

扩散核的Sinkhorn归一化

Nathan Kessler, Robin Magnet, Jean Feydy

机构 * ENS Paris-Saclay(巴黎-萨克雷大学) Inria, Université Paris Cité, Inserm, HeKA(法国国家科学研究中心、巴黎-城市大学、法国国家医学研究院、HeKA)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于Sinkhorn算法的对称变体,将通用相似性矩阵归一化为类似扩散算子,继承拉普拉斯算子的理想性质,用于不规则数据(如点云、稀疏体素网格、高斯混合)的平滑处理,并保留谱信息用于形状分析与匹配。

Comments 33 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30553 2026-06-01 cs.LG cs.IT math.IT 79%

Destruction is a General Strategy to Learn Generation; Diffusion's Strength is to Take it Seriously; Exploration is the Future

破坏是学习生成的一般策略;扩散的优势在于认真对待它;探索是未来

Pierre-André Noël

机构 * ServiceNow AI Research(ServiceNow AI研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出扩散模型作为信息隐藏与猜测框架的一部分,论证其破坏式信息隐藏比手工设计更灵活,尤其在数据稀缺场景有优势,并探讨强化学习技术移植到扩散上下文时的微妙问题及原生探索方向。

Comments Published April 27th, 2026 as an ICLR blogpost https://iclr-blogposts.github.io/2026/blog/2026/destruction/

Journal ref Noël, Piere-André. "Destruction is a General Strategy to Learn Generation; Diffusion's Strength is to Take it Seriously; Exploration is the Future", ICLR Blogposts, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31564 2026-06-01 cs.CL cs.AI 78%

What Gets Unmasked First? Trajectory Analysis of Diffusion Models for Graph-to-Text Generation

什么先被揭开?面向图到文本生成的扩散模型轨迹分析

Qing Wang, Jacob Devasier, Chengkai Li

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文首次系统研究掩码扩散语言模型在图到文本生成中的解码轨迹,发现其优先生成实体,并针对监督微调导致的输出长度固定问题提出无训练推理时修改方法λ缩放结构解码,恢复+9.4 BLEU-4,同时引入Graph-LLaDA模型以显式融入关系图结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31106 2026-06-01 cs.LG 78%

Riemannian Diffusion Models on General Manifolds via Physics-Informed Neural Networks

基于物理信息神经网络的通用流形上的黎曼扩散模型

Gyeonghoon Ko, Juho Lee

机构 * Korea Advanced Institute of Science and Technology, Korea(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对黎曼流形上热核难以解析计算的问题,提出用物理信息神经网络求解流形热方程来近似热核,从而实现扩散模型的训练与采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30965 2026-06-01 eess.AS cs.AI cs.CL 78%

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

ImmersiveTTS:基于多模态扩散Transformer和领域特定表示对齐的环境感知文本转语音

Jun-Hak Yun, Seung-Bin Kim, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出ImmersiveTTS模型,通过多模态扩散Transformer和领域特定表示对齐,实现与环境音频自然融合的文本到语音生成。

Comments Accepted to ACL 2026 main conference. Code is available at https://github.com/jjunak-yun/ImmersiveTTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30825 2026-06-01 cs.LG cs.AI math.OC stat.ML 78%

Unlearning in Diffusion Models: A Unified Framework with KL Divergence and Likelihood Constraints

扩散模型中的遗忘学习:基于KL散度和似然约束的统一框架

Shervin Khalafi, Alejandro Ribeiro, Dongsheng Ding

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Tennessee, Knoxville(田纳西大学,基洛纳)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一个约束优化框架,通过最小化与预训练模型的偏差并施加与遗忘分布的分离约束,实现扩散模型中的概念和数据遗忘,并基于KL散度和似然约束推导最优解及原始-对偶算法。

Comments 27 pages, 6 figures, 4 tables; Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30776 2026-06-01 cs.LG 78%

Efficient and Uncertainty-Aware Diffusion Framework for Offline-to-Online Reinforcement Learning

高效且不确定性感知的离线到在线强化学习扩散框架

Ha Manh Bui, Metod Jazbec, Eric Nalisnick, Anqi Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, MD, U.S.A.(约翰霍普金斯大学计算机科学系) AMLab, University of Amsterdam, Amsterdam, Netherlands(阿姆斯特丹大学AM实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DUAL框架,利用扩散模型先验知识蒸馏快速采样扩散策略和转移模型,并通过拉普拉斯近似和距离转移状态偏移检测进行不确定性量化,以改进在线阶段的探索与利用平衡。

Comments International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30753 2026-06-01 cs.CL 78%

Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation

通过时空并行解码和置信度外推的高效扩散大语言模型

Zekai Li, Ji Liu, Yiqing Huang, Ziqiong Liu, Dong Li, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出时空并行解码(TSPD)和置信度外推(CE)两种方法,通过动态控制去噪轨迹减少冗余迭代,加速扩散大语言模型推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30642 2026-06-01 cs.LG 78%

Diffusion Models Preferentially Memorize Prototypical Examples or: Why Does My Diffusion Model Love Slop?

扩散模型优先记忆原型样本,或:为什么我的扩散模型喜欢“潦草”?

Marta Aparicio Rodriguez, Anastasia Borovykh, Grigorios A. Pavliotis, Daniel J. Korchinski

机构 * Department of Mathematics, Imperial College London, UK ML Lab, Capital Fund Management, France Department of Physics, \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL), Switzerland

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过随机层次模型生成的字符串训练扩散模型,发现模型优先记忆常见子串组成的样本,即使数据完全去重,表明点级去重无法保证隐私,而数据集多样性(尤其是高层抽象)能延缓记忆,并识别出部分记忆的中间状态导致生成均值回归的“潦草”现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30614 2026-06-01 cs.CR cs.SD 78%

Audio Pirates: Black-box Audio Watermark Removal via Diffusion Priors

Audio Pirates: 基于扩散先验的黑盒音频水印移除

Lingfeng Yao, Xincong Zhong, Chenpei Huang, Xuandong Zhao, Hanqing Guo, Aohan Li, Jiang Liu, Tomoaki Ohtsuki, Miao Pan

机构 * University of Houston(德克萨斯大学休斯敦分校) Waseda University(早稻田大学) University of Hawaii at Mānoa(夏威夷大学马诺阿分校) Keio University(庆应大学) The University of Electro-Communications(电通通信大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出黑盒水印移除攻击DiffErase,通过将水印音频扰动到中间扩散噪声水平并利用预训练去噪模型再生,有效去除水印同时保持感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22967 2026-06-01 cs.LG 78%

Learned Relay Representations for Forward-Thinking Discrete Diffusion Models

学习的中继表示用于前向思考的离散扩散模型

Benjamin Rozonoyer, Jacopo Minniti, Dhruvesh Patel, Neil Band, Avishek Joey Bose, Tim G. J. Rudner, Andrew McCallum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国学院) Mila Vijil

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。

Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: https://github.com/jacopo-minniti/relay

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07061 2026-06-01 astro-ph.HE 78%

Anisotropic Diffusion in Pulsar Halos: Interpreting the asymmetric morphology of Geminga and Monogem halos measured by HAWC

脉冲星晕中的各向异性扩散:解释HAWC测量的Geminga和Monogem晕的不对称形态

Si-Zhe Wu, Chao-Ming Li, Ruo-Yu Liu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 利用各向异性扩散模型,通过HAWC观测的Geminga和Monogem脉冲星晕的不对称形态,约束星际磁湍流性质,发现两个晕的平均磁场方向不同但阿尔芬马赫数相近(~0.2),并推断局部磁场相干长度约100 pc。

Comments 11 pages, 8 figures, 2 table

Journal ref ApJ 1003 (2026) 149

详情

展开后加载摘要…

URL PDF HTML 收藏