arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-28 至 2026-05-28 共收录 114 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2605.25763 2026-05-28 cs.CV 92%

AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis

AI-T2I: 面向文本到图像合成的扩散模型的聚合与隔离交叉注意力

Shipeng Cao, Biao Qian, Haipeng Liu, Yang Wang, Meng Wang

机构 * Institute of Advanced Medicine and Frontier Technology(先进医学与前沿技术研究院) Hefei University of Technology(合肥工业大学) Key Laboratory of Knowledge Engineering With Big Data, Ministry of Education(大数据知识工程重点实验室) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);personalized generation(abstract)

AI总结 针对扩散模型在文本到图像合成中交叉注意力图内文本-图像对齐不精确的问题,提出一种聚合与隔离交叉注意力方法(AI-T2I),通过聚合损失整合分散的令牌内激活并引入隔离损失分离令牌间激活,实现精确对齐。

Comments Accepted by IEEE Transactions on Multimedia (2026). 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28615 2026-05-28 cs.CV 92%

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

基于区域感知双模态直接偏好优化的组合式文本到图像生成

Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 文生图 :diffusion(summary_cn,abstract);image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出BiDPO框架,通过构建大规模偏好数据集BiComp和扩展Diffusion DPO联合优化图像与文本偏好,结合区域级引导方法,提升文本到图像模型对复杂组合提示的生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28137 2026-05-28 cs.CV cs.LG 79%

No Safe Dose: How Training Data Drives Unsafe Image Generation

无安全剂量:训练数据如何驱动不安全图像生成

Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

机构 * Black Forest Labs(黑森林实验室) TU Darmstadt & hessian.AI(图腾达姆施塔特大学 & heessian.AI) DFKI(德意志联邦鹰嘴豆研究所) Lab1141(Lab1141实验室)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 通过控制训练数据中不安全图像的比例(0%至9.6%),发现输出不安全率随比例单调上升,且比例而非绝对数量是关键因素,同时文本编码器(如SafeCLIP)可降低基线风险,但剂量效应持续存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27595 2026-05-28 cs.CV cs.AI 70%

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

多模态大语言模型在农业图像解释与生成任务中的幻觉行为

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

机构 * Texas A&M University System(德克萨斯大学系统)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 6 篇

2605.28067 2026-05-28 cs.AI 89%

BlazeEdit: Generalist Image Editing on Mobile Devices with Image-to-Image Diffusion Models

BlazeEdit: 基于图像到图像扩散模型的移动设备通用图像编辑

Fei Deng, Yanwu Xu, Zhipeng Bao, Zhixing Zhang, Haolin Jia, Karthik Raveendran, Jianing Wei

机构 * Google(谷歌)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);text-to-image(abstract)

AI总结 提出BlazeEdit,一个仅195M参数的轻量级通用图像编辑扩散模型,通过消除文本条件组件和多任务架构,在移动设备上实现快速、隐私保护的图像编辑。

Comments Accepted to CVPR 2026 EDGE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02417 2026-05-28 cs.CV 83%

DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing

DirectEdit: 基于流的图像编辑的逐步骤精确反演

Desong Yang, Mang Ye

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心,计算机科学学院,武汉大学,中国武汉)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出DirectEdit方法,通过直接对齐前向路径消除反演过程中的累积漂移,实现精确重建和可靠特征共享,无需额外神经函数评估,在多种场景下优于现有方法。

Comments ICML 2026. Project page: https://desongyang.github.io/Directedit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27924 2026-05-28 cs.CV 77%

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) Alibaba Group(阿里巴巴集团) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25491 2026-05-28 cs.CV cs.AI 74%

The Forensic Cost of Watermark Removal: From Dedicated Attacks to Image Editing

水印移除的法医成本:从专用攻击到图像编辑

Gautier Evennou, Ewa Kijak

机构 * IMATAG(IMATAG机构) IRISA, Univ. Rennes, INRIA, CNRS(IRISA大学、INRIA和CNRS)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 本文提出水印移除检测(WRD)作为新评估维度,通过训练分类器检测移除痕迹,在10^{-3}假阳性率下实现最优检测,证明法医隐蔽性是水印移除的必要条件。

Comments v1:The Forensic Cost of Watermark Removal, accepted at IH&MMSEC 2026, Special Session "Watermarking Across the Lifecycle of Generative Models". v2: extended version, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28450 2026-05-28 cs.CV cs.AI 57%

BiasEdit: A Training-Free Bias-Detect-and-Edit Framework for Learning Fair Visual Classifiers

BiasEdit: 一种无需训练的偏差检测与编辑框架,用于学习公平的视觉分类器

Jungwook Seo, Yoonsik Park, Changmin Lee, Sungyong Baik

机构 * Hanyang University Department of Artificial Intelligence BAIK Lab Seoul South Korea(翰阳大学人工智能系BAIK实验室首尔韩国) Hanyang University Department of Data Science BAIK Lab Seoul South Korea(翰阳大学数据科学系BAIK实验室首尔韩国) Hanyang University Department of Data Science Department of Artificial Intelligence BAIK Lab Seoul South Korea(翰阳大学数据科学系人工智能系BAIK实验室首尔韩国) Hanyang University(翰阳大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BiasEdit框架,通过统计依赖和互信息分析自动检测偏差属性,并利用文本引导的图像编辑生成无偏样本,无需手动标注即可实现公平分类。

Comments Accepted to The Web Conference 2026 (formerly WWW) as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22096 2026-05-28 cs.CV 57%

WeatherCity: Urban Scene Reconstruction with Controllable Multi-Weather Transformation

WeatherCity: 可控多天气变换的城市场景重建

Wenhua Wu, Huai Guan, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出WeatherCity框架,利用文本引导的图像编辑、天气高斯表示和物理驱动模型,实现高保真、时间一致的4D城市场景重建与多天气编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 80 篇

2605.27813 2026-05-28 cs.CV cs.AI cs.LG 89%

Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models

残差化时间稀疏自编码器用于解释扩散模型

Calvin Yeung, Prathyush Poduval, Ali Zakeri, Zhuowen Zou, Mohsen Imani

机构 * University of California, Irvine(加州大学 Irvine 分校)

专题命中 扩散模型 :diffusion(title,summary_cn);text-to-image(abstract);分类 cs.CV

AI总结 提出残差化时间稀疏自编码器,通过去噪时间步间的线性预测残差学习扩散激活轨迹中的可解释特征,并在Stable Diffusion 1.5上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04898 2026-05-28 cs.CR cs.AI 88%

Semantic-level Backdoor Attack against Text-to-Image Diffusion Models

针对文本到图像扩散模型的语义级后门攻击

Tianxin Chen, Wenbo Jiang, Hongqiao Chen, Zhirun Zheng, Cheng Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院,上海,中国) State Key Laboratory of Integrated Services Networks, Xidian University, Xian, China(集成服务网络国家重点实验室,西安电子科技大学,西安,中国) University of Electronic Science and Technology of China, Sichuan, China(电子科技大学,四川,中国) Ajou University, Gyeonggi-do, South Korea(庆尚道,韩国,全州大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 提出语义级后门攻击(SemBD),通过基于连续语义区域的表示级触发器替代离散文本模式,利用蒸馏编辑交叉注意力层的键和值投影矩阵植入后门,并引入语义正则化和多实体后门目标增强隐蔽性,实现100%攻击成功率并抵御输入级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28036 2026-05-28 cs.CV cs.LG 85%

Stay Fair! Ensuring Group Fairness in Diffusion Models Across Guidance Scales

保持公平!确保扩散模型在不同引导尺度下的群体公平性

Myeongsoo Kim, Eunji Kim, Minwoo Chae, Sangwoo Mo

机构 * POSTECH Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出StayFair方法,通过分解总偏差为模型偏差和引导偏差,并扩展强人口平价到引导过程,设计公平引导算法,使扩散模型在不同引导尺度下保持群体公平性。

Comments 28 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09675 2026-05-28 cs.CV 85%

Accelerating Diffusion Sampling via Exploiting Local Transition Coherence

利用局部转移一致性加速扩散采样

Shangwen Zhu, Han Zhang, Zhantao Yang, Qianyu Peng, Zhao Pu, Huangji Wang, Fan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种无需训练的加速方法LTC-Accel,通过利用相邻步骤间转移算子的统计关系来估计当前转移算子,从而加速文本到图像和视频的扩散采样,兼容多种网络结构和现有加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20497 2026-05-28 cs.CV cs.AI 83%

LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

LESA: 可学习的阶段感知预测器用于扩散模型加速

Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型计算开销大、现有缓存策略难以适应去噪过程阶段动态变化的问题,提出基于两阶段训练的可学习阶段感知预测器框架,利用KAN网络学习时序特征映射并采用多阶段多专家架构,在保持高质量生成的同时实现显著加速。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28394 2026-05-28 cs.CV cs.GR 81%

Sketch2Motion: Text-driven 2D Sketch to 3D Animation via Diffusion-guided Skeleton Optimization

Sketch2Motion: 文本驱动的二维草图到三维动画的扩散引导骨架优化

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, IIIT Delhi(IIIT德里图形研究组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出Sketch2Motion框架,结合扩散模型和骨架优化,将二维草图转化为三维动画,无需配对运动数据,支持多种角色类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04144 2026-05-28 cs.CV cs.GR 81%

Chirpy3D: Part-Aware Multi-View Diffusion for Creative Fine-Grained Object Generation

Chirpy3D: 面向创意细粒度物体生成的部件感知多视角扩散

Kam Woh Ng, Jing Yang, Jia Wei Sii, Chee Seng Chan, Jiankang Deng, Yi-Zhe Song, Tao Xiang, Xiatian Zhu

机构 * University of Surrey(萨里大学) University of Cambridge(剑桥大学) Universiti Malaya(马来亚大学) Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出Chirpy3D,一种部件感知多视角扩散框架,从无姿态2D图像中学习层次化部件潜在空间,实现部件级交换、插值和零样本组合,无需3D数据或手动标注。

Comments 20 pages. Code at https://github.com/kamwoh/chirpy3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21890 2026-05-28 cs.LG cs.AI cs.GR 80%

The Principles of Diffusion Models

扩散模型的原理

Chieh-Hsin Lai, Yang Song, Dongjun Kim, Yuki Mitsufuji, Stefano Ermon

机构 * MIT Press(MIT出版社) Sony AI(索尼人工智能) OpenAI(开放人工智能) Stanford University(斯坦福大学) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文从变分、基于分数和基于流三种视角统一阐述扩散模型的数学原理,并讨论可控生成、高效求解器和流映射模型等扩展。

Comments Supplementary materials for the book are available at the book website: https://the-principles-of-diffusion-models.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28456 2026-05-28 cs.AI cs.CV eess.AS 79%

Diffusion Large Language Models for Visual Speech Recognition

用于视觉语音识别的扩散大语言模型

Jeong Hun Yeo, Chae Won Kim, Hyeongseop Rha, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国加耶大学集成视觉语言实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个基于扩散大语言模型(DLLM)的视觉语音识别框架DLLM-VSR,通过迭代掩码去噪和灵活顺序解码,结合置信度引导的解掩码策略及两阶段训练,并引入长度引导候选解码以降低目标长度不确定性,在LRS3上取得19.5%的词错误率。

Comments Code: https://github.com/JeongHun0716/dllm-vsr

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27102 2026-05-28 cs.CV cs.LG 79%

JLT: Clean-Latent Prediction in Latent Diffusion Transformers

JLT: 潜在扩散Transformer中的干净潜在预测

Funing Fu, Tenghui Wang, Guanyu Zhou, Junyong Cen, Qichao Zhu

机构 * Independent Researcher(独立研究者) Wuhan University of Technology(武汉理工大学) Hangzhou Jiyi Artificial Intelligence Co., Ltd.(杭州智益人工智能有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出JLT,一种在冻结的FLUX.2 VAE编码上训练的130M潜在扩散Transformer,通过干净潜在预测相比速度预测在ImageNet 256×256上获得更优的FID分数,表明潜在扩散中的预测目标是依赖于表示的几何选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27990 2026-05-28 cs.LG cs.AI cs.CV 79%

Geometry-Correct Diffusion Posterior Sampling with Denoiser-Pullback Curvature Guidance and Manifold-Aligned Damping

几何校正扩散后验采样:基于去噪器回拉曲率引导与流形对齐阻尼

Seunghyeok Shin, Minwoo Kim, Dabin Kim, Hongki Lim

机构 * Department of Electrical and Computer Engineering, Inha University, Incheon, 22212, South Korea(电气与计算机工程系,Inha大学,Incheon,22212,韩国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于去噪器回拉曲率引导和流形对齐阻尼的几何校正扩散后验采样方法,通过每噪声水平的阻尼高斯-牛顿校正替代标量引导,实现稳定高效的后验采样。

Comments Code: https://github.com/Seunghyeok0715/CLAMP

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27736 2026-05-28 cs.LG cs.CV 79%

Explicit Critic Guidance for Aligning Diffusion Models

显式评论家引导的对齐扩散模型

Zhengyang Liang, Qihang Zhang, Ceyuan Yang

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种状态对齐的潜在演员-评论家框架,通过将扩散模型自身作为时间步条件价值函数,实现轨迹级PPO训练和推理时引导,在单/多奖励基准上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27495 2026-05-28 cs.CV cs.LG 79%

Representation-Conditioned Diffusion Models for Guided Training Data Generation

表示条件扩散模型用于引导训练数据生成

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen

机构 * Linköping University(利乌普斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出表示条件扩散模型,通过DINOv2、DINOv3和CLIP的表示条件生成合成图像,在ImageNet100上分类准确率比类条件生成高10.76个百分点,甚至超过真实数据训练的模型2.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27487 2026-05-28 cs.CV cs.AI 79%

Diffusion-Based Ukrainian Handwritten Text Generation with Cross-Domain Style Transfer

基于扩散的乌克兰手写文本生成与跨域风格迁移

Andrii Ahitoliev, Pavlo Berezin

机构 * Ukrainian Catholic University, Lviv, Ukraine(乌克兰天主教大学,利沃夫,乌克兰) National University of ``Kyiv-Mohyla Academy'', Kyiv, Ukraine(基輔-莫 Hil'a 学院国立大学,基輔,乌克兰)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对乌克兰语等非拉丁文字手写文本生成缺乏数据和模型泛化研究的问题,构建了乌克兰手写单词数据集并重新训练DiffusionPen模型,通过跨语言、零样本和少样本迁移实验验证了潜在扩散模型在跨域风格迁移中的有效性。

Comments 16 pages, 7 figures. Submitted to ICTERI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19729 2026-05-28 cs.CV cs.AI 79%

LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models

LIFT and PLACE: 一种简单、稳定且有效的轻量级扩散模型知识蒸馏框架

Hyunsoo Han, Sangyeop Yeo, Jaejun Yoo

机构 * Ulsan National Institute of Science and Technology (UNIST)(ulsan国家科学技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LIFT和PLACE框架,通过粗到细的蒸馏策略解决教师网络高复杂度带来的学生模仿困难,在极端压缩下仍能稳定训练并取得良好性能。

Comments Project page: https://hyun-s.github.io/LIFT_PLACE_site , 15 pages, 11 figure, 9 tables, To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15523 2026-05-28 cs.CV 79%

Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning

自提示扩散变压器用于开放词汇场景文本编辑的上下文学习

Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

机构 * MT Lab, Meitu Inc., Beijing, China School of Computer Science \& Technology, Beijing Institute of Technology, Beijing, China

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种自提示场景文本编辑方法,通过构建风格和字形提示,利用多模态扩散变压器的上下文学习能力,实现开放词汇和风格一致的文本编辑。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18647 2026-05-28 cs.LG cs.AI cs.CV cs.IT math.IT 79%

Noise Scheduling as Information-Guided Allocation in Diffusion Training

噪声调度作为扩散训练中的信息引导分配

Gabriel Raya, Bac Nguyen, Georgios Batzolis, Yuhta Takida, Dejan Stancevic, Naoki Murata, Chieh-Hsin Lai, Yuki Mitsufuji, Luca Ambrogioni

机构 * Tilburg University & JADS(蒂尔堡大学及JADS) Sony AI(索尼人工智能) University of Cambridge(剑桥大学) Radboud University(拉德堡德大学) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出InfoNoise,一种在线自适应噪声调度方法,通过估计条件熵率剖面动态调整训练噪声分布,以优化去噪任务中的信息增益,在图像、DNA和语言生成等任务中达到或超越基线,并节省高达3倍训练计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16872 2026-05-28 cs.CV 79%

DODO: Discrete OCR Diffusion Models

DODO: 离散OCR扩散模型

Sean Man, Gilad Deutch, Roy Ganz, Roi Ronen, Shahar Tsiper, Shai Mazor, Niv Nayman

机构 * Technion - Israel Institute of Technology, Haifa, Israel.(特拉维夫大学-以色列理工学院,海法,以色列。) Amazon Web Services(亚马逊网络服务)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对OCR任务中自回归解码速度慢的问题,提出首个利用块离散扩散的VLM模型DODO,在保持高精度的同时实现高达5倍的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28677 2026-05-28 math.PR math.AP 78%

Weak universality for stochastic reaction-diffusion models with long-range correlated noise

具有长程相关噪声的随机反应扩散模型的弱普适性

Simon Gabriel, Markus Tempelmayr

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究在弱非线性区域中由长程相关噪声驱动的随机反应扩散方程的大尺度行为,通过正则性结构理论证明其普适性由动态Φ^p模型描述,并建立随机估计和模型收敛性。

Comments 66 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28657 2026-05-28 cs.SD 78%

DEMON: Diffusion Engine for Musical Orchestrated Noise

DEMON: 音乐编排噪声的扩散引擎

Ryan Fosdick

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DEMON实时扩散引擎,通过异构去噪调度、共享可变状态、逐帧源混合和窗口化VAE解码四种机制,使去噪过程可作为现场乐器演奏,在单GPU上实现每秒12.3次60秒音乐解码。

Comments 15 pages, 3 figures, 15 tables. Project page with audio samples and demo video: https://daydreamlive.github.io/DEMON/

详情

展开后加载摘要…

URL PDF HTML 收藏