arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-10 至 2026-04-10 共收录 105 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 79 篇

2604.08338 2026-04-10 cond-mat.stat-mech nlin.CD 78%

Controlling the rain fall statistics using Mean-Reverting Jump Diffusion model

利用均值回归跳跃扩散模型控制降雨统计

Joya GhoshDastider, D. Pal, Pankaj Kumar Mishra

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种随机均值回归跳跃扩散模型,用于模拟降雨时间序列并验证其有效性,展示了如何通过调整参数控制极端事件和干旱区域持续时间,同时验证了模型在时间尺度上的有效性。

Comments 19pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14096 2026-04-10 cs.LG 78%

TENDE: Transfer Entropy Neural Diffusion Estimation

TENDE:转移熵神经扩散估计

Simon Pedro Galeano Munoz, Mustapha Bounoua, Giulio Franzese, Pietro Michiardi, Maurizio Filippone

机构 * KAUST(沙特阿拉伯国王科技大学) EURECOM(法国EURECOM)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TENDE通过条件互信息估计转移熵,解决传统方法在维度灾难、分布假设和数据规模上的局限,实现灵活可扩展的估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08197 2026-04-10 eess.SP 78%

Discrete Diffusion for Codebook-Based Beam Candidate Generation

基于代码本的波束候选生成的离散扩散

Amirhossein Azarbahram, Onel L. A. López

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于离散扩散概率模型的波束候选生成方法,通过学习历史探测记录来生成高质量候选波束,提升在受限探测预算下的信号质量和波束误判概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08152 2026-04-10 math.FA 78%

Global mild solutions for a transport-diffusion equation with a rough drift

带有粗糙漂移项的传输-扩散方程的全局温和解

Diego Chamorro, Anca-Nicoleta Marcoci, Liviu-Gabriel Marcoci

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究在临界条件下,构造带有粗糙Calderón-Zygmund算子的传输-扩散方程的全局温和解,采用关键方法解决粗糙漂移项的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07612 2026-04-10 cs.SD cs.AI 78%

Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP

实时人机音乐合奏:基于潜在扩散模型和MAX/MSP的伴奏生成

Tornike Karchkhadze, Shlomo Dubnov

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出实时人机音乐合奏框架,利用潜在扩散模型生成伴奏,结合MAX/MSP实时音频处理与Python服务器,实现低延迟的伴奏生成与评估。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07397 2026-04-10 cs.LG cs.AI 78%

Data Warmup: Complexity-Aware Curricula for Efficient Diffusion Training

数据预热:面向高效扩散训练的复杂度感知课程学习

Jinhong Lin, Pan Wang, Zitong Zhan, Lin Zhang, Pedro Morgado

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University at Buffalo, SUNY(纽约州立大学布法罗分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Data Warmup方法,通过按复杂度从简到繁安排训练图像,提升扩散模型训练效率,实验表明其在ImageNet上显著提升生成质量并提前达到基线水平。

Comments CVPRW in the proceedings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14181 2026-04-10 cond-mat.mtrl-sci 78%

Faster grain-boundary diffusion with a higher activation enthalpy than bulk diffusion in ionic space-charge layers

在离子空间电荷层中,晶界扩散的活化焓高于体扩散

Timon F. Kielgas, Roger A. De Souza

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过连续模拟发现,在掺杂的钙钛矿氧化物中,晶界处离子扩散速率可通过两种机制实现,导致活化焓比体扩散高,从而实现r>1。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07755 2026-04-10 stat.ML cs.LG 78%

Physics-Informed Neural Networks for Joint Source and Parameter Estimation in Advection-Diffusion Equations

基于物理信息的神经网络用于对流-扩散方程中的源和参数联合估计

Brenda Anague, Bamdad Hosseini, Issa Karambal, Jean Medard Ngnotchouye

机构 * AIMS RIC Kigali(非洲数学科学研究所卢旺达创新中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于神经切线核的加权自适应方法,用于解决对流-扩散方程中源函数和参数的联合估计问题,通过将偏微分方程作为约束条件提高信息利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05020 2026-04-10 cond-mat.mtrl-sci 78%

Comparing fine-tuning strategies of MACE machine learning force field for modeling Li-ion diffusion in LiF for batteries

比较MACE机器学习力场的微调策略用于建模LiF中Li离子扩散

Nada Alghamdi, Paolo de Angelis, Pietro Asinari, Eliodoro Chiavazzo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究比较了预训练和微调MACE MLFF的预测能力,探讨不同微调策略对LiF中间隙锂扩散性预测的影响,发现MACE-MPA-0模型在大规模分子动力学模拟中预测关键扩散特性时与深度学习模型表现相当。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06546 2026-04-10 physics.bio-ph 78%

A multiscale theory for network advection-reaction-diffusion

网络输运-反应-扩散的多尺度理论

Hadrien Oliveri, Emilia Cozzolino, Alain Goriely

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种多尺度网络输运-反应-扩散理论,基于微观过程推导宏观输运算子,研究其与边长的标度关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19982 2026-04-10 cs.CL cs.AI 78%

Diffusion Language Models Know the Answer Before Decoding

扩散语言模型在解码前就知道答案

Pengxiang Li, Yefan Zhou, Dilxat Muhtar, Lu Yin, Shilin Yan, Li Shen, Soroush Vosoughi, Shiwei Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Dartmouth College(达特茅斯学院) University of Surrey(萨里大学) Sun Yat-sen University(中山大学) ELLIS Institute Tübingen(ELLIS 图宾根研究所) MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Prophet方法,通过早期解码收敛机制加速扩散语言模型推理,减少解码步骤并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03134 2026-04-10 stat.ML cs.LG 78%

A Probabilistic Formulation of Offset Noise in Diffusion Models

扩散模型中偏移噪声的概率建模

Takuro Kutsuna

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种新的扩散模型,通过概率框架自然引入额外噪声,解决极端亮度值生成问题,实验表明在高维场景中性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22486 2026-04-10 stat.ML cs.LG math.ST stat.TH 75%

Flow Matching is Adaptive to Manifold Structures

流匹配适应于流形结构

Shivam Kumar, Yixin Wang, Lizhen Lin

机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Department of Statistics, University of Michigan(密歇根大学统计系) Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI 74%

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07700 2026-04-10 cond-mat.dis-nn cond-mat.mes-hall 71%

Localization--non-ergodic transition in controllable-dimension fractal networks from diffusion-limited aggregation

在可控维度分形网络中扩散限制聚合的局部化-非均衡相变

Oleg I. Utesov, Alexei Andreanov, Tomasz Bednarek, Alexandra Siklitskaya, Sergei V. Koniakhin

专题命中 扩散模型 :diffusion(title)

AI总结 研究通过分析可控维度分形聚集体的谱性质,揭示了二维情况下所有本征态局域,而三维情况下随参数α增加出现局部化-非均衡相变,产生临界态。

Comments 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02514 2026-04-10 cs.CV cs.LG 70%

Privacy Attacks on Image AutoRegressive Models

图像自回归模型的隐私攻击

Antoni Kowalczuk, Jan Dubiński, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Warsaw University of Technology(华沙理工大学) NASK National Research Institute(NASK国家研究所)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究揭示图像自回归模型(IARs)在隐私安全方面的缺陷,开发新型成员推理攻击(MIA)发现IARs的隐私风险显著高于扩散模型(DMs),并展示IARs在数据泄露方面的更高脆弱性。

Comments Accepted at ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10348 2026-04-10 cs.LG cs.CR cs.CV 70%

Language Guided Adversarial Purification

语言引导的对抗净化

Himanshu Singh, A V Subramanyam

机构 * Indraprastha Institute of Information Technology, Delhi, India(印度德里因陀罗普拉斯塔信息技术学院)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出语言引导的对抗净化框架,利用预训练扩散模型和标签生成器提升对抗鲁棒性,无需专门训练即可优于现有方法。

Journal ref 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 7685-7689

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23727 2026-04-10 cs.SD cs.AI 67%

AudioMoG: Guiding Audio Generation with Mixture-of-Guidance

AudioMoG:通过混合指导引导音频生成

Junyou Wang, Zehua Chen, Binjie Yuan, Kaiwen Zheng, Chang Li, Yuxuan Jiang, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu AI(生数科技) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 本文提出AudioMoG,一种改进的采样方法,在无需大量训练资源的情况下提升文本到音频和视频到音频生成质量,同时在多样性保持和生成质量上优于单一指导方法。

Comments Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07795 2026-04-10 cs.CV cs.GR 62%

Image-Guided Geometric Stylization of 3D Meshes

基于图像的3D网格几何风格化

Changwoon Choi, Hyunsoo Lee, Clément Jambon, Yael Vinker, Young Min Kim

机构 * Seoul National University(首尔大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种几何风格化框架,通过变形3D网格表达图像风格,保留拓扑结构和部分语义,实验表明能生成具有独特几何特征的风格化3D模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08500 2026-04-10 cs.CV 57%

Novel View Synthesis as Video Completion

新颖视角合成作为视频补全

Qi Wu, Khiem Vuong, Minsik Jeon, Srinivasa Narasimhan, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出将稀疏新颖视角合成视为低帧率视频补全任务,通过改进架构实现视角不变性,证明视频模型能以最少监督生成竞争性稀疏视角合成结果。

Comments Project page: https://frame-crafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08088 2026-04-10 cs.CV 57%

Coordinate-Based Dual-Constrained Autoregressive Motion Generation

基于坐标双约束的自回归运动生成

Kang Ding, Hongsong Wang, Jie Gui, Liang Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院、教育部新一代人工智能技术及其跨学科应用重点实验室) Purple Mountain Laboratories(紫金山实验室) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education(教育部区块链应用监管工程研究中心(东南大学)) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统全国重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CDAMD框架,通过坐标输入和双约束因果掩码提升文本到运动的生成质量与语义一致性。

Comments Code is available at: https://github.com/fly-dk/CDAMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08063 2026-04-10 cs.CV 57%

EEG2Vision: A Multimodal EEG-Based Framework for 2D Visual Reconstruction in Cognitive Neuroscience

EEG2Vision:一种基于EEG的多模态框架,用于认知神经科学中的2D视觉重建

Emanuele Balloni, Emanuele Frontoni, Chiara Matti, Marina Paolanti, Roberto Pierdicca, Emiliano Santarnecchi

机构 * Università Politecnica delle Marche(马尔凯理工大学) University of Macerata(马切拉塔大学) Horizon Intelligence Labs(地平线智能实验室) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 EEG2Vision通过多模态大语言模型和图像扩散模型提升低密度电极配置下的视觉重建质量,验证了低分辨率EEG设备在实时脑-图像应用中的可行性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08047 2026-04-10 eess.IV cs.MM 57%

A H.265/HEVC Fine-Grained ROI Video Encryption Algorithm Based on Coding Unit and Prompt Segmentation

一种基于编码单元和提示分割的H.265/HEVC细粒度ROI视频加密算法

Xiang Zhang, Haoyan Lu, Ziqiang Li, Ziwen He, Zhenshan Tan, Fei Peng, Zhangjie Fu

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文提出基于编码单元和提示分割的细粒度ROI视频加密算法,通过改进的ROI映射方法和多语法元素选择加密方案,提升加密精度与安全性,适用于医疗、军事等敏感领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07428 2026-04-10 cs.LG cs.AI 56%

Regret-Aware Policy Optimization: Environment-Level Memory for Replay Suppression under Delayed Harm

考虑后悔的策略优化:环境层面的记忆用于回放抑制在延迟伤害下

Prakul Sunil Hiremath

机构 * Department of Computer Science and Engineering, VTU, Belagavi, India(印度贝尔高姆VTU计算机科学与工程系) Aliens on Earth (AoE) Autonomous Research Group, Belagavi, India(印度贝尔高姆地球外星人自主研究小组)

专题命中 扩散模型 :diffusion(abstract,comments)

AI总结 本文提出RAPO方法,通过环境层面的记忆机制抑制回放,减少有害区域的可达性,从而提升安全性和任务性能。

Comments 18 pages, 3 figures. Includes theoretical analysis and experiments on graph diffusion environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08373 2026-04-10 astro-ph.HE astro-ph.IM cond-mat.stat-mech gr-qc physics.data-an 50%

Stochastic problems in pulsar timing

脉冲星定时中的随机问题

Reginald Christian Bernardo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于随机微分方程研究脉冲星定时噪声和引力波背景信号,推导出分析解并探讨非平稳性起源。

Comments 26 pages + refs, 2 figures, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08307 2026-04-10 cs.ET 50%

Analytical Modeling of Dispersive Closed-loop MC Channels with Pulsatile Flow

分散型闭环分子通信通道的解析建模:具有脉动流

Theofilos Symeonidis, Fardad Vakilipoor, Robert Schober, Nunzio Tuccitto, Maximilian Schäfer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种考虑脉动流的分散型闭环分子通信通道的一维时间变模型,推导出具有时间变均值和方差的包裹正态分布的通道脉冲响应,并通过三维粒子模拟验证了模型的准确性。

Comments 8 pages, 5 figures, Submitted for 13th ACM International Conference on Nanoscale Computing and Communication (NANOCOM27), St. Johns, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08283 2026-04-10 math.AP cs.NA math.NA 50%

A convergence rate for the entropic JKO scheme

熵JKO方案的收敛速率

Aymeric Baradat, Sofiane Cherf

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究熵JKO方案与初始PDE解在α和τ趋近于零时的收敛速率,通过新界证明了额外的线性扩散项的影响。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15933 2026-04-10 quant-ph cond-mat.dis-nn cond-mat.str-el physics.atom-ph 50%

Robustness of Kardar-Parisi-Zhang-like transport in long-range interacting quantum spin chains

Kardar-Parisi-Zhang型输运的鲁棒性研究:长程相互作用量子自旋链

Sajant Anand, Jack Kemp, Julia Wei, Christopher David White, Michael P. Zaletel, Norman Y. Yao

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究长程相互作用量子自旋链中非积分模型的自旋与能量输运,发现KPZ型超扩散行为,揭示其与Inozemtsev模型的关联。

Comments 5 pages, 4 figures + 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02696 2026-04-10 cs.LG 50%

Deep Privacy Funnel Model: From a Discriminative to a Generative Approach with an Application to Face Recognition

深度隐私 funnel 模型:从判别到生成方法的转变及其在人脸识别中的应用

Behrooz Razeghi, Parsa Rahimi, Sébastien Marcel

机构 * Harvard University(哈佛大学) Idiap Research Institute(Idiap 研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Université de Lausanne(洛桑大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出深度隐私 funnel 模型,结合信息论隐私原则与表征学习,改进人脸识别中的隐私保护与效用平衡,同时引入生成隐私 funnel 模型和深度变分隐私 funnel 模型,降低敏感信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12848 2026-04-10 cs.IT cs.CR math.IT 50%

On the Direct Construction of MDS and Near-MDS Matrices

关于MDS和近MDS矩阵的直接构造

Kishan Chand Gupta, Sumit Kumar Pandey, Susanta Samanta

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过广义范德蒙德矩阵直接构造MDS和NMDS矩阵的方法,并证明了与NMDS码相关的 folklore 结果,解决了递归NMDS矩阵的直接构造问题。

Journal ref Advances in Mathematics of Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏