arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-21 至 2026-04-21 共收录 133 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 99 篇

2508.21658 2026-04-21 math.PR 50%

Infinite-dimensional stochastic differential equations for Coulomb random point fields

无限维随机微分方程用于库仑随机点场

Hirofumi Osada, Shota Osada

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究无限粒子系统与库仑随机点场相关的无限维随机微分方程,证明其强解存在性和路径唯一性,并揭示无限粒子动力学作为有限粒子系统的极限。

Comments 83 pages,This version includes corrections of typos and a new result on the convergence of $N$-particle systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13667 2026-04-21 astro-ph.HE astro-ph.IM 50%

PHECT: A lightweight computation tool for pulsar halo emission

PHECT:一种用于脉冲星晕发射的轻量计算工具

Kun Fang

专题命中 扩散模型 :diffusion(abstract)

AI总结 PHECT是一种轻量级工具,用于建模脉冲星晕发射,支持多种传输模型以更精确地模拟脉冲星晕的形成机制。

Comments 47 pages, 10 figures. Submitted to PRD; revised in response to the first round of referee comments

Journal ref Phys.Rev.D 113 (2026) 8, 083018

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12363 2026-04-21 cs.SD eess.AS 50%

DGSNA: Dynamic Generative Scene-based Noise Addition method

DGSNA:动态生成场景基噪声添加方法

Zihao Chen, Zhentao Lin, Bi Zeng, Linyi Huang, Jia Cai

机构 * School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) China Electronic Product Reliability and Environmental Testing Research Institute(中国电子元件可靠性及环境试验研究所) Key Laboratory of Ministry of Industry and Information Technology for Intelligent Products Testing and Reliability(工业和信息化部智能产品测试与可靠性重点实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出DGSNA方法,结合生成语言模型动态生成场景信息与基于场景的噪声添加,提升语音识别鲁棒性,实验显示提升11.32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04640 2026-04-21 math.AP math.PR 50%

The Nonlocal Stefan Problem via a Martingale Transport

通过martingale运输的非局部Stefan问题

Raymond Chu, Inwon Kim, Young-Heon Kim, Kyeongsik Nam

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究非局部Stefan问题,通过随机优化方法构建全局时间弱解,并给出概率解释。重点在于将焓和温度变量用粒子系统解释,建立抛物障碍问题与非局部扩散Stefan问题的联系,并在熔化问题中证明解与文献一致,获得新的指数收敛结果。

Comments This version has a new exponential convergence rate of the enthalpy in the melting case and has been revised based on comments from an anonymous referee

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16421 2026-04-21 math.PR math.AP stat.ML 50%

Wasserstein Mirror Gradient Flow as the limit of the Sinkhorn Algorithm

Wasserstein Mirror Gradient Flow 作为 Sinkhorn 算法极限

Nabarun Deb, Young-Heon Kim, Soumik Pal, Geoffrey Schiebinger

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究证明了Sinkhorn算法迭代得到的边际分布序列在正则化参数趋于零且迭代次数与1/ε成比例时收敛于2-Wasserstein空间的绝对连续曲线,提出了Wasserstein镜像梯度流概念,并推导了该流的指数收敛条件及对应的Mckean-Vlasov扩散。

Comments 49 pages, 2 figures, Accepted in the Annals of Probability

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16956 2026-04-21 math.PR 50%

Waves Everywhere: A Distributional Equation Approach to Front Propagation

处处皆波:分布方程方法在前沿传播中的应用

Matthieu Jonckheere, Seva Shneer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过分布方程方法研究粒子系统前沿传播速度及粒子分布,结合鞅极限理论与分支过程,分析反应扩散模型的极限行为及旅行波解。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16865 2026-04-21 stat.ML cs.LG math.PR 50%

Extraction of informative statistical features in the problem of forecasting time series generated by It{ô}-type processes

在Itô型过程生成的时间序列预测问题中提取信息性统计特征

Victor Korolev, Mikhail Ivanov, Tatiana Kukanova, Artyom Rukavitsa, Alexander Vakshin, Peter Solomonov, Alexander Zeifman

机构 * Lomonosov Moscow State University, Faculty of Computational Mathematics and Cybernetics(罗蒙诺索夫莫斯科国立大学,计算数学与 cybernetics 学院) Moscow Center for Fundamental and Applied Mathematics(莫斯科基础与应用数学中心) Federal Research Center ‘‘Computer Science and Control’’, Russian Academy of Sciences(俄罗斯科学院计算机科学与控制联邦研究中心) Moscow Center for Artificial Intelligence(莫斯科人工智能中心) Vologda State University(沃洛佳州大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了从Itô型过程生成的时间序列中提取最信息性的特征,通过统计调整的混合型模型参数进行预测,采用统计重建系数的方法,通过均匀和非均匀统计重建技术获得两种参数,提升预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16825 2026-04-21 physics.comp-ph 50%

Coarse-Grained Dynamics with Spatial Disorder and Non-Markovian Memory

具有空间无序和非马尔可夫记忆的粗粒化动力学

Chuyi Liu, Yifeng Guan, Jingyuan Li, Mao Su

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种数据驱动的方法,通过变分贝叶斯框架和随机场先验,分离静态空间无序与粘弹性摩擦,准确预测长时动力学和异常扩散行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16721 2026-04-21 cs.LG cs.AI math.DS 50%

Late Fusion Neural Operators for Extrapolation Across Parameter Space in Partial Differential Equations

跨参数空间的偏微分方程 extrapolation 的晚融合神经算子

Eva van Tegelen, Taniya Kapoor, George A. K. van Voorn, Peter van Heijster, Ioannis N. Athanasiadis

机构 * Artificial Intelligence Group, Wageningen University and Research(瓦赫宁根大学与研究人工智能组) Mathematical and Statistical Methods, Wageningen University and Research(瓦赫宁根大学与研究数学与统计方法)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出晚融合神经算子,通过分离状态动态与参数影响,提升预测性能,优于Fourier Neural Operator和CAPE-FNO,在四个基准PDE中表现最佳,RMSE减少达72.9%和71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16558 2026-04-21 cs.LG 50%

Cross-Modal Generation: From Commodity WiFi to High-Fidelity mmWave and RFID Sensing

跨模态生成:从商品WiFi到高保真毫米波和RFID传感

Zhixiong Yang, Long Jing, Yao Li, Shuli Cheng, Guoxuan Chi, Chenyu Wen

机构 * Xinjiang University(新疆大学) Northwest University(西北大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出RF-CMG方法,利用丰富的WiFi数据生成高保真毫米波和RFID数据,通过高频指导与低频约束解耦生成过程,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16431 2026-04-21 cs.LG cond-mat.dis-nn cs.AI nlin.AO 50%

Dimensional Criticality at Grokking Across MLPs and Transformers

在MLP和Transformer中Grokking的维度临界性

Ping Wang

机构 * Institute of High Energy Physics, Chinese Academy of Science(中国科学院高能物理研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过TDU-OFC方法揭示了Grokking过程中动态临界现象,发现不同任务在一般化临界点处呈现不同的维度跨越行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16416 2026-04-21 cs.IR 50%

Tensor Manifold-Based Graph-Vector Fusion for AI-Native Academic Literature Retrieval

基于张量流形的图-向量融合用于AI原生学术文献检索

Xing Wei, Yang Yu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于张量流形的图-向量融合框架,解决现有方法在矩阵依赖、存储爆炸、语义稀释和AI原生支持不足的问题,通过理论分析和复杂性证明,实现线性时间复杂度的高效动态学术文献检索。

Comments 36 pages, 10 tables, 0 figures; accepted for publication; extended version of graph-vector fusion framework for AI-native academic literature retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23224 2026-04-21 cs.RO 50%

AeroScene: Progressive Scene Synthesis for Aerial Robotics

AeroScene:用于空域机器人领域的渐进式场景合成

Nghia Vu, Tuong Do, Dzung Tran, Binh X. Nguyen, Hoan Nguyen, Erman Tjiputra, Quang D. Tran, Hai-Nguyen Nguyen, Anh Nguyen

机构 * University of Liverpool, UK(英国利物浦大学) AIOZ Ltd., Singapore(新加坡AIOZ有限公司) National Tsing Hua University, Taiwan(台湾国立清华大学) RMIT University, Vietnam Campus(越南RMIT大学校园) University of Information Technology, VNUHCM, Vietnam(越南VNUHCM大学信息科技学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出AeroScene,一种用于空域机器人领域的渐进式3D场景合成模型,通过分层扩散模型实现全局布局与局部细节的推理,生成物理合理且语义一致的场景,提升导航、着陆等任务性能。

Comments 8 pages. Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17455 2026-04-21 math.AP 50%

A unified relative entropy framework for macroscopic limits of Vlasov--Fokker--Planck equations

一个统一的相对熵框架用于Vlasov-Fokker-Planck方程的宏观极限

Young-Pil Choi, Jinwook Jung

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个统一的相对熵框架,用于研究具有Riesz型相互作用和Fokker-Planck松弛的动能方程的宏观极限,涵盖扩散极限、高场极限和强磁场极限三种典型奇异情形,通过熵耗散、Fisher信息控制和调制相互作用能量,获得强收敛和弱收敛结果。

Comments The structure of the article has been changed and we have improved the rate of convergences for diffusive and strong magnetic field limits

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06183 2026-04-21 math.AP 50%

Forward and inverse problems of a semilinear transport equation

半线性传输方程的正反问题

Kui Ren, Yimin Zhong

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究半线性辐射传输模型的正反问题,改进了边界数据理论,并统一了扩散和传输 regime 的L1稳定性理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16168 2026-04-21 physics.ao-ph 50%

FuXi-TC: A generative framework integrating deep learning and physics-based models for improved tropical cyclone forecasts

FuXi-TC:一种结合深度学习和物理模型的生成框架,用于改进热带气旋预测

Shan Guo, Lei Chen, Yangyang Zhao, Yuetan Lin, Zeyi Niu, Xinyan Zhang, Ziyao Sun, Xiaohui Zhong, Hao Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出FuXi-TC框架,结合深度学习与物理模型,提升热带气旋预测精度,尤其在降水预测方面表现优异,同时具有更高的计算效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06493 2026-04-21 math.PR 50%

Co-evolving vertex and edge dynamics in dense graphs

密集图中顶点和边动态的共演化

Siva Athreya, Frank den Hollander, Adrian Röllin

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究密集图中顶点和边动态的共演化,通过颜色切换速率和边开关速率的机制,分析极限过程的马尔可夫过程特性。

Comments 59 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01538 2026-04-21 math.PR 50%

Convergence to the uniform distribution of moderately self-interacting diffusions on compact Riemannian manifolds

在紧致黎曼流形上中等自相互作用扩散过程收敛于均匀分布

Simon Holbach, Olivier Raimond

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究中等自相互作用扩散过程在紧致黎曼流形上收敛于均匀分布的条件,证明了归一化占据测度几乎必然弱收敛于均匀分布,并给出了光滑测试函数的多项式收敛速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07626 2026-04-21 cs.CR 50%

Growing Random Strings in CA

在细胞自动机中生长随机字符串

M. Andrecut

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了一类能从短种子字符串生成长随机字符串的细胞自动机,利用扩散和混淆原理,并通过傅里叶变换、熵估计和压缩验证其伪随机性,还提供了密码学应用的Python代码。

Comments 9 pages, 4 figures, corrected several typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.12569 2026-04-21 cs.SI cs.CY 50%

Conductance and Influence-Capital: Modeling Online Social Influence

导电性与影响资本:在线社会影响建模

Rohit Ram, Marian-Andrei Rizoiu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种数据驱动的通用影响模型(GIM),结合导电性扩散网络和影响资本分配机制,改进了现有方法并纠正了跟随者计数指标的偏差,通过实证测试揭示了职业影响力与信息传播的关系。

Comments Published in EPJ Data Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 8 篇

2604.16680 2026-04-21 cs.CV 74%

C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion

C-GenReg:基于多视角一致的几何到图像生成的无训练3D点云配准

Yuval Haitman, Amit Efraim, Joseph M. Francos

机构 * Ben-Gurion University(本·古里安大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 C-GenReg通过多视角一致的几何到图像生成,结合概率模态融合,实现无训练的3D点云配准,解决了跨模态、采样差异和环境的泛化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18267 2026-04-21 cs.CV 57%

MARCO: Navigating the Unseen Space of Semantic Correspondence

MARCO:导航语义对应未知空间

Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth

机构 * Politecnico di Torino(都灵理工大学) TU Darmstadt(德累斯顿理工大学) ELIZA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MARCO通过新颖的训练框架提升语义对应泛化能力,在多个数据集上取得新突破,同时更高效且更小。

Comments CVPR 2026 Oral. Project page: https://visinf.github.io/MARCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01643 2026-04-21 cs.CV 57%

ViT$^3$: Unlocking Test-Time Training in Vision

ViT$^3$:解锁视觉中的测试时间训练

Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。

Comments CVPR 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17802 2026-04-21 eess.IV cs.CV 57%

Optimally Bridging Semantics and Data: Generative Semantic Communication via Schrödinger Bridge

最优地弥合语义与数据:通过施罗德桥的生成语义通信

Dahua Gao, Ruichao Liu, Minxi Yang, Shuai Ma, Youlong Wu, Guangming Shi

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Pazhou Lab(琶洲实验室) Peng Cheng Laboratory(鹏城实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于施罗德桥的生成语义通信框架,通过优化传输轨迹减少幻觉和计算成本,改进FID和SSIM并加速推理速度。

Comments 23 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17005 2026-04-21 cs.CV cs.SD 57%

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance: 基于对比对齐的文本控制音乐驱动舞蹈生成

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * University of Surrey, Guildford, Surrey, UK(萨里大学) Jiangnan University, Wuxi, Jiangsu, China(江南大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TeMuDance框架,通过统一嵌入空间对齐音乐、文本和运动数据,实现无需手动标注数据的文本控制音乐驱动舞蹈生成,提升语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16796 2026-04-21 cs.CV cs.IT eess.SP math.IT 57%

Generative Semantic Communication via Alternating Dual-Domain Posterior Sampling

通过交替双域后验采样实现生成语义通信

Shunpu Tang, Qianqian Yang

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过交替双域后验采样提升无线图像传输的感知质量,解决传统方法在数据分布保留和领域间冲突的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17986 2026-04-21 cs.SD cs.AI 50%

Latent Fourier Transform

潜在傅里叶变换

Mason Wang, Cheng-Zhi Anna Huang

机构 * CSAIL(计算机科学与人工智能实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出潜在傅里叶变换框架,通过频域控制生成音乐模型,分离音乐模式并保持时尺度特征,提升生成质量与可解释性。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01210 2026-04-21 physics.optics cond-mat.dis-nn physics.med-ph 50%

Harnessing coherent-wave control for sensing applications

利用相干波控制实现传感应用

Pablo Jara, Arthur Goetschy, Hui Cao, Alexey Yamilov

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出微观光学灵敏度理论,通过干涉效应提升光学灵敏度,展示相位共轭输入状态可实现最大灵敏度增强,而最大反射本征通道可全局增强灵敏度分布,为整合波前控制与扩散光学成像提供理论基础。

Comments 26 pages, 11 figures

Journal ref Phys. Rev. Appl. 24, 054027 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 5 篇

2604.08364 2026-04-21 cs.CV 79%

MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping

MegaStyle: 通过一致的文本到图像风格映射构建多样化和可扩展的风格数据集

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Yuanpeng Tu, Fei Shen, Weidong Zhang, Cairong Zhao, Jun Zhang

机构 * Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Fuzhou University(福州大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出MegaStyle数据集,通过现有大生成模型的一致文本到图像风格映射能力,构建了包含170k风格提示和400k内容提示的多样化数据集,并提出风格监督对比学习方法和FLUX风格迁移模型。

Comments project website https://jeoyal.github.io/MegaStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18537 2026-04-21 cs.CV 77%

MetaCloak-JPEG: JPEG-Robust Adversarial Perturbation for Preventing Unauthorized DreamBooth-Based Deepfake Generation

MetaCloak-JPEG:用于防止未经授权的基于DreamBooth的深度伪造生成的JPEG鲁棒对抗扰动

Tanjim Rahaman Fardin, S M Zunaid Alam, Mahadi Hasan Fahim, Md Faysal Mahfuz

机构 * Computer Science and Engineering(计算机科学与工程)

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对DreamBooth驱动的文本到图像合成,提出MetaCloak-JPEG,通过在JPEG压缩管道中引入可微JPEG层,提升对抗扰动效果,实现高PSNR和高JPEG生存率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏