arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-10 至 2026-08-10 共收录 32 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1 篇

2511.01295 2026-08-10 cs.CV 版本更新 79%

UniREditBench: A Unified Reasoning-based Image Editing Benchmark

UniREditBench: 一个基于推理的图像编辑统一基准

Feng Han, Yibin Wang, Chenglin Li, Zheming Liang, Dianyi Wang, Yang Jiao, Zhipeng Wei, Chao Gong, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 UniREditBench通过多模态双参考评估和大规模合成数据集,提升图像编辑模型在复杂推理场景中的评估可靠性与性能表现。

Comments Project page: https://maplebb.github.io/UniREditBench

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 25 篇

2606.24817 2026-08-10 cs.CV eess.IV 版本更新 89%

High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology

高保真合成透射电子显微镜图像生成:基于扩散概率模型的数据受限半导体计量

Johannes Boehm, Bappaditya Dey

机构 * Chemnitz University of Technology, Chemnitz, Germany(化学工业大学,化学矿泉,德国) Interuniversity Microelectronics Centre (imec), Leuven, Belgium(大学微电子中心(imec),卢汶,比利时)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 针对半导体计量中TEM数据稀缺问题,提出基于去噪扩散概率模型(DDPM)的合成图像生成框架,采用渐进式补丁训练策略,仅需15个样本即可从零训练,并集成数据增强、域迁移、分类器引导和修复技术,生成图像在结构相似性上达到MS-SSIM>0.98,支持缺陷检测、分割等下游任务。

Comments To be presented at the 2026 International Symposium ELMAR, published by IEEE in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07039 2026-08-10 quant-ph cs.LG 版本更新 82%

Quantum Generative Diffusion Model: A Fully Quantum-Mechanical Model for Generating Quantum State Ensemble

量子生成扩散模型:一种用于生成量子态系综的全量子力学模型

Chuangtao Chen, Qinglin Zhao, MengChu Zhou, Zhimin He, Zhili Sun, Haozhen Situ

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出全量子力学模型QGDM,基于量子信道理论构建正向与反向过程,在多种量子态生成任务中性能优于现有模型,为量子生成建模提供了新框架。

Comments 31 pages, 15 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. The supplementary material is included at the end of the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16048 2026-08-10 cs.CV 版本更新 79%

CloudDiffusion: Diffusion-Based Scene Completion in the Point Cloud Domain

PointDiffusion: 点云领域的基于扩散的场景补全

Chidera Agbasiere, Mikhail Sannikov, Faith Ogunwoye, Erik Shaikhiev, Alex Kozinov, Ilya Mikhalchuk, Iana Zhura, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院智能空间机器人实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出多令牌高斯VAE和锚点ICP地面真值精化,实现单步扩散场景补全,在SemanticKITTI上平方倒角距离降低16倍,推理延迟降低25-143倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新 79%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07419 2026-08-10 cs.CV 版本更新 79%

DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation

DisPOSE: 投影多随机扩散用于自监督多视图3D人体姿态估计

Tony Danjun Wang, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Imperial College London(伦敦帝国学院) Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DisPOSE框架,将多视图人员分配问题建模为多随机张量空间上的生成扩散过程,通过可微Sinkhorn投影和超图卷积解码器实现自监督3D人体姿态估计,在标准数据集和手术室遮挡场景中表现优异。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10340 2026-08-10 cs.CV 版本更新 79%

Learning Ordinal Degradation Representations with Textual Priors for Diffusion-Based Blind Image Super-Resolution

通过插件分层退化表示实现稳定扩散的零样本适应

Yi-Cheng Liao, Shyang-En Weng, Yu-Syuan Xu, Chia-Hung Yuan, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) MediaTek Inc.(联发科公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HD-CLIP通过分层退化表示提升扩散模型在现实世界超分辨率中的零样本适应能力,增强细节保真度和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20882 2026-08-10 math.PR math.AP 版本更新 78%

An Eyring--Kramers Law for the Hypoelliptic Third-Order Langevin Diffusion

关于亚椭圆三阶朗之万扩散的艾林 - 克莱默斯定律

Yingli Wang, Lingjiong Zhu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究亚椭圆三阶朗之万扩散在低温极限下亚稳态跃迁的艾林 - 克莱默斯定律,通过扩展策略并结合多种方法确定平均跃迁时间的相关尺度和因子,数值实验验证了阿累尼乌斯标度及因子比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18856 2026-08-10 cs.CL cs.LG 版本更新 78%

Diffusion-MF: Approximate Structured Diffusion for Sequence Labelling

近似结构化扩散用于序列标注

Nicolas Floquet, Joseph Le Roux, Nadi Tomeh

机构 * Université Sorbonne Paris Nord, CNRS, Laboratoire d’Informatique de Paris Nord, LIPN(巴黎北大学 Sorbonne、法国国家科学研究中心、巴黎北信息学实验室、LIPN)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种基于扩散的条件随机场(CRF)训练方法,通过引入标签噪声条件来捕捉长距离依赖,结合近似推理在词性标注任务上实现16.5%的错误率降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13798 2026-08-10 math.PR math-ph math.CO math.MP 版本更新 78%

Iterated Graph Systems (I): random walks and diffusion limits

迭代图系统(I):随机游走与扩散极限

Ziyu Neroli

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了由边迭代图系统生成的广义分形图上的随机游走与扩散极限,证明了缩放后的简单随机游走在Gromov-Hausdorff-Prokhorov-Skorokhod拓扑下收敛于极限扩散,当电阻维度为正时与布朗运动一致,同时解决了Hambly和Kumagai提出的DHL渗流簇问题。

Comments 50 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08390 2026-08-10 cs.LG 版本更新 78%

Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement

通过轨迹细化提升扩散语言模型的推理时间扩展

Meihua Dang, Jiaqi Han, Minkai Xu, Kai Xu, Akash Srivastava, Stefano Ermon

机构 * Stanford University(斯坦福大学) Red Hat AI Innovation(红帽人工智能创新)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出PG-DLM,通过轨迹级细化提升扩散语言模型的推理效率,引入新的缩放轴并实现自适应计算分配,实验显示在奖励引导生成任务中表现更优。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14978 2026-08-10 math.ST cs.NA math.AP math.NA math.PR stat.TH 版本更新 78%

Inferring diffusivity from killed diffusion

从 killed 扩散推断扩散率

Richard Nickl, Fanny Seizilles

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过 killed 扩散过程的 killed 位置直方图推断无限维扩散参数,证明其遵循泊松点过程并转化为非线性逆问题,采用贝叶斯方法求解。

Comments 33 pages. Fixed minor typos and proof of Lemma 5.3(a). Identical to the version to appear in the Annals of Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18425 2026-08-10 math.NA cs.NA 版本更新 78%

Stochstic Sampling for Generative Diffusion Models: From Euler-Maruyama to Higher-Order Schemes

分析生成扩散模型的误差:从欧拉-马尔耶姆到高阶方案

Emanuel Pfarr, Radu Timofte, Frank Werner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究生成扩散模型中不同离散化方案对误差的影响,提出基于SDE的离散化方法的收敛性分析,并首次给出高阶方案的误差界结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22778 2026-08-10 math.PR cs.LG stat.ML 版本更新 78%

Free Denoising Diffusion Models

自由去噪扩散模型

Swagatam Das

机构 * Electronics and Communication Sciences Division, Indian Statistical Institute, Kolkata 700108, India(印度统计研究所电子与通信科学系,加尔各答700108,印度)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出用于去噪扩散的自由概率框架,恢复相关不等式等理论结果,推导反向时间方程与得分匹配算法,分析算子值波动率情况并给出谱间隙阈值及数值实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18804 2026-08-10 stat.ML cs.LG math.ST stat.TH 版本更新 78%

Convergence of Diffusion Models Under the Manifold Hypothesis in High-Dimensions

高维流形假设下扩散模型的收敛性

Iskander Azangulov, George Deligiannidis, Judith Rousseau

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究在流形假设下证明 DDPM 的分数学习和采样复杂度均实现与高维 ambient 空间维度无关的速率,通过建立扩散模型与高斯过程极值理论的新框架完成,解释了其经验成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18522 2026-08-10 cond-mat.stat-mech 版本更新 71%

Quasiparticle dynamics and diffusive scale hydrodynamics in an inhomogeneous gas of hard rods

一维硬杆气体中准粒子动力学与水动力学

Anupam Kundu

专题命中 扩散模型 :diffusion(title)

AI总结 研究一维硬杆气体中准粒子的随机动力学,分析其均值、方差和自相关函数在长程相关和无长程相关初始态下的演化,推导相空间密度相关性的解析结果,揭示长程相关对均值欧拉广义水动力学方程的扩散尺度修正。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05811 2026-08-10 cs.CV 版本更新 70%

Energy-Guided Flow Matching

能量引导的流匹配(Energy-Guided Flow Matching)

Haoyang Tong, Yu He, Fang Li, Lichen Ma, Jingling Fu, Dong Chen, Zhen Chen, Junshi Huang, Jie Cao

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出能量引导的流匹配(EG-FM),通过移动端点显式建模从粗到细的生成轨迹,无需额外适配,在ImageNet类条件图像生成及文本到图像生成任务中均取得优异性能。

Comments 19 pages, Code:https://github.com/ysng123/EG-FM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新 57%

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26839 2026-08-10 cs.RO cs.CV 版本更新 57%

Ordinal Neural Collapse as a Representation Prior for Visual Navigation

序数神经坍缩作为视觉导航的表征先验

E-In Son, Jung-Taak Kim, Seung-Woo Seo

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视觉模仿学习中编码器学习到模糊、动作无关表征的问题,提出ORION方法,利用导航动作的序数结构显式组织表征空间,在仿真和真实环境中显著提升导航成功率。

Comments 27 pages, 14 figures. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23655 2026-08-10 cs.MM 版本更新 57%

A 3D-Cascading Crossing Coupling Framework for Hyperchaotic Map Construction and Its Application to Color Image Encryption

一种用于超混沌映射构建的3D级联交叉耦合框架及其在彩色图像加密中的应用

Jilei Sun, Dianhong Wu

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文提出了一种3D级联交叉耦合框架用于构建超混沌映射,并应用于彩色图像加密,实现了高安全性的加密方案。

Comments Withdrawn as the research requires substantial additional work and major revisions to meet the standard of a complete study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12236 2026-08-10 eess.IV cs.CV 版本更新 57%

Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT

分辨率无关的神经算子用于多速率稀疏视角CT

Aujasvit Datta, Jiayun Wang, Asad Aali, Anima Anandkumar

机构 * Caltech(加州理工学院) IIT Kanpur(印度理工学院坎普尔分校) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 CTO提出一种分辨率无关的神经算子框架,通过连续函数空间实现多速率稀疏视角CT重建的泛化,提升重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22618 2026-08-10 math.OC math.PR 版本更新 50%

Transform Method for Stochastic Processing and Matching Networks

随机处理与匹配网络的变换方法

Sushil Mahavir Varma, Prakirt Jhunjhunwala, Daniela Hurtado-Lange, Siva Theja Maguluri

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究现代服务系统拥堵问题中随机处理与匹配网络的稳态分析,提出变换方法,通过直接处理预极限系统克服技术障碍,得出显式函数方程,提供非渐近性能保证,综述其理论进展及实际相关性,为系统设计控制提供有力分析替代。

Comments Appeared in "TutORials in Operations Research" in the 2026 issue

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23041 2026-08-10 astro-ph.GA 版本更新 50%

Itô tracers: continuous-trajectory Lagrangian particles for Eulerian hydrodynamics

伊藤追踪器:用于欧拉流体动力学的连续轨迹拉格朗日粒子

Eric R. Moseley, R. Teyssier, Tom Abel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出伊藤追踪器,通过匹配动量、扩散和散射来改进拉格朗日粒子追踪,相比蒙特卡洛追踪器在统计测试中表现更优,且适用于多种连续轨迹过程。

Comments 16 pages, 11 figures, submitted to MNRAS. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00669 2026-08-10 cs.LG math.DS 版本更新 50%

Embedded Variational Neural Stochastic Differential Equations for Learning Heterogeneous Dynamics

嵌入变分神经随机微分方程用于学习异质动态

Sandeep Kumar Samota, Reema Gupta, Snehashish Chakraverty

机构 * National Institute of Technology, Rourkela, India(印度国立理工学院鲁尔克拉分校) Poverty Alleviation Research Centre, National Institute of Technology, Rourkela, India(印度国立理工学院鲁尔克拉分校扶贫研究中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出V-NSDE模型,结合神经SDE的动态表达与VAE的生成能力,用于学习异质动态,通过编码器和解码器处理时间序列数据,提升复杂模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12607 2026-08-10 stat.ME 版本更新 50%

On goodness-of-fit testing for volatility in McKean-Vlasov models

McKean-Vlasov模型中波动率的拟合优度检验

Akram Heidari, Mark Podolskij

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对McKean-Vlasov随机微分方程的波动率拟合优度检验问题,提出基于粒子系统离散观测的检验方法,建立其渐近性质,为高维平均场扩散模型的波动率设定评估提供严格依据。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03181 2026-08-10 q-fin.TR q-fin.CP 版本更新 50%

Correlation emergence in two coupled simulated limit order books

两个耦合模拟限价订单簿中的相关性涌现

Dominic Bauer, Derick Diana, Tim Gebbie

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过随机游走模拟耦合限价订单簿,证明Epps效应可由交易者相互作用涌现产生,无需依赖市场微观结构噪声,还分析了相关程式化事实的影响因素。

Comments 11 pages, 4 figures, 15 subfigures; v2: corrects a typographical sign error in the Gaussian source term that is correct in the code-base; added references to clarified software availability and reproducibility. Results and conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 1 篇

2605.27735 2026-08-10 quant-ph 版本更新 71%

An IQP Born Machine for Calorimeter Image Generation at 64 Qubits with Compiled-IQP Deployment

用于64量子比特量热仪图像生成的IQP玻恩机及编译IQP部署

Jamal Slim, Saverio Monaco, Florian Rehm, Dirk Krücker, Kerstin Borras

专题命中 可控生成 :image generation(title)

AI总结 提出一种瞬时量子多项式时间(IQP)玻恩机架构,通过编译为单次采样困难的IQP电路,在64量子比特上实现高能物理量热仪簇射图像的生成,并达到优于经典基线的相关性度量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像修复 1 篇

2605.30594 2026-08-10 eess.AS 版本更新 50%

FiPA-SR -- FiLM-Conditioned Perceptually Informed Audio Super-Resolution

FiPA-SR -- 基于FiLM条件感知的音频超分辨率

Wallace Abreu, Luiz W. P. Biscainho

专题命中 图像修复 :diffusion(abstract)

AI总结 提出FiPA-SR,一种基于GAN的感知架构,通过FiLM层适应不同输入带宽,在单一模型中处理多种采样率,性能优于AudioSR且效率更高。

Comments Submitted to the XLIV BRAZILIAN SYMPOSIUM ON TELECOMMUNICATIONS AND SIGNAL PROCESSING - SBrT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2602.21141 2026-08-10 cs.CV 版本更新 57%

SynthRender and I-AsSET: Open-Source Framework and Dataset for Bidirectional Sim-Real Transfer in Industrial Object Perception

SynthRender 和 IRIS:用于工业物体感知双向仿真-现实迁移的开源框架和数据集

Jose Moises Araya-Martinez, Thushar Tom, Adrián Sanchis Reig, Pablo Rey Valiente, Jens Lambrecht, Jörg Krüger

机构 * Technical University Berlin, Industrial Automation Technology(柏林技术大学,工业自动化技术) Mercedes-Benz AG, Future Manufacturing Technologies(梅赛德斯-奔驰公司,未来制造技术) Technical University Braunschweig, Institute for Cognitive Robotics(不伦瑞克技术大学,认知机器人研究所)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出SynthRender和IRIS,通过合成数据生成与结构化评估,系统研究双向仿真-现实迁移,提供32类数据集和CAD模型,实现高效合成训练与工业应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 3 篇

2605.07327 2026-08-10 cs.CV 版本更新 79%

Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations

教师特征漂移:基于预训练扩散表示的一步扩散蒸馏

Yuan Zhang, Chenyi Li, Haodong Yu, Guoqing Ma, Jiajun Zha, Yuanming Yang, Bo Wang, Wei Tang, Wenbo Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过单步扩散蒸馏简化模型,利用预训练扩散教师自身的特征空间,无需额外网络即可实现语义特征几何的漂移,同时引入轻量模式覆盖损失以提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏