arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-28 至 2026-07-28 共收录 141 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 109 篇

2607.23134 2026-07-28 cs.LG cs.SY eess.SY 新提交 78%

Diffusion-Guided Search via Exponential Tilting (DiffTilt): An Application to Falsification of Safety-Critical Systems

通过指数倾斜的扩散引导搜索(DiffTilt):在安全关键系统证伪中的应用

Tanmay Khandait, Preetom Biswas, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Giulia Pedrielli

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) Toyota Motor North America, Research & Development(丰田汽车北美研发公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对自主和网络物理系统安全关键故障发现难题,提出DiffTilt框架,通过指数倾斜扩散模型诱导分布进行引导搜索,放大故障概率,优于条件采样,在基准测试中表现良好,提升了证伪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22661 2026-07-28 cs.AI 新提交 78%

TRE: Training-Free Hallucination Detection for Diffusion Language Models

TRE:用于扩散语言模型的无训练幻觉检测

Pengcheng Weng, Yanyu Qian, Yue Tan, Yixin Liu

机构 * University of Bern(伯尔尼大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语言模型的幻觉问题,现有方法有局限。本文提出无训练的TRE指标,通过在模型解码过程中沿时空维度提取熵信号来估计幻觉风险,经实验验证其性能有竞争力,具有泛化性、效率和鲁棒性等优点。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22634 2026-07-28 cs.AI 新提交 78%

PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding

PRESTO:用于扩散推测解码的前缀对齐树草稿生成

Zheng Wang, Zhifan Ye, Qi Cheng, Yonggan Fu, Ziyan Wang, Feng Zhu, Haozhe Zhao, Jan Kautz, Pavlo Molchanov, Humphrey Shi, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散大语言模型用于推测解码时现有方法的局限,提出PRESTO框架,通过前缀对齐评分和基于优先级的树搜索,解决扩散草稿与前缀验证不匹配问题,在多种基准测试中显著提升了端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22599 2026-07-28 cs.AI 新提交 78%

Differencing the Diffusion Trajectory toward Uncertain Components for Time Series Forecasting

针对时间序列预测,向不确定成分差分扩散轨迹

Chen Su, Yuanhe Tian, Yan Song

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对时间序列预测中未来与历史的不对称问题,提出DiffDiff扩散框架,将可预测性不对称嵌入扩散轨迹,使前向算子依赖步骤,在多基准测试中优于基线,能集中精力于目标最不确定成分,减轻重建历史锚定内容负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24324 2026-07-28 stat.ME math.ST stat.TH 新提交 78%

Diffusion Bootstrap for High-Dimensional Linear Models

高维线性模型的扩散自举法

Ce Liang, Wei Ma

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究高维线性模型中经典自举法的不足,提出基于扩散的配对自举法,通过学习生成律取代经验联合分布,经理论论证和实验验证,该方法能改善方差校准及I型错误校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23947 2026-07-28 eess.SY cs.SY math.OC 新提交 78%

Reverse-Time Diffusion Processes for Discrete Time Linear and Nonlinear Systems with non-Gaussian Noise

具有非高斯噪声的离散时间线性和非线性系统的反向时间扩散过程

Soura Dasgupta, Brian D. O. Anderson, Raghuraman Mudumbai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对具有非高斯噪声的离散时间线性和非线性系统,建立了直接找到反向扩散的理论,给出正向线性且噪声高斯时反向模型为输入仿射的条件,揭示多种状态密度下不存在输入仿射反向扩散及与连续时间对应方程反转的差异。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23226 2026-07-28 cs.LG math.ST stat.TH 新提交 78%

From Score Learning to Discretized Sampling: An End-to-End Generalization Analysis of Diffusion Models

从得分学习到离散采样:扩散模型的端到端泛化分析

Jinshu Huang, Yiming Jiang, Chunlin Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究基于实际残差网络架构的得分扩散模型,建立统一收敛和泛化框架,分析从得分函数学习到采样过程的特性,将生成误差分解为四个分量,定量刻画训练样本大小等因素对扩散模型样本保真度的控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24086 2026-07-28 math.NA cs.NA 新提交 78%

A convergent Scharfetter-Gummel scheme for a three-species drift-diffusion model for memristors

一种用于忆阻器的三物种漂移扩散模型的收敛性Scharfetter-Gummel格式

Ansgar Jüngel, Zhiwei Sun, Sara Xhahysa

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对忆阻器的三物种漂移扩散模型,提出保持结构的全隐式Scharfetter-Gummel有限体积格式,重铸通量揭示隐藏信息分量,建立离散解存在性等,二维数值模拟证实格式特性及忆阻器细丝形成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24004 2026-07-28 math.OC 新提交 78%

Closed-loop solvability of infinite-horizon stochastic linear-quadratic problem for Markov regime-switching jump-diffusion system

马尔可夫状态切换跳跃扩散系统无限时域随机线性二次问题的闭环可解性

Kai Ding, Fan Wu, Jie Xiong, Xinyue Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究马尔可夫状态切换跳跃扩散系统无限时域随机线性二次控制问题,通过耦合代数黎卡提方程系统的稳定解给出最优控制反馈表示,并应用于终身财富跟踪问题得出最优投资策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23548 2026-07-28 math.PR 新提交 78%

A CIR-Type Diffusion Driven by Hermite Processes: Well-Posedness, Positivity and Malliavin Analysis

由埃尔米特过程驱动的CIR型扩散:适定性、正性和 Malliavin 分析

Atef Lechiheb

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究由埃尔米特过程驱动的广义CIR扩散,利用其赫尔德正则性在杨氏 - 斯蒂尔杰斯意义下解释动力学,建立了适定性、正性界、Malliavin可微性及绝对连续性四个主要结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23192 2026-07-28 math.NA cs.LG cs.NA 新提交 78%

Data-Driven Diffusion Processes on Differential Forms via the Projected Ambient Connection Laplacian

通过投影环境联络拉普拉斯算子在微分形式上进行数据驱动的扩散过程

Alvaro Almeida Gomez, Jorge Duque Franco

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究如何通过投影环境联络拉普拉斯算子对微分形式进行数据驱动的扩散过程,基于新颖表示构造矩阵值扩散算子,有渐近最优核带宽缩放,推导显式欧拉格式并经数值实验验证,为几何偏微分方程数值逼近奠定基础。

Comments Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22660 2026-07-28 math.OC math.PR 新提交 78%

Generalized Fine-Tuning of Diffusion Models via Stochastic Control and FBSDEs

通过随机控制和正倒向随机微分方程对扩散模型进行广义微调

Zirui Wang, Lu Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 从随机控制角度为扩散模型提出广义微调框架,引入一般运行成本,通过正倒向随机微分方程刻画值函数,建立存在唯一性,最优控制有非线性反馈形式,还引入梯度相关惩罚,提供统一微调框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24505 2026-07-28 physics.plasm-ph 新提交 78%

Impact of ion-electron collisions on nonlocal ion heat conduction, viscous stress, and diffusion

离子-电子碰撞对非局部离子热传导、粘性应力和扩散的影响

Nicholas Mitchell, David Chapman, Grigory Kagan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究离子-电子碰撞对强非均匀等离子体中离子输运的影响,采用第一性原理简化动力学方法,发现其显著改变非局部热流峰值并强烈抑制非局部预热。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24272 2026-07-28 cond-mat.mtrl-sci cs.LG 新提交 78%

Catalyst Diffusion Transformer: Generative Inverse Design of Heterogeneous Catalysts

催化剂扩散变换器:多相催化剂的生成式逆设计

Hayoung Doo, Dong Hyeon Mok, Seoin Back, Jonggeol Na

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对催化剂发现人力物力消耗大及现有生成模型局限性问题,提出催化剂扩散变换器CatDiT,通过学习潜在表示实现高效训练与快速采样,支持多条件设定,用于逆催化剂设计,在氮还原反应中取得良好效果,是实用可扩展的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22742 2026-07-28 cond-mat.stat-mech cond-mat.mtrl-sci 新提交 78%

Statistical Mechanics of Thermal Diffusion in Rough Energy Landscapes

粗糙能量景观中热扩散的统计力学

Soham Chattopadhyay, Blas P. Uberuaga

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究从质量输运变分原理出发,提出统计框架描述复杂固体热扩散,表明微观涨落支配非阿累尼乌斯扩散,动力学项可机器学习处理,还阐述了固溶体空位扩散在不同条件下与阿累尼乌斯行为的关系。

Comments 14 pages, 3 figures, 24 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26017 2026-07-28 cs.RO 版本更新 78%

G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance

G2DP: 基于时空网格引导的扩散规划

Hang Yu, Ye Jin, Alessandro Canevaro, Julian Schmidt, Julian Jordan, Peizheng Li, Marc Kaufeld, Silvan Lindner, Johannes Betz, Wilhelm Stork

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) TU Munich(慕尼黑工业大学) University of Tübingen(图宾根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对自动驾驶扩散规划器随机性导致的安全与路线保持问题,提出G2DP,通过可微时空代价体积在去噪过程中注入密集梯度,实现无碰撞与路径最优的轨迹生成,在nuPlan等基准上取得最优性能。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22901 2026-07-28 cs.LG 版本更新 78%

Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching

通过误差反馈事件驱动缓存加速频域扩散模型

Dong Liu, Yanxuan Yu, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Yale University(耶鲁大学) East China Normal University(华东师范大学) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出E²-CRF方法,利用频域扩散模型的频谱局部化和镜像对称性,通过事件驱动的残差动态实现自适应缓存,提升推理速度2.2倍并保持样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16648 2026-07-28 cs.LG q-bio.QM 版本更新 78%

FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time

FRIGID:在训练和推理时通过质谱进行扩散分子生成的扩展

Montgomery Bohde, Hongxuan Liu, Mrunali Manjrekar, Magdalena Lederbauer, Shuiwang Ji, Runzhong Wang, Connor W. Coley

机构 * Massachusetts Institute of Technology, Cambridge, MA, United States Texas A\&M University, College Station, TX, United States

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FRIGID通过中间指纹表示和确定的化学式生成分子结构,利用扩散模型在大规模无标签数据上训练,推理时通过碎片修复提升准确性,达到18%的Top-1准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09045 2026-07-28 hep-lat hep-ph 版本更新 78%

Diffusion Models for SU(2) Lattice Gauge Theory in Two Dimensions

二维SU(2)晶格规范理论中的扩散模型

H. Alharazin, J. Yu. Panteleeva, B. -D. Sun

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用扩散模型生成二维SU(2)晶格规范场,通过四元数参数化和U-Net架构实现高精度模拟,验证了其在非阿贝尔规范场生成中的有效性。

Journal ref Phys. Rev. D 114, 014522 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01572 2026-07-28 cs.LG cs.AI physics.app-ph 78%

Reconstructing Multi-Scale Physical Fields from Extremely Sparse Measurements with an Autoencoder-Diffusion Cascade

使用自编码器-扩散级联从极度稀疏测量中重建多尺度物理场

Letian Yi, Tingpeng Zhang, Mingyuan Zhou, Guannan Wang, Quanke Su, Zhilu Lai

机构 * Internet of Things Thrust(物联网方向) Intelligent Transportation Thrust(智能交通方向) Marine Hydrodynamic Research Facility(海洋流体研究设施) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Cascaded Sensing框架,通过粗尺度确定性估计和细尺度条件扩散模型级联,解决极度稀疏测量下物理场重建的不适定性和多模态后验问题。

Comments 34 pages,22 figures

Journal ref Journal of Computational Physics, Volume 565, 15 November 2026, Article 115214

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07649 2026-07-28 math.AP 版本更新 78%

Damping-Diffusion-Noise Interactions in the Stochastic Camassa-Holm Equation

随机 Camassa-Holm 方程中的阻尼-扩散-噪声相互作用

Diego Alonso-Orán, Peter H. C. Pang, Hao Tang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究含时非齐次阻尼、非局部扩散和噪声相互作用对 Camassa-Holm 方程经典解的影响,建立局部时间理论,确定保证解全局正则性和长期行为的条件,证明测度演化系统存在,推广不变测度概念。

Journal ref Journal of the London Mathematical Society, Volume114, Issue2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27259 2026-07-28 cs.LG 版本更新 71%

Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning

Kan扩展变换器:注意力、扩散和预测-分离自条件的范畴统一

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts(马萨诸塞大学) Amherst(阿默斯特)

专题命中 扩散模型 :diffusion(title)

AI总结 提出Kan扩展变换器(KETs)作为多种Transformer实现的统一范畴框架,将Transformer层视为加权结构化扩展算子,并通过预测-分离机制实现有效的自条件化,实验表明预测-分离机制比改变邻域族带来更大性能提升。

Comments Clarified that predict-detach is strictly autoregressive only under a target-relative prefix-measurability condition; restricted exact Kan-extension claims to representable enriched cases; and clarified experimental coverage across depths 2, 8, 16 and widths 64, 256. A detailed change log appears in the supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23492 2026-07-28 cs.CV cs.LG 新提交 70%

To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion

擦除还是不擦除:基于保留感知自适应排序子空间扩展的无训练鲁棒概念擦除

Shaswati Saha, Rajasekhar Anguluri, Manas Gaur

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型的概念擦除技术面临的鲁棒性与效用权衡问题,提出无训练框架PARSE,通过自适应发现擦除与保留概念、编辑交叉注意力值空间及迭代搜索触发因素来实现鲁棒概念擦除,引入BEUS评估,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22674 2026-07-28 cs.GR cs.CV cs.HC 新提交 62%

Text-based Tactile Graphics Generation for the Visually Impaired

为视障人士生成基于文本的触觉图形

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究为视障人士开发基于文本生成触觉图形的集成系统,引入制作感知技术,能联合生成多种元素,经评估和用户研究,结果优于基线,拓宽了生成式AI对视障群体及其他人的可及性。

Comments ECCV 2026, Project webpage: https://ruihangao.github.io/Text2TactileGraphics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00874 2026-07-28 cs.CV cs.AI cs.LG cs.MM 62%

Latent Space Probing for Adult Content Detection in Video Generative Models

潜在空间探测用于视频生成模型中的成人内容检测

Alizishaan Khatri, Chiquita Prabhu

机构 * Wrynx Inc.(Wrynx公司) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种潜在空间探测框架,通过拦截视频扩散模型生成过程中的去噪潜在表示,利用轻量级分类器实现实时成人内容检测,实验表明潜在空间信号在有害内容检测中具有强判别能力。

Comments To be published in 2026 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22772 2026-07-28 eess.IV cs.CV 新提交 57%

Generative Video Compression with Adaptive Score Distillation

基于自适应分数蒸馏的生成式视频压缩

Naifu Xue, Zhaoyang Jia, Haosen Li, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Qi Meng, Yuan Zhang, Yan Lu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视频压缩探索专门设计的扩散模型,提出GenVC,通过全局到局部层次结构恢复时空细节,用自适应分数蒸馏加速推理,在超低比特率下实现高质量重建,参数少且解码速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22765 2026-07-28 eess.IV cs.CV 新提交 57%

Frequency-Aware Dual-Stream Learning for Balanced Realism and Fidelity in Electron Microscopy Imaging

电子显微镜成像中用于平衡真实感和保真度的频率感知双流学习

Longmi Gao, Zhengkai Zhao, Pan Gao, Manoranjan Paul

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对电子显微镜成像分辨率与采集速度权衡问题,提出频率自适应双流架构,利用离散小波变换分解图像,通过条件扩散模型和变压器网络分别进行全局合成与细节恢复,实验表明该方法性能优越且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24436 2026-07-28 cs.CV 新提交 57%

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

MSVS-VAE:用于高保真3D重建的多尺度锚定向量集

Dehao Hao, Kaiyi Zhang, Tanghui Jia, Xiangjun Gao, Dongyu Yan, Weikai Chen, Zeyu Hu, Lingting Zhu, Yingda Yin, Runze Zhang, Li Yuan, Xin Wang, Long Quan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lightspeed Studios(光速工作室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对高保真3D重建中VAE的瓶颈问题,提出MSVS-VAE。通过分层点洗牌上采样 densify 锚定向量集潜在特征,用AVS-Conv取代全局交叉注意力,引入多尺度查询解码融合特征,实验表明其性能优于现有方法,解码速度和紧凑性有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24027 2026-07-28 cs.CV 新提交 57%

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Sol-Attn:通过即时注意力稀疏化加速视频生成推理

Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散变压器视频生成中注意力推理瓶颈,提出无训练的Sol-Attn方法,通过即时块阈值处理和代理分数重用统一动态路由等,在图像和视频生成任务实验中实现质量-效率提升,加速视频生成和编辑。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23493 2026-07-28 cs.CV cs.AI 新提交 57%

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation

用于多模态情感解释的令牌-区域引导交叉注意力融合

Musa Tur Farazi, Nufayer Jahan Reza

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对孟加拉语模因政治意图检测难题,引入多模态交叉注意力融合框架,利用视觉语言模型提取文本,经跨模态多头注意力机制合成特征,还整合政治词汇表,实验表明该方法显著优于基线,Macro-F1达0.94,有效实现文本语义基于视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏