arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-20 至 2026-08-20 共收录 22 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 18 篇

2608.11748 2026-08-20 cs.CV 版本更新 79%

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21307 2026-08-20 cs.CV 版本更新 79%

The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

可解释令牌的线性几何:未学习扩散模型的越狱攻击与防御

Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

机构 * Department of Electrical Engineering & Computer Science, University of Michigan(电气工程与计算机科学系,密歇根大学) Department of Computer Science, Michigan State University(计算机科学系,密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究揭示未学习扩散模型中擦除的有害概念以线性子空间存在,提出SubAttack越狱攻击与SubDefense防御,实验表明其提升了对扩散未学习漏洞的理解与缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17837 2026-08-20 nucl-th 版本更新 78%

Dissipative properties of a Fermi system within the diffusion approximation of kinetic theory

动力学理论扩散近似下费米系统的耗散性质

Sergiy V. Lukyanov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究球形原子核模型费米系统在动力学理论扩散近似下的耗散性质,通过非线性扩散方程解析解表明分布函数趋近平衡费米分布,得出不同弛豫时间,解释了弛豫时间差异。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08055 2026-08-20 cond-mat.mtrl-sci 版本更新 78%

Anisotropic Defect Diffusion in Layered CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$ Perovskites

层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中各向异性缺陷扩散

Konrad Wilke, Mike Pols, Titus S. van Erp, Geert Brocks, Shuxia Tao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分子动力学模拟探讨层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中缺陷扩散的各向异性,揭示层状卤素排列对材料稳定性及缺陷迁移的调控作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09560 2026-08-20 cs.LG 版本更新 78%

The Diffusion-Attention Connection

扩散与注意的联系

Julio Candanedo

机构 * SparseTrace.ai, Appleton, Wisconsin, USA(SparseTrace.ai,美国威斯康星州阿普尔顿)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文揭示Transformer、扩散图和磁拉普拉斯为单一马尔可夫几何的不同模式,通过定义QK双向发散实现注意力、扩散图和磁扩散的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05092 2026-08-20 stat.ML cs.LG 版本更新 78%

Foundations of Diffusion Models in General State Spaces: A Self-Contained Introduction

扩散模型在一般状态空间中的基础:一个自包含的介绍

Vincent Pauline, Tobias Höppe, Kirill Neklyudov, Alexander Tong, Stefan Bauer, Andrea Dittadi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提供了一个自包含的扩散模型入门教程,统一了连续和离散状态空间的理论框架,阐述了反向动力学和ELBO的形成机制,适用于不同背景的读者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08484 2026-08-20 cs.CV 版本更新 77%

Generalizable AI-Generated Image Detection Based on Fractal Self-Similarity in the Spectrum

基于频谱分形自相似性的可泛化AI生成图像检测

Shengpeng Xiao, Yuanfang Guo, Heqi Peng, Hui Miao, Zeming Liu, Liang Yang, Jiantao Zhou, Yunhong Wang

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对AI生成图像检测中现有方法泛化能力不足的问题,提出Fractal-CNN模型,通过捕捉频谱分形自相似性实现与生成器无关的检测,在16个测试生成器上平均准确率达93.93%,具备强跨生成器泛化能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-20 cs.CV cs.LG 版本更新 70%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16445 2026-08-20 cs.LG cs.AI cs.CV stat.ML 版本更新 70%

Iterative Flow Matching: Path Correction and Gradual Refinement for Enhanced Generative Modeling

迭代流匹配:用于增强生成建模的路径校正与渐进式优化

Eldad Haber, Shadab Ahamed, Md. Shahriar Rahim Siddiqui, Niloufar Zakariaei, Moshe Eliasof

专题命中 扩散模型 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对图像生成模型易产生幻觉的问题,提出可集成于各类生成建模技术的迭代流匹配方法,通过路径校正与渐进式优化提升图像合成的性能与鲁棒性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 62%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-08-20 cs.CV cs.LG 版本更新 57%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

Comments Published in TMLR (09/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21636 2026-08-20 cs.LG cs.AI 版本更新 50%

Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models

测量依赖差距:诊断表格生成模型中的列间保真度

Jie Zhang

机构 * Accenture Japan(埃森哲日本公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究表格生成模型列间保真度,引入依赖感知保真度诊断方法,分解XGB-C2ST测试,应用于TabbyFlow/EF-VFM发现标准指标遗漏的依赖差距,探讨差距原因,表明是缺乏直接依赖监督,非容量或结构问题

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03262 2026-08-20 physics.ao-ph 版本更新 50%

A Wigner-based volumetric transport framework for paraxial waves in random media

基于维格纳的随机介质中傍轴波体积输运框架

Arnaud Coatanhay, Thomas Bonnafont, Angélique Dremeau

专题命中 扩散模型 :diffusion(abstract)

AI总结 为随机介质中平均傍轴波传播开发基于维格纳的相空间框架,从随机抛物波方程推导相关分布演化,经多层建模得出分析结果并验证求解器,与非局部动力学模型比较,还引入大气特化。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18122 2026-08-20 astro-ph.HE 版本更新 50%

Spectral energy-loss bump and $γ$-ray pulsar halos

谱能损驼峰与γ射线脉冲星晕

Kun Fang

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分析LHAASO J0248+6021的高曲率谱,提出该脉冲星晕的能损驼峰未显著偏离高能截止,从而统一解释年轻和年老脉冲星晕的广谱谱特征。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17195 2026-08-20 astro-ph.EP 版本更新 50%

Conditions for planetesimal formation via the streaming instability persist under turbulence driven by magnetorotational instability

通过流体不稳定性形成行星胚胎的过程在由磁旋转不稳定性驱动的湍流中持续存在

Linn E.J.Eriksson, Ziyan Xu, Jeonghoon Lim, Chao-Chin Yang, Pinghui Huang, Mordecai-Mark Mac Low

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究探讨了磁旋转不稳定性驱动的湍流对流体不稳定性形成行星胚胎的影响,发现自洽生成的湍流不会抑制行星胚胎形成。

Comments Accepted for publication in A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05160 2026-08-20 cond-mat.stat-mech quant-ph 版本更新 50%

Framework for fluctuating times and counting observables in stochastic excursions

一种用于随机游走和计数可观测量的框架

Guilherme Fiusa, Pedro E. Harunari, Abhaya S. Hegde, Gabriel T. Landi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种用于分析随机游走和计数可观测量的框架,通过提供技术结果和公式,揭示了游走统计与热力学量之间的关系,并探讨了其在多个物理问题中的应用。

Comments Companion paper to arXiv:2505.06208 (https://arxiv.org/abs/2505.06208)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04024 2026-08-20 physics.med-ph math.NA 版本更新 50%

Cine MRI-Validated Biventricular Electromechanical Digital Twin Framework for Predicting Regional Endocardial Motion

经 Cine MRI 验证的双心室电机械数字孪生框架用于预测区域心内膜运动

Milad Hasani, Tomas Zaremba, Sam Riahi, Alireza Rezania

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出经 Cine MRI 验证的双心室电机械数字孪生框架,整合多类心脏生理机制,可预测区域心内膜运动,为心内植入物植入部位选择及患者特异性规划提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21705 2026-08-20 math.OC math.NA 版本更新 50%

Preconditioning transformations of adjoint systems for evolution equations

演化方程伴随系统的预处理变换

Brian K. Tran, Ben S. Southworth, Hannah F. Blumhoefer, Samuel Olivier

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对演化方程伴随系统提出两类预处理变换框架,将其应用于辐射扩散方程逆问题,使优化迭代收敛速度提升,可高精度重现波前。

Comments Appears in: Journal of Nonlinear Science

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 70%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: this https URL (https://srl-ethz.github.io/Mask2Real-WM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-20 cs.RO 版本更新 50%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26635 2026-08-20 math.OC 版本更新 50%

Equilibrium for regular-singular control under mean-variance criterion: A unified approach via control laws

均值方差准则下正则-奇异控制的均衡问题

Zongxia Liang, Xiaodong Luo, Jiayu Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文针对均值方差准则下的混合正则-奇异控制问题,在个人内博弈框架中提出新均衡概念,推导了均衡的数学刻画,并为再保险问题构造了显式耦合均衡解,退化情形下解可简化为独立单控制均衡组合。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2606.22361 2026-08-20 cs.CL cs.AI 版本更新 50%

First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

首个令牌广播者:Transformer中语言身份与分布式鲁棒性的机制起源

Arjun Pillai, Christian Hoang, Anjelo Jann Laroza

机构 * Irvington High School(欧文顿高中) GenAI4E Mapua University(马普阿大学)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 通过因果干预方法LIHA,发现Transformer中少量注意力头(如GPT-2的L6H1)持续关注首个令牌并广播语言信号,且消融后补偿呈现层级前馈模式;指令微调将语言身份电路重组至早期层。

Comments Under review at Interp4Discovery @ NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏