arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-20 至 2026-08-20 共收录 56 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1 篇

2608.18215 2026-08-20 cs.CV 新提交 57%

LumiTokens: 3D Relighting via Token-Space Lighting Transformation

LumiTokens:基于标记空间光照变换的三维重光照

Yiwen Chen, Matheus Gadelha, Huaizu Jiang

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 LumiTokens是将三维重光照转化为潜在场景标记直接变换的框架,支持渐进式可组合光照编辑,重光照质量优于或媲美现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 44 篇

2608.19119 2026-08-20 cs.LG cs.AI 新提交 82%

Discretizing Continuous Time Series for Imputation with Masked Diffusion Training

用于掩码扩散训练插补的连续时间序列离散化

Dongbin Kim, Seungyun Lee, Geonwoo Shin, Jaewook Lee

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对时间序列插补的现有方法存在的局限性,提出MDTIM模型,引入随机离散化技术,在多种基准上的实验显示其鲁棒性和可扩展性优于现有基线方法。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19000 2026-08-20 cs.CV 新提交 79%

Mise-en-Scène: Implicit Layout Emergence in Diffusion Transformers for Human-AI Design Co-Creation

场景布置(Mise-en-Scène):用于人机协同设计共创的扩散Transformer中隐式布局的涌现

Zipeng Xu, Ryan Murdock, Umberto Michieli

机构 * Canva Research(Canva研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Mise-en-Scène框架,通过微调扩散Transformer实现隐式布局涌现,结合匹配放置步骤保证素材保真度,在PrismLayersPlus基准上生成的设计感知质量显著优于现有方法。

Comments Best Paper Award at ECCV Human-AI Co-Creation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-20 cs.CV 版本更新 79%

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21307 2026-08-20 cs.CV 版本更新 79%

The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

可解释令牌的线性几何:未学习扩散模型的越狱攻击与防御

Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

机构 * Department of Electrical Engineering & Computer Science, University of Michigan(电气工程与计算机科学系,密歇根大学) Department of Computer Science, Michigan State University(计算机科学系,密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究揭示未学习扩散模型中擦除的有害概念以线性子空间存在,提出SubAttack越狱攻击与SubDefense防御,实验表明其提升了对扩散未学习漏洞的理解与缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18764 2026-08-20 cs.IR 新提交 78%

GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling

GateDiffInt:用于用户行为建模的门控介导可控扩散与多意图大语言模型蒸馏

Jialong Duan, Zichen Zhang, Zirui Tu, Zheng Zhang, Zepeng Li, Qingyao Cui, Qinwen Wang, Yudan Liu, Luo Yang, Yao Hu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有排序模型难以解耦结构化意图的问题,提出GateDiffInt框架,通过可控扩散与LLM蒸馏实现意图感知表示,在公开及工业数据集和线上测试中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19067 2026-08-20 stat.ML cs.LG math.ST 新提交 78%

Diffusion Models for High-Dimensional Clustered Data: Intrinsic-Dimension Adaptivity via Bayesian Classification

用于高维聚类数据的扩散模型:通过贝叶斯分类实现本征维度适应性

Yuga Iguchi, Paul Fearnhead

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究将扩散模型理论与多模态高维聚类数据几何结合,通过K混合高斯框架证明其去噪可作为动态贝叶斯分类器,KL误差界线性依赖聚类最大本征维度,实现了本征维度适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18237 2026-08-20 stat.ML cs.LG math.OC 新提交 78%

Sobolev Regularized Score Difference Estimation in Diffusion Models

扩散模型中的Sobolev正则化得分差估计

Chenghan Xie, Jose Blanchet, Renyuan Xu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对扩散模型得分差估计存在的统计一致性或可扩展性问题,提出Sobolev正则化的一致可扩展估计器,在小样本场景稳定性提升,真实任务性能优于非正则化方法。

Comments Accpeted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18526 2026-08-20 cond-mat.soft 新提交 78%

Particle-Wall Alignment Interaction and Active Brownian Diffusion Through Narrow Channels

粒子-壁面的取向相互作用与活性布朗粒子通过窄通道的扩散

Poulami Bag, Shubhadip Nayak, Pulak Kumar Ghosh

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究通过数值模拟探究粒子-壁面取向相互作用对活性粒子通过窄通道扩散的影响,明确不同稳定取向构型下扩散系数的变化规律,为理解微/纳米物体在窄通道中的扩散提供理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17837 2026-08-20 nucl-th 版本更新 78%

Dissipative properties of a Fermi system within the diffusion approximation of kinetic theory

动力学理论扩散近似下费米系统的耗散性质

Sergiy V. Lukyanov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究球形原子核模型费米系统在动力学理论扩散近似下的耗散性质,通过非线性扩散方程解析解表明分布函数趋近平衡费米分布,得出不同弛豫时间,解释了弛豫时间差异。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08055 2026-08-20 cond-mat.mtrl-sci 版本更新 78%

Anisotropic Defect Diffusion in Layered CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$ Perovskites

层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中各向异性缺陷扩散

Konrad Wilke, Mike Pols, Titus S. van Erp, Geert Brocks, Shuxia Tao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分子动力学模拟探讨层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中缺陷扩散的各向异性,揭示层状卤素排列对材料稳定性及缺陷迁移的调控作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09560 2026-08-20 cs.LG 版本更新 78%

The Diffusion-Attention Connection

扩散与注意的联系

Julio Candanedo

机构 * SparseTrace.ai, Appleton, Wisconsin, USA(SparseTrace.ai,美国威斯康星州阿普尔顿)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文揭示Transformer、扩散图和磁拉普拉斯为单一马尔可夫几何的不同模式,通过定义QK双向发散实现注意力、扩散图和磁扩散的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05092 2026-08-20 stat.ML cs.LG 版本更新 78%

Foundations of Diffusion Models in General State Spaces: A Self-Contained Introduction

扩散模型在一般状态空间中的基础:一个自包含的介绍

Vincent Pauline, Tobias Höppe, Kirill Neklyudov, Alexander Tong, Stefan Bauer, Andrea Dittadi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提供了一个自包含的扩散模型入门教程,统一了连续和离散状态空间的理论框架,阐述了反向动力学和ELBO的形成机制,适用于不同背景的读者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08484 2026-08-20 cs.CV 版本更新 77%

Generalizable AI-Generated Image Detection Based on Fractal Self-Similarity in the Spectrum

基于频谱分形自相似性的可泛化AI生成图像检测

Shengpeng Xiao, Yuanfang Guo, Heqi Peng, Hui Miao, Zeming Liu, Liang Yang, Jiantao Zhou, Yunhong Wang

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对AI生成图像检测中现有方法泛化能力不足的问题,提出Fractal-CNN模型,通过捕捉频谱分形自相似性实现与生成器无关的检测,在16个测试生成器上平均准确率达93.93%,具备强跨生成器泛化能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18908 2026-08-20 cs.CE 新提交 71%

Image Generation Techniques for Urban Planning

面向城市规划的图像生成技术

Katharina Roth, Eva Hagen, Alexander Bartscher, Inga Scheler, Nicolas R. Gauger

专题命中 扩散模型 :image generation(title)

AI总结 本研究开发了基于掩码的加权条件流匹配(MWCFM)模型,用于自动生成城市场景中的建筑演示图像,并通过应用相关指标评估其性能,为城市规划图像生成提供优化方案。

Comments 9 pages (incl. references), 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18416 2026-08-20 math.AP 新提交 71%

Global existence of weak solutions to chemotaxis models with porous medium diffusion, linear production, and logistic source on $\mathbb{R}^N$

Zulaihat Hassan

专题命中 扩散模型 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-20 cs.CV cs.LG 版本更新 70%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16445 2026-08-20 cs.LG cs.AI cs.CV stat.ML 版本更新 70%

Iterative Flow Matching: Path Correction and Gradual Refinement for Enhanced Generative Modeling

迭代流匹配:用于增强生成建模的路径校正与渐进式优化

Eldad Haber, Shadab Ahamed, Md. Shahriar Rahim Siddiqui, Niloufar Zakariaei, Moshe Eliasof

专题命中 扩散模型 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对图像生成模型易产生幻觉的问题,提出可集成于各类生成建模技术的迭代流匹配方法,通过路径校正与渐进式优化提升图像合成的性能与鲁棒性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19055 2026-08-20 cs.CV cs.GR cs.SD 新提交 62%

Generalized Audio-Driven Synthesis of Precise Drummer Motion

音频驱动的精确鼓手动作的广义合成

Álvaro G. Iñesta, Mattia Ryffel, Amit H. Bermano, Robert W. Sumner, Martin Guay

机构 * DisneyResearch|Studios(迪士尼研究工作室) The Blavatnik School of Computer Science and AI, Tel-Aviv University(特拉维夫大学布拉瓦尼克计算机科学与人工智能学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出带双目标损失函数的生成式扩散框架,结合自有数据集与新指标,实现从音频生成厘米级精度的逼真打鼓动作,泛化能力优于现有方法。

Comments Best Paper Award at the 25th ACM SIGGRAPH / Eurographics Symposium on Computer Animation (SCA 2026). For Supplementary Video, see this https URL (https://studios.disneyresearch.com/2026/08/18/generalized-audio-driven-synthesis-of-precise-drummer-motion/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 62%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18907 2026-08-20 cs.CV cs.AI 新提交 57%

Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets

面向小规模数据集的学习状态感知动态生成式数据增强

Ting Xiang, Chenxi Deng, Jinhui Zhao, Bingting Jiang, Ke Zhang, Changjian Chen, Zhuo Tang

机构 * Hunan University(湖南大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对小规模图像分类数据稀缺问题,提出LSADA方法,通过构建样本学习状态映射增强强度,采用解耦增强与扩散融合策略,在9个数据集上较SOTA动态GDA方法取得平均2.5%-4.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18523 2026-08-20 cs.CV cs.AI 新提交 57%

Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection

用于通用AI生成图像检测的先验条件高斯判别模型

Shashank Kotyan, Makoto Shing, Yuki Imajuku, Rujikorn Charakorn, Tarin Clanuwat

机构 * Sakana AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对AI生成图像检测在多因素变化下失效的问题,提出先验条件高斯判别梯方法,在Percept-Lens数据集上验证其性能,推动相关报告与基线的优化。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18516 2026-08-20 cs.CV cs.AI 新提交 57%

OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation

OptiModNet:用于视盘和视杯分割的结合分组查询与通道注意力的UNet-Transformer混合模型

Soumili Ghosh, Debapriya Roy, Aryan Das, Bikash Santra

机构 * IEM Saltlake(IEM盐湖校区) Techno Main Salt Lake(Techno主盐湖校区) VIT Bhopal University(博帕尔维洛尔理工大学) IIT Jodhpur(焦特布尔印度理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出OptiModNet,一款用于视盘和视杯分割的轻量混合架构,结合分组查询与通道注意力及聚合金字塔损失,在REFUGE2数据集上实现超现有方法2.5%的最优性能,且仅需3.73 GFLOPs和1.93M参数,兼顾高性能与低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-08-20 cs.CV cs.LG 版本更新 57%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

Comments Published in TMLR (09/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19144 2026-08-20 cs.LG 新提交 50%

Bridge Graphical Models: Coupling, Projection, and Current-Preserving Dynamics for Generative Modeling

桥接图模型:用于生成建模的耦合、投影与保电流动力学

Tiantian Zhang

机构 * Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出桥接图模型(BGMs),定义马尔可化间隙作为生成模型桥到解码器压缩的不可约损失,通过实验验证其可作为桥和耦合设计的训练前诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 50%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18783 2026-08-20 q-fin.PR math.PR q-fin.MF 新提交 50%

When to Sell an Asset? - A Distribution Builder Approach

何时出售资产?——一种分布构建器方法

Peter Carr, Stephan Sturm

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究基于分布构建器方法,将最优资产出售问题与Skorokhod嵌入问题关联,在资产服从几何布朗运动且目标分布特定时,可观察到风险-收益权衡。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19198 2026-08-20 math.PR math.OC 新提交 50%

Probabilistic Representation and Convergence of Gromov-Wasserstein Gradient Flows

Venkatkrishna Karumanchi, Ziv Goldfeld, Kengo Kato, Zhengxin Zhang

专题命中 扩散模型 :diffusion(abstract)

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19111 2026-08-20 math.AP 新提交 50%

On the uniform bound of solutions to a thermo-diffusive system

热扩散方程组解的一致界

Kirill Leontev, Lenya Ryzhik

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对具有L^∞初值的反应扩散型热扩散方程组,证明了其解的全局时间一致界。

详情

展开后加载摘要…

URL PDF HTML 收藏