arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-29 至 2026-04-29 共收录 48 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 48 篇

2604.25299 2026-04-29 cs.CV cs.AI 85%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25358 2026-04-29 cs.CV 83%

Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings

通过闭合和开放设置的统一语义-空间评估基准测试布局引导扩散模型

Luca Parolari, Nicla Faccioli, Lamberto Ballan

机构 * Department of Mathematics, University of Padova(帕多瓦大学数学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出C-Bench和O-Bench两种基准测试,结合语义和空间准确性评估布局引导扩散模型,通过大规模测试揭示模型性能与局限性。

Comments Accepted to CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24913 2026-04-29 cs.LG q-bio.PE 82%

Generative diffusion models for spatiotemporal influenza forecasting

生成扩散模型用于时空流感预测

Joseph Lemaitre, Justin Lessler

机构 * Department of Epidemiology, Gillings School of Global Public Health, University of North Carolina at Chapel Hill(流行病学系,全球公共卫生学院,北卡罗来纳大学查佩尔希尔分校) Department of Epidemiology, Johns Hopkins Bloomberg School of Public Health, Baltimore, MD 21205, USA(流行病学系,约翰·霍普金斯伯恩斯坦公共卫生学院,巴尔的摩,MD 21205, USA) Carolina Population Center, University of North Carolina at Chapel Hill(卡罗来纳人口中心,北卡罗来纳大学查佩尔希尔分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 本文提出Influpaint模型,利用扩散模型对流感流行病进行时空预测,通过将流感季节编码为时空图像,学习疾病动态的丰富分布,并在回顾评估中实现了与领先集成方法相当的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24877 2026-04-29 cs.CV cs.AI cs.LG eess.IV 80%

Learning Illumination Control in Diffusion Models

在扩散模型中学习光照控制

Nishit Anand, Manan Suri, Christopher Metzler, Dinesh Manocha, Ramani Duraiswami

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一个完全开源的管道,通过生成光照控制训练三元组来改进扩散模型的光照控制,实验显示在感知相似性、结构相似性和身份保持方面优于基线模型。

Comments Accepted to ICLR 2026 ReALM-GEN Workshop on Diffusion Models. Project Website: https://nishitanand.github.io/relighting-diffusion-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09923 2026-04-29 cs.CV 79%

Splatent: Splatting Diffusion Latents for Novel View Synthesis

Splatent: 基于扩散模型的潜在空间光场表示用于新视角合成

Or Hirschorn, Omer Sela, Inbar Huberman-Spiegelglas, Netalee Efrat, Eli Alshan, Ianir Ideses, Frederic Devernay, Yochai Zvik, Lior Fritz

机构 * Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Splatent通过多视图注意力机制在2D中恢复细节,提升VAE潜在空间光场重建质量,实现高精度稀疏视角3D重建。

Comments CVPR 2026. Project's webpage at https://orhir.github.io/Splatent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25319 2026-04-29 cs.CV 79%

Edge-Cloud Collaborative Reconstruction via Structure-Aware Latent Diffusion for Downstream Remote Sensing Perception

通过结构感知潜在扩散实现边缘-云协作重建以用于下游遥感感知

Yun Li, Xianju Li

机构 * School of Computer Science, China University of Geosciences, Wuhan, Hubei, China(中国地质大学(武汉)计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结构感知潜在扩散框架,通过边缘-云协作实现高效超分辨率重建,在极端带宽限制下提升遥感场景分类和小目标检测性能。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25289 2026-04-29 cs.LG cs.CV 79%

Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds

探索扩散生成模型中的时间条件:从离散噪声数据流形的角度

Liuzhuozheng Li, Zhiyuan Zhan, Shuhong Liu, Dengyang Jiang, Zanyi Wang, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * SGIT AI Lab(SGIT人工智能实验室) UTokyo(东京大学) HKUST(香港科技大学) UCSD(加州大学圣地亚哥分校) ZJUT(浙江工业大学) Baidu(百度) RIKEN AIP(日本理化学研究所AIP)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从几何视角重新审视扩散模型中的时间条件作用,发现高维空间中噪声分布集中在低维流形上,通过调整DDIM前向过程并结合流匹配方法,证明无需时间条件即可生成高质量内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26783 2026-04-29 cs.CV cs.AI 79%

Can We Change the Stroke Size for Easier Diffusion?

我们能否通过改变笔触大小来使扩散更简单?

Yunwei Bai, Ying Kiat Tan, Yao Shu, Tsuhan Chen

机构 * National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究通过控制笔触大小改变监督目标的粗糙度,以缓解低信噪比下的预测挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04682 2026-04-29 cs.CV 79%

HATIR: Heat-Aware Diffusion for Turbulent Infrared Video Super-Resolution

HATIR: 用于湍流红外视频超分辨率的热感知扩散

Yang Zou, Xingyue Zhu, Kaiqi Han, Jun Ma, Xingyuan Li, Zhiying Jiang, Jinyuan Liu

机构 * Northwestern Polytechnical University(西北工业大学) Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) Dalian Maritime University(大连海事大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HATIR通过热感知变形先验联合建模湍流退化与结构细节损失,提出相位引导流估计器和湍流感知解码器,构建首个湍流红外视频超分辨率数据集FLIR-IVSR,提升非均匀退化下的结构恢复精度。

Journal ref Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25852 2026-04-29 math.NA cs.NA 78%

Efficient boundary elements for the Smoluchowski diffusion equation

高效的Smoluchowski扩散方程边界元法

Ignacio Labarca-Figueroa, Heiko Gimperlein

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出高效的频域边界元方法,用于求解具有非常数、无界系数的Smoluchowski扩散方程,通过傅里叶积分近似基本解和近场奇异性处理,提升计算精度与效率。

Comments 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12326 2026-04-29 math.PR math.CO 78%

Diffusion limited aggregation in the layers model

分层模型中的扩散限制聚集体

Colin Cooper, Alan Frieze

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究了有限图上扩散限制聚集体过程,确定了不同图类的结束时间,并证明最终聚集体中连接源和汇的子组件本质上是唯一路径。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25266 2026-04-29 math.AP 78%

Uniqueness of simultaneous reconstruction of general space- and time-dependent sources and initial states in fractional diffusion equations and systems from single boundary measurements

分数扩散方程及系统中一般空间-时间依赖源与初始状态同时重构的唯一性

Jaan Janno

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了从边界测量确定分数扩散方程中一般空间-时间依赖源和初始状态的逆问题,证明了当分数导数阶数为无理数时的唯一性,并推广到耦合分数扩散方程系统中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25013 2026-04-29 astro-ph.SR math-ph math.MP 78%

The Singular Behaviour of Ambipolar Diffusion Revealed by 1D Cartesian Solutions

双极扩散的奇异行为通过1D笛卡尔解被揭示

F. Moreno-Insertis, E. R. Priest, D. Nóbrega-Siverio

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究双极扩散在零点附近的1D笛卡尔解,分析非线性本征模,提出MHD代码中双极扩散求解器的测试方法。

Comments Accepted for publication in Astronomy + Astrophyics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24832 2026-04-29 cs.LG cs.AI 78%

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04973 2026-04-29 stat.ML cs.LG cs.SD 78%

StrADiff: A Structured Source-Wise Adaptive Diffusion Framework for Linear and Nonlinear Blind Source Separation

StrADiff:一种结构化的源级自适应扩散框架用于线性和非线性盲源分离

Yuan-Hao Wei

机构 * PolyU

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 StrADiff通过结构化源级自适应扩散框架实现无监督盲源分离,无需监督标签或后处理,联合优化源生成、结构正则化和观测空间重构,展示在线性和非线性混合中的稳定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20645 2026-04-29 cs.LG 78%

Diffusion Model for Manifold Data: Score Decomposition, Curvature, and Statistical Complexity

流形数据的扩散模型:分数分解、曲率与统计复杂性

Zixuan Zhang, Kaixuan Huang, Tuo Zhao, Mengdi Wang, Minshuo Chen

机构 * Georgia Tech(佐治亚理工学院) Princeton University(普林斯顿大学) Northwestern University(西北大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究扩散模型如何学习流形数据,通过分析分数函数的分解和曲率影响,提出高效的神经网络近似方法,并推导出基于数据内在维度和曲率的统计学习率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20092 2026-04-29 cs.LG 78%

How Out-of-Equilibrium Phase Transitions can Seed Pattern Formation in Trained Diffusion Models

非平衡相变如何在训练的扩散模型中引发图案形成

Luca Ambrogioni

机构 * Radboud University(拉德堡德大学) Donders Institute for Brain, Cognition, and Behaviour(多恩斯脑、认知与行为研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了训练扩散模型中图案形成的机制,发现非平衡相变驱动了低频模式的不稳定,从而组织噪声形成有序图案,通过理论框架和实验验证了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06398 2026-04-29 cond-mat.mtrl-sci 78%

Reaction-Diffusion Driven Patterns in Immiscible Alloy Thin Films

不可混合金合金薄片中的反应-扩散驱动图案

Vivek C. Peddiraju, Shourya Dutta-Gupta, Subhradeep Chatterjee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过银铜薄片与基板相互作用调控其微结构,揭示了'光环'现象及生长机制,提出半解析动力学模型解释产物和光环的生长行为。

Comments 35 pages, 20 figures (including supplementary information)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16956 2026-04-29 math.AP math-ph math.MP 78%

Distortion of charge distribution due to internal electric fields described by the drift-diffusion semiconductor model

由于内部电场引起的电荷分布畸变问题:基于漂移扩散半导体模型

Masakazu Yamamoto

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究漂移扩散方程的初值问题,揭示内部电场对电荷分布对称性和尺度的扭曲影响,提出更强大的非线性结果。

Comments 7 pages

Journal ref Z. Angew. Math. Phys. 77 (2026), 148

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08764 2026-04-29 physics.optics 78%

Ultrafast Pulse Retrieval from Partial FROG Traces Using Implicit Diffusion Models

从部分FROG轨迹中快速恢复超快脉冲

Abhimanyu Borthakur, Jack Eden Hirschman, Sergio Carbajo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于隐式扩散模型的FROG轨迹恢复方法,有效处理低采样率下的超快脉冲强度和相位恢复,优于传统CNN和序列模型,在准确性和效率上表现优异。

Comments Frontiers and Optics and Laser Science 2025, Denver, Colorado Winner: 2025 Emil Wolf Outstanding Student Paper Competition; In Review (SPIE Advanced Photonics Nexus)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04470 2026-04-29 eess.SY cs.SY 78%

A Diffusion-based Generative Machine Learning Paradigm for Dynamic Contingency Screening

基于扩散的生成式机器学习范式用于动态 contingency 分析

Quan Tran, Suresh S. Muknahallipatna, Dongliang Duan, Nga Nguyen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于扩散的生成式机器学习方法,用于动态 contingency 分析,通过预测最可能的critical contingencies来提高实时安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02964 2026-04-29 cs.LG stat.CO 78%

Injecting Measurement Information Yields a Fast and Noise-Robust Diffusion-Based Inverse Problem Solver

注入测量信息获得一种快速且噪声鲁棒的基于扩散的逆问题求解器

Jonathan Patsenker, Henry Li, Myeongseob Ko, Ruoxi Jia, Yuval Kluger

机构 * Yale University(耶鲁大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过估计条件后验均值来解决逆问题,采用轻量级单参数最大似然估计,实现快速且内存高效的求解器,并展示在多个数据集上优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25128 2026-04-29 cs.CV 77%

ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent

ResetEdit: 通过可重置的起始潜在实现生成图像的精确文本引导编辑

Hanyi Wang, Han Fang, Zheng Wang, Shilin Wang, Ee-Chien Chang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(科学技术大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);分类 cs.CV

AI总结 本文提出ResetEdit框架,通过在生成过程中嵌入可恢复的潜在信息,实现高精度文本引导编辑,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24885 2026-04-29 cs.CV cs.LG 70%

VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

VibeToken: 1D图像分词器和自回归模型的扩展以实现动态分辨率生成

Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

机构 * Arizona State University(亚利桑那州立大学) SonyAI(索尼人工智能)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VibeToken,一种高效的自回归图像合成方法,支持任意分辨率和纵横比,通过动态序列生成实现高效性能平衡。VibeToken-Gen在低计算资源下生成高质量图像,相比传统扩散模型更高效。

Comments Accepted at CVPR'26 | Project Page: https://github.com/SonyResearch/VibeToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV 57%

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22990 2026-04-29 cs.CV cs.AI 57%

Hard to See, Hard to Label: Generative and Symbolic Acquisition for Subtle Visual Phenomena

难以察觉,难以标注:生成与符号获取用于微妙的视觉现象

Renjith Prasad, Rishabh Sharma, Andrew E. Shao, Annmary Justine Koomthanam, Shreyas Kulkarni, Suparna Bhattacharya, Martin Foltin, Amit Sheth, David Orozco, Matthew Quinn, Brian Sammuli

机构 * University of South Carolina(南卡罗来纳大学) AI Research Lab, HPE Labs, Hewlett Packard Enterprise(HPE实验室人工智能研究部) Indian AI Research Organization(印度人工智能研究组织) General Atomics(通用原子公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GSAL框架,结合生成模型与语义覆盖先验,解决细微视觉异常标注难题,提升稀有类别检索效率。

Comments Accepted at CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14183 2026-04-29 cs.CV 57%

UniSER: A Foundation Model for Unified Soft Effects Removal

UniSER:一个用于统一软效果去除的基础模型

Jingdong Zhang, Lingzhi Zhang, Qing Liu, Mang Tik Chiu, Connelly Barnes, Yizhou Wang, Haoran You, Xiaoyang Liu, Yuqian Zhou, Zhe Lin, Eli Shechtman, Sohrab Amirghodsi, Xin Li, Wenping Wang, Xiaohang Zhan

机构 * Texas A&M University(德克萨斯农工大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 UniSER通过构建大规模数据集和定制训练流程,提出统一软效果去除模型,实现对多种软效果的鲁棒高保真修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09981 2026-04-29 cs.CV cs.RO 57%

ReSim: Reliable World Simulation for Autonomous Driving

ReSim:面向自动驾驶的可靠世界模拟

Jiazhi Yang, Kashyap Chitta, Shenyuan Gao, Long Chen, Yuqian Shao, Xiaosong Jia, Hongyang Li, Andreas Geiger, Xiangyu Yue, Li Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) OpenDriveLab at Shanghai AI Lab(上海人工智能实验室OpenDrive实验室) NVIDIA Research(NVIDIA研究) Xiaomi EV(小米电动车) Shanghai Jiao Tong University(上海交通大学) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) HKUST(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ReSim模型,通过整合真实数据与模拟数据提升自动驾驶场景模拟的可靠性与可控性,提升规划和策略选择性能。

Comments NeurIPS 2025 Spotlight. Project page: https://opendrivelab.com/ReSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25864 2026-04-29 quant-ph 50%

Quantum limit cycles with continuous symmetries from coherent parametric driving: exact solutions and many-body extensions

具有连续对称性的量子极限环:从相干参数驱动出发的精确解及多体扩展

Sihan Chen, Aashish A. Clerk

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了基于相干参数驱动的多模玻色子极限环模型,该模型具有O(N)连续对称性,能够精确求解量子耗散稳态,展现丰富的物理特性,如稳态纠缠、相位扩散减少及量子极限环的实现。

Comments 12 + 12 pages, 3 + 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25745 2026-04-29 cond-mat.stat-mech cond-mat.soft 50%

Universal transport of active colloids with sensory delay in motility landscapes

具有感知延迟的活性胶体在运动景观中的普遍传输

Adrià Garcés, Ueli Töpfer, Lucio Isa, Demian Levis, Ignacio Pagonabarraga

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了具有感知延迟的活性胶体在运动景观中的扩散传输,通过动态随机切换过程替代自推进速度的空间依赖性,推导出均方位移和有效扩散系数的解析结果,揭示了密度模式和有效扩散的普适标度形式。

详情

展开后加载摘要…

URL PDF HTML 收藏