arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-24 至 2026-03-24 共收录 145 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 97 篇

2603.20930 2026-03-24 cs.LG cs.AI cs.IT math.IT 78%

Causally-Guided Diffusion for Stable Feature Selection

基于因果引导的扩散模型稳定特征选择

Arun Vignesh Malarkkan, Xinyuan Wang, Kunpeng Liu, Denghui Zhang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克雷默斯大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出CGDFS方法,通过因果引导扩散模型实现稳定特征选择,提升模型在分布变化下的鲁棒性与泛化能力。

Comments 8 pages + references + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20902 2026-03-24 physics.geo-ph 78%

Virtual receiver functions via conditional diffusion transformers for robust crustal imaging

通过条件扩散变换器生成虚拟接收函数以实现稳健的地壳成像

Tiente R. Koireng, Priyanshu Gupta, Pawan Bharadwaj

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用条件扩散模型生成高质量虚拟接收函数,以解决接收函数受噪声和源信号干扰导致的成像问题,并在合成数据和实际应用中验证了其有效性。

Comments submitted to JGR: Solid Earth

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20710 2026-03-24 math-ph math.MP 78%

Vertex Centrality Reconstruction in an Inverse Problem for Information Diffusion

顶点中心性重构:信息扩散中的反问题

Yixian Gao, Songshuo Li, Yang Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过随机游走模型重构顶点中心性,提出基于边界控制方法的直接算法,验证了其在小图中的有效性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20700 2026-03-24 eess.IV cs.LG 78%

mmWave-Diffusion:A Novel Framework for Respiration Sensing Using Observation-Anchored Conditional Diffusion Model

毫米波扩散:一种基于观测锚定条件扩散模型的呼吸感知新框架

Yong Wang, Qifan Shen, Bao Zhang, Zijun Huang, Chengbo Zhu, Shuai Yao, Qisong Wu

机构 * Key Laboratory of Underwater Acoustic Signal Processing of Ministry of Education, Southeast University, Nanjing, 211189, China(教育部水下声学信号处理重点实验室,东南大学,南京,211189,中国) Purple Mountain Laboratories, Nanjing, 211111, China(紫金山实验室,南京,211111,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出mmWave-Diffusion框架,通过观测锚定条件扩散模型消除微运动干扰,实现呼吸信号的高精度重建与估计。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00761 2026-03-24 cs.LG 78%

A Probabilistic Approach to Wildfire Spread Prediction Using a Denoising Diffusion Surrogate Model

基于去噪扩散替代模型的 wildfire 传播预测概率方法

Wenbo Yu, Anirbit Ghosh, Tobias Sebastian Finn, Rossella Arcucci, Marc Bocquet, Sibo Cheng

机构 * CEREA, ENPC, EDF R&D, Institut Polytechnique de Paris(CEREA、ENPC、EDF R&D、巴黎理工学院) Department of Earth Science & Engineering, Imperial College London(帝国理工学院伦敦地球科学与工程系) Department of Computing, Imperial College London(帝国理工学院伦敦计算机科学系) Data Science Institute, Imperial College London(帝国理工学院伦敦数据科学研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出首个去噪扩散模型用于预测野火传播,通过模拟多种可能场景,考虑野火动态的不确定性,优于传统确定性方法。

Journal ref Geosci. Model Dev., 19, 1027-1054, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20466 2026-03-24 cs.CL cs.AI 78%

Diffutron: A Masked Diffusion Language Model for Turkish Language

Diffutron:一种针对土耳其语言的掩码扩散语言模型

Şuayp Talha Kocabay, Talha Rüzgar Akkuş

机构 * Hugging Face

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Diffutron,一种专为土耳其语言设计的掩码扩散语言模型,通过高效训练流程和分阶段指令微调,实现了紧凑模型在土耳其语言生成任务中的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13322 2026-03-24 cs.SI cs.CY physics.soc-ph 78%

Community notes reduce engagement with and diffusion of false information online

社区注释减少在线虚假信息的参与度和扩散

Isaac Slaughter, Axel Peytavin, Johan Ugander, Martin Saveski

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了社区注释对虚假信息参与度和扩散的影响,发现注释显著降低了虚假信息的传播和互动,通过合成控制法估计了不同指标的减少比例。

Comments Accepted for publication in the Proceedings of the National Academy of Sciences. Changes from prior arXiv version: title updated in response to reviewer comment; added robustness checks, permutation test, and expanded discussion; corrected software issue, leading to changes in magnitude of unconditional average effects by no more than 8% (no changes to statistical significance or direction)

Journal ref Proc. Natl. Acad. Sci. USA 122(38), e2503413122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11289 2026-03-24 cs.CV cs.MM 76%

UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer

UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画

Xiang Wang, Shiwei Zhang, Longxiang Tang, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV、cs.MM

AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。

Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22027 2026-03-24 cs.CV 70%

Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models

在推理过程中调整现实世界图像恢复:一种适用于流匹配模型的测试时间缩放范式

Purui Bai, Junxian Duan, Pin Wang, Jinhua Hao, Ming Sun, Chao Zhou, Huaibo Huang

机构 * MAIS \& NLPR, Institute of Automation, Chinese Academy of Sciences, China Kuaishou Tech, China

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出ResFlow-Tuner框架,基于FLUX.1-dev模型,结合多模态融合与测试时间缩放,实现高质量图像恢复。通过奖励模型动态调整去噪方向,提升性能并控制计算开销,实验表明其在多个基准上达到最优。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22283 2026-03-24 cs.CV cs.AI cs.GR cs.LG 62%

End-to-End Training for Unified Tokenization and Latent Denoising

端到端训练用于统一的标记化和潜在去噪

Shivam Duggal, Xingjian Bai, Zongze Wu, Richard Zhang, Eli Shechtman, Antonio Torralba, Phillip Isola, William T. Freeman

机构 * Massachusetts Institute of Technology(麻省理工学院) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出UNITE模型,通过端到端训练实现统一的标记化和潜在扩散,无需对抗损失或预训练编码器,在图像和分子领域达到接近SOTA的性能。

Comments First two authors contributed equally. Project: https://xingjianbai.com/unite-tokenization-generation/ Code: https://github.com/ShivamDuggal4/UNITE-tokenization-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22286 2026-03-24 cs.CV cs.AI cs.CL cs.LG 57%

WorldCache: Content-Aware Caching for Accelerated Video World Models

WorldCache: 用于加速视频世界模型的内容感知缓存

Umair Nawaz, Ahmed Heakl, Ufaq Khan, Abdelrahman Shaker, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 WorldCache通过引入运动自适应阈值、显著性加权漂移估计和最优近似方法,实现动态场景下的高效特征重用,提升推理速度并保持高质量。

Comments 33 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21557 2026-03-24 cs.CV 57%

From Part to Whole: 3D Generative World Model with an Adaptive Structural Hierarchy

从部分到整体:具有自适应结构层次的3D生成世界模型

Bi'an Du, Daizong Liu, Pufan Li, Wei Hu

机构 * Wangxuan Institute of \ Technology, Peking University Beijing, China Institute for Math \& AI, Wuhan University Wuhan, China

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种自适应部分-整体层次的3D生成世界模型,通过直接从图像令牌推断出软且组合性的掩码,自主发现潜在结构槽,实现跨类别的形状共享和去噪。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17779 2026-03-24 cs.CV 57%

CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image

CrowdGaussian:从单张图像重建高保真的人类人群3D高斯

Yizheng Song, Yiyu Zhuang, Qipeng Xu, Haixiang Wang, Jiahe Zhu, Jing Tian, Siyu Zhu, Hao Zhu

机构 * Nanjing University, China(南京大学) Fudan University, China(复旦大学) State Key Laboratory of Novel Software Technology, China(新型软件技术国家重点实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CrowdGaussian框架,通过单张图像直接重建多人3D高斯点云,解决遮挡、低清晰度和多样外观等挑战,实验表明其能生成逼真且几何一致的多人场景重建。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23956 2026-03-24 cs.CV 57%

SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

SwitchCraft: 无需训练的多事件视频生成与注意力控制

Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang

机构 * Westlake University(西湖大学) Duke Kunshan University(杜克-昆山大学) The University of Queensland(昆士兰大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SwitchCraft通过引入事件对齐查询引导和自动平衡强度求解器,提升多事件视频生成的提示对齐、事件清晰度和场景一致性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04090 2026-03-24 cs.CV 57%

Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction

Gen3R:3D场景生成与前馈重建的结合

Jiaxin Huang, Yuanbo Yang, Bangbang Yang, Lin Ma, Yuewen Ma, Yiyi Liao

机构 * Zhejiang University(浙江大学) ByteDance Project(字节跳动项目)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Gen3R通过结合基础重建模型的强先验与视频扩散模型,实现3D场景生成,生成RGB视频及3D几何数据,实验显示其在单图和多图条件下达到SOTA结果。

Comments Project page: https://xdimlab.github.io/Gen3R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09278 2026-03-24 cs.CV 57%

LoGoColor: Local-Global 3D Colorization for 360° Scenes

LoGoColor: 本地-全局 3D 色彩化用于 360 度场景

Yeonjin Chang, Juhwan Cho, Seunghyeon Seo, Wonsik Shin, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 LoGoColor 方法,通过本地-全局策略生成一致的 3D 色彩化结果,提升复杂 360 度场景的色彩多样性与一致性。

Comments Project page is available at: https://yeonjin-chang.github.io/LoGoColor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13617 2026-03-24 cs.CV 57%

Let Synthetic Data Shine: Domain Reassembly and Soft-Fusion for Single Domain Generalization

让合成数据发光:单域泛化中的领域重组与软融合

Hao Li, Yubin Xiao, Ke Liang, Mengzhu Wang, Long Lan, Kenli Li, Xinwang Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DRSF框架,通过领域重组与软融合处理合成数据与真实目标域之间的分布偏差,提升单域泛化性能,适用于图像分类、目标检测和语义分割。

Comments 26 pages, 10 figures (Accepted by IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21366 2026-03-24 cs.CV 57%

Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation

放松强制:用于一致长视频生成的放松KV内存

Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学) Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Relax Forcing机制,通过结构化时间内存提升长视频生成的运动动态和时间一致性,减少注意力开销。

Comments Project page: see https://zengqunzhao.github.io/Relax-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14188 2026-03-24 cs.CV 57%

Joint Segmentation and Grading with Iterative Optimization for Multimodal Glaucoma Diagnosis

多模态青光眼诊断的联合分割与分级迭代优化方法

Zhiwei Wang, Yuxing Li, Meilu Zhu, Defeng He, Edmund Y. Lam

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong, China(香港大学电子与电气工程系) College of Information Engineering, Zhejiang University of Technology, Hangzhou, China(浙江工业大学信息工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种迭代多模态优化模型,通过中层融合策略整合眼底和OCT特征,并利用跨模态特征对齐模块减少模态差异,实现青光眼的精确分割与分级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13157 2026-03-24 cs.CV cs.AI 57%

Intrinsic Image Fusion for Multi-View 3D Material Reconstruction

多视角3D材质重建的内在图像融合

Peter Kocsis, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出内在图像融合方法,通过多视角图像重建高质量物理材质。引入单视角先验约束优化过程,利用扩散基材质估计器生成多个不一致候选分解,并通过鲁棒优化框架融合最一致的预测,最终优化低维参数,提升材质分离质量。

Comments Project page: https://peter-kocsis.github.io/IntrinsicImageFusion/ Video: https://www.youtube.com/watch?v=-Vs3tR1Xl7k

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21923 2026-03-24 eess.SP 50%

APEG: Adaptive Physical Layer Authentication with Channel Extrapolation and Generative AI

APEG:基于信道外推和生成式人工智能的自适应物理层认证

Xiqi Cheng, Rui Meng, Xiaodong Xu, Haixiao Gao, Ping Zhang, Dusit Niyato

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出APEG,通过生成式人工智能生成信道状态信息指纹,提升动态环境下的身份验证鲁棒性,采用CCMDM和CADM模型优化信道指纹生成精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21871 2026-03-24 cs.IR cs.SI 50%

GoogleTrendArchive: A Year-Long Archive of Real-Time Web Search Trends Worldwide

GoogleTrendArchive:全球实时网络搜索趋势一年期档案

Aleksandra Urman, Anikó Hannák, Joachim Baumann

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出GoogleTrendArchive数据集,包含一年内125个国家1358个地点的实时搜索趋势数据,通过捕捉实时搜索激增现象,为研究集体注意力动态提供系统分析工具。

Comments Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21834 2026-03-24 math.OC 50%

A hybrid wavelet-based physics-informed neural network for portfolio management

一种基于小波的混合物理信息神经网络用于投资组合管理

Bahadur Yadav, Mahaprasad Mohanty, Ratikanta Behera, Sanjay Kumar Mohanty

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于小波的混合物理信息神经网络框架,用于投资组合管理,通过简化系数优化策略和高效FFT计算,实现了高精度和鲁棒性的衍生品定价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21761 2026-03-24 physics.flu-dyn 50%

A Lego Block Approach to Flow in Complex Microfluidic Networks

为复杂微流体网络流动提供乐高积木方法

Etienne Boulais, Richard D. Braatz

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种利用Schwarz-Christoffel映射和集成电路分析启发的分段技术,构建分析解的乐高积木方法,用于复杂微流体网络和平面无序介质的流动建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21690 2026-03-24 cs.AI econ.GN q-fin.EC 50%

AI Token Futures Market: Commoditization of Compute and Derivatives Contract Design

AI 令牌期货市场:计算资源的商品化与衍生品合约设计

Yicai Xing

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文分析AI令牌作为新商品的属性,提出标准化令牌期货合约设计,通过模型和模拟评估其对计算成本波动的抑制效果,探讨GPU计算期货的可行性及监管框架。

Comments 16 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21546 2026-03-24 cs.LG cs.AI 50%

What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators

世界模型在强化学习中学习了什么?在学习的环境模拟器中探测潜在表示

Xinyu Zhang

机构 * Anyscale

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过线性与非线性探针、因果干预和注意力分析,探讨了IRIS和DIAMOND两种架构的世界模型对游戏状态的内部表示,发现其具有近似线性的结构化表示。

Comments 5 pages, 3 figures, 1 table

Journal ref ICLR 2026 the 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11843 2026-03-24 cond-mat.mtrl-sci 50%

Self-organized defect-phases along dislocations in irradiated alloys

辐照合金中位错线上自组织缺陷相的形成

N. Saunders, R. S. Averback, P. Bellon

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究离子辐照下位错线上析出物的非平衡偏析形成的图案化现象,通过晶格动力学蒙特卡洛模拟揭示了溶质在位错上的输运竞争对自组织纳米结构稳定性的贡献。

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08104 2026-03-24 nlin.CD cs.AI 50%

High-Fidelity Modeling of Stochastic Chemical Dynamics on Complex Manifolds: A Multi-Scale SIREN-PINN Framework for the Curvature-Perturbed Ginzburg-Landau Equation

高保真建模随机化学动力学在复杂流形上:一种多尺度SIREN-PINN框架用于曲率扰动的Ginzburg-Landau方程

Julian Evan Chrisnanto, Salsabila Rahma Alia, Nurfauzi Fadillah, Yulison Herry Chrisnanto

机构 * Department of Bio-Functions and Systems Science(生物功能与系统科学系) Graduate School of Bio-Applications and Systems Engineering(生物应用与系统工程研究生院) Department of Mathematics(数学系) Faculty of Mathematics and Natural Sciences(数学与自然科学学院) Universitas Padjadjaran(万隆大学) Department of Informatics(信息系) Faculty of Science and Informatics(科学与信息学院) Jenderal of Achmad Yani University(阿赫马德·亚尼大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出多尺度SIREN-PINN框架,用于在复杂流形上高保真建模随机化学动力学,通过解决逆pinning问题,实现对隐藏高斯曲率场的重建,并展示其在湍流化学反应器中的应用。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17654 2026-03-24 astro-ph.CO gr-qc hep-ph hep-th 50%

Calculating the power spectrum in stochastic inflation by Monte Carlo simulation and least squares curve fitting

通过蒙特卡洛模拟和最小二乘曲线拟合计算随机膨胀中的功率谱

Koichi Miyamoto, Yuichiro Tada

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于蒙特卡洛模拟和最小二乘拟合的新方法,用于计算随机膨胀中的功率谱,通过减少计算成本提高效率。

Comments 28 pages, 4 figures

Journal ref JCAP 03 (2026) 060

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03987 2026-03-24 physics.flu-dyn nlin.CD physics.app-ph physics.bio-ph 50%

Vortex transition and thermal mixing by pitching a perforated flexible panel

旋涡转变与热混合:通过 pitching 一个孔隙率的柔性面板

Yicong Fu, Zhengyang Liu, Samir Tandon, Jake Gelfand, Sunghwan Jung

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了柔性孔隙面板的主动 pitching 运动对热混合和旋涡转变的影响,通过实验和半经验模拟揭示了运动学、孔隙率和柔性的作用。

Comments 35 pages, 18 figures, 1 table. Submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏