arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-31 至 2026-03-31 共收录 119 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 119 篇

2603.28405 2026-03-31 cs.CV cs.AI 88%

EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation

EdgeDiT:面向边缘设备的高效扩散变换器

Sravanth Kodavanti, Manjunath Arveti, Sowmya Vajrala, Srinivas Miriyala, Vikram N R

机构 * Samsung Research Institute Bangalore, India(三星研究所班加罗尔)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出EdgeDiT,一种为移动端NPU优化的高效生成变换器,通过硬件感知优化减少参数和计算量,提升边缘设备图像生成效率。

Comments Accepted at the Mobile AI Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26834 2026-03-31 eess.IV cs.AI cs.CV 85%

Hybrid Diffusion Model for Breast Ultrasound Image Augmentation

混合扩散模型用于乳腺超声图像增强

Farhan Fuad Abir, Sanjeda Sara Jennifer, Niloofar Yousefi, Laura J. Brattain

机构 * University of Central Florida(中佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出混合扩散框架,结合文本生成与图像精修提升超声图像真实性,通过LoRA和文本倒置优化,降低FID值,提升分类性能。

Comments Accepted at IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07455 2026-03-31 cs.CV cs.AI cs.CL cs.GR 84%

Image Generation Models: A Technical History

图像生成模型:技术史

Rouzbeh Shirvani

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了过去十年图像生成模型的快速发展,涵盖VAEs、GANs、正常化流、自回归和Transformer模型以及扩散方法,分析其技术原理、训练方法及局限性,并讨论视频生成和模型鲁棒性等最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28763 2026-03-31 cs.CV 83%

PoseDreamer: Scalable and Photorealistic Human Data Generation Pipeline with Diffusion Models

PoseDreamer:基于扩散模型的可扩展且逼真的人体数据生成管道

Lorenza Prospero, Orest Kupyn, Ostap Viniavskyi, João F. Henriques, Christian Rupprecht

机构 * The Podium Institute for Sports Medicine and Technology, University of Oxford(牛津大学体育医学与技术讲台研究所) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出PoseDreamer,通过扩散模型生成大规模合成数据,结合可控图像生成与偏好优化,提升3D人体数据质量与多样性,实现比传统合成数据更高的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15288 2026-03-31 cs.CV 83%

APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping

APPLE:基于扩散模型的属性保留伪标签面部交换

Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) SAMSUNG(三星)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出APPLE框架,通过条件去模糊和属性感知反向方案提升面部交换中属性保留能力,实现高保真属性与身份转移。

Comments Accepted at CVPR 2026. Project Page: https://cvlab-kaist.github.io/APPLE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27637 2026-03-31 cs.CV 83%

OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

OPRO:用于面板感知上下文图像生成的正交面板相对运算符

Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。

Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28209 2026-03-31 cs.SD 82%

On the Usefulness of Diffusion-Based Room Impulse Response Interpolation to Microphone Array Processing

扩散基房间脉冲响应插值在微电极阵列处理中的实用性

Sagi Della Torre, Mirco Pezzoli, Fabio Antonacci, Sharon Gannot

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 本文探讨了扩散基插值在多麦克风阵列处理中的应用,验证了其在真实房间脉冲响应插值中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13213 2026-03-31 stat.ML cs.LG 82%

Diffusion Models with Double Guidance: Generate with aggregated datasets

具有双重引导的扩散模型:利用聚合数据集生成

Yanfeng Yang, Kenji Fukumizu

机构 * Graduate University of Advanced Studies (SOKENDAI), Kanagawa, Japan(综合研究大学院大学(SOKENDAI),神奈川,日本) The Institute of Statistical Mathematics, Tokyo, Japan(统计数理研究所,东京,日本)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出一种新的扩散模型,通过双重引导实现精确条件生成,即使训练数据中没有同时包含所有条件。在分子和图像生成任务中,该方法在对齐目标条件分布和缺失条件控制方面优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28114 2026-03-31 cs.CV cs.LG 79%

Attention Frequency Modulation: Training-Free Spectral Modulation of Diffusion Cross-Attention

注意力频率调制:无训练的扩散交叉注意力频谱调制

Seunghun Oh, Unsang Park

机构 * Sogang University(西江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AFM,通过频域调整交叉注意力logits,实现无训练的注意力频谱控制,实验证明能有效编辑图像内容并保持语义一致性。

Comments 16 pages; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26068 2026-03-31 cs.CV 79%

PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery

PAD-Hand: 基于物理的扩散方法用于手部运动恢复

Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

机构 * Michigan State University(密歇根州立大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种物理感知的条件扩散框架,通过MeshCNN-Transformer架构,利用欧拉-拉格朗日动力学提升手部运动的物理一致性,并通过方差估计增强运动的可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23165 2026-03-31 cs.CV 79%

DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

DyaDiT:一种多模态扩散变换器,用于生成社会有利的双人手势

Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kris Kitani

机构 * Institute of Science Tokyo(东京科学大学) UNIST(蔚山科学技术院) Shanda AI Research Tokyo(盛大人工智能研究院东京) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DyaDiT通过多模态扩散变换器生成适合社会互动的双人手势,利用双人音频信号和社交上下文令牌,融合双方信息并编码运动先验,实现更自然的交互。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14959 2026-03-31 cs.CV 79%

Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

迈向视频帧插值的整体建模:具有自回归扩散变换器的局部扩散强制

Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LDF-VFI方法,通过自回归扩散变换器建模整个视频序列,结合跳连采样策略和稀疏注意力机制,提升视频帧插值的时序一致性和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12554 2026-03-31 cs.CV 79%

Multimodal Graph Network Modeling for Human-Object Interaction Detection with PDE Graph Diffusion

基于PDE图扩散的多模态图网络建模用于人-物交互检测

Wenxuan Ji, Haichao Shi, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于PDE图扩散的多模态图网络模型,通过四阶段图结构建模人-物交互任务,利用白盒PDE扩散方程实现信息传播,并引入变分信息挤压机制优化CLIP提取的多模态特征,实验表明在HICO-DET和V-COCO基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 79%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27371 2026-03-31 cs.CV 79%

HMPDM: A Diffusion Model for Driving Video Prediction with Historical Motion Priors

HMPDM:一种利用历史运动先验的扩散模型用于驾驶视频预测

Ke Li, Tianjia Yang, Kaidi Liang, Xianbiao Hu, Ruwen Qin

机构 * Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HMPDM模型,通过引入历史运动先验提升驾驶视频预测的时序一致性与视觉质量,实验表明其在Cityscapes和KITTI基准上优于现有方法,FVD指标提升28.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17388 2026-03-31 cs.CV 79%

Toward Phonology-Guided Sign Language Motion Generation: A Diffusion Baseline and Conditioning Analysis

迈向语音引导的手语动作生成:一种扩散基线与条件分析

Rui Hong, Jana Kosecka

机构 * George Mason University(乔治梅森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的基线方法,研究文本条件对手语动作生成的影响,发现将符号化标注转为自然语言是CLIP有效条件,T5不受影响,最佳变体在所有指标上优于现有方法。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08021 2026-03-31 cs.RO cs.CV 79%

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

AffordGrasp:跨模态扩散用于感知意识抓取合成

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AffordGrasp,通过跨模态扩散模型生成准确反映物体几何和用户指令的抓取姿态,提升AR/VR和具身AI中的手-物交互质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07775 2026-03-31 cs.CV 79%

Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

滚动汇:在有限时间训练和开放-ended测试之间架桥

Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。

Comments v5: Fix some typos. Figures were compressed to 150 dpi to comply with arXiv's submission size limit. Project page: https://rolling-sink.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC 79%

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21545 2026-03-31 cs.CV cs.LG 79%

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26827 2026-03-31 cs.LG cs.AI cs.CV 79%

Central-to-Local Adaptive Generative Diffusion Framework for Improving Gene Expression Prediction in Data-Limited Spatial Transcriptomics

面向数据有限空间转录组学的中心到局部自适应生成扩散框架:提升基因表达预测

Yaoyu Fang, Jiahe Qian, Xinkun Wang, Lee A. Cooper, Bo Zhou

机构 * Northwestern University(西北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出C2L-ST框架,通过结合大规模形态学先验与有限分子指导,解决空间转录组学数据稀缺问题,提升基因表达预测准确性与空间一致性。

Comments 31 pages, 12 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26767 2026-03-31 cs.CV 79%

A training-free framework for high-fidelity appearance transfer via diffusion transformers

无需训练的高保真外观迁移框架:通过扩散变换器

Shengrong Gu, Ye Wang, Song Wu, Rui Ma, Qian Wang, Lanjun Wang, Zili Yi

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of New Media and Communication, Tianjin University(天津大学新媒体与传播学院) JIUTIAN Research(九天研究院) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的扩散变换器框架,通过解耦结构与外观,利用高保真倒置建立内容先验,结合几何先验实现参考图像的动态融合,从而在结构保持和外观保真度上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26759 2026-03-31 cs.CV 79%

Physics-Aware Diffusion for LiDAR Point Cloud Densification

面向激光雷达点云密集化的物理感知扩散模型

Zeping Zhang, Robert Laganière

机构 * University of Ottawa(渥太华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Scanline-Consistent Range-Aware Diffusion模型,通过概率细化提升激光雷达点云密集度,以156ms实现高保真结果,采用Ray-Consistency损失和Negative Ray增强技术抑制物理幻觉,提升3D检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18050 2026-03-31 math.OC 78%

On the Controllability of a Fully Nonlocal Coupled Stochastic Reaction--Convection--Diffusion System

关于完全非局部耦合随机反应-对流-扩散系统的可控性

Abdellatif Elgrou, Federica Gregorio, Abdelaziz Rhandi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了一类完全非局部耦合随机反应-对流-扩散系统的可控性问题,通过引入三种控制策略,利用对偶论证和新的全局Carleman估计,证明了系统的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28600 2026-03-31 q-bio.NC 78%

A Normative Theory of Decision Making from Multiple Stimuli: The Contextual Diffusion Decision Model

基于多刺激的决策规范理论:情境扩散决策模型

Michael Shvartsman, Vaibhav Srivastava, Narayanan Sundaram, Jonathan D. Cohen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出情境扩散决策模型(CDDM),扩展了经典扩散决策模型(DDM),用于解释多种依赖情境的简单决策任务,同时通过规范分析探讨最优反应和记忆分配策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28478 2026-03-31 cs.CE 78%

Physics-Enforced Neural Ordinary Differential Equation for Chemical Kinetics Optimization in Reaction-Diffusion Systems

物理约束的神经普通微分方程用于反应扩散系统中的化学动力学优化

Feixue Cai, Hua Zhou, Zhuyin Ren

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种物理一致的扩散-化学耦合神经普通微分方程,用于优化反应扩散系统中的化学动力学,通过嵌入阿伦尼乌斯结构的反应神经元,实现直接梯度分析,提升计算效率和物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28350 2026-03-31 math.AP 78%

Inverse source problems with reduced interior data for a coupled reaction-diffusion system

反源问题与耦合反应扩散系统的缩减内部数据

Xinyue Luo, Masahiro Yamamoto, Jin Cheng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究了耦合反应扩散系统中确定未知源项的反源问题,利用Carleman估计建立了Lipschitz和Hölder稳定性估计,探讨了在保留唯一性和稳定性的情况下减少观测数据的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28037 2026-03-31 cs.LG 78%

Diffusion Maps is not Dimensionality Reduction

扩散映射不是降维

Julio Candanedo, Alejandro Patiño

机构 * Universidad Nacional de Colombia sede Manizales(哥伦比亚国立大学马尼萨莱斯分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过瑞士卷数据对比,指出扩散映射提供内在几何的谱表示而非完整图表方法,揭示其与Isomap和UMAP在低维重构中的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27878 2026-03-31 cond-mat.mtrl-sci 78%

On a relationship between grain boundary free energy, grain boundary segregation, and grain boundary diffusion

关于晶界自由能、晶界偏析与晶界扩散之间关系的探讨

Yuri Mishin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文重新推导了Borisov方程,修正了其中的错误并扩展了其应用范围,探讨了晶界自由能与扩散之间的关系及关键假设的验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21675 2026-03-31 astro-ph.CO gr-qc 78%

Unimodular Diffusion and Interacting Vacuum Cosmology

单模扩散与相互作用真空宇宙学

Gopal Kashyap, Naveen K. Singh

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了单模扩散宇宙学与相互作用暗物质模型之间的对应关系,通过超新星、DESI BAO、宇宙钟和CMB数据,发现真空耦合模型中ξ=-0.0197±0.0076,而物质耦合模型中ξ=0.0018,且在线性扰动下仅与均匀能量转移模型一致,影响结构增长。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏