arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2510.20093 2026-04-15 cs.CV cs.AI 83%

StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback

StableSketcher: 通过视觉问答反馈增强扩散模型以生成基于像素的素描

Jiho Park, Sieun Choi, Jaeyoon Seo, Jihie Kim

机构 * Dongguk University(东国大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StableSketcher框架,通过优化潜在解码和视觉问答反馈提升扩散模型生成手绘素描的逼真度和语义一致性。

Comments Under review at IEEE Access. Author-submitted preprint. Not the IEEE-published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12242 2026-04-13 cs.CV cs.AI cs.LG 83%

OmniPrism: Learning Disentangled Visual Concept for Image Generation

OmniPrism: 学习解耦的视觉概念用于图像生成

Yangyang Li, Daqing Liu, Wu Liu, Allen He, Xinchen Liu, Yongdong Zhang, Guoqing Jin

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 OmniPrism通过自然语言引导学习解耦的视觉概念表示,结合扩散模型生成高质量图像,解决多方面概念混淆问题。

Comments WebPage available at https://tale17.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08301 2026-04-10 cs.CV 83%

GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis

GroundingAnomaly: 基于空间的扩散用于少样本异常合成

Yishen Liu, Hongcang Chen, Pengcheng Zhao, Yunfan Bao, Yuxi Tian, Jieming Zhang, Hao Chen, Zheng Zhi, Yongchun Liu, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) Beijing Jiaotong University(北京交通大学) Li Auto(理想汽车) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出GroundingAnomaly框架,通过空间条件模块和门控自注意力模块实现精准异常合成,提升少样本异常检测性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07879 2026-04-10 cs.CV cs.AI 83%

FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding

FlowGuard: 通过线性潜在解码实现扩散模型生成过程中的轻量级安全检测

Jinghan Yang, Yihe Fan, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 FlowGuard通过线性近似和课程学习方法,在生成过程中检测不安全内容,提升扩散模型的安全性和效率,F1分数优于现有方法30%以上,同时显著降低GPU内存占用和投影时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04678 2026-04-10 cs.CV 83%

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06916 2026-04-09 cs.LG cs.AI cs.CV 83%

FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling

FP4探索,BF16训练:通过高效的回放缩放实现扩散强化学习

Yitong Li, Junsong Chen, Shuchen Xue, Pengcuo Zeren, Siyuan Fu, Dinghao Yang, Yangyang Tang, Junjie Bai, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达) HKU(香港大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Sol-RL框架,通过FP4量化与BF16训练结合,提升扩散模型的对齐性能,实现训练效率与精度的平衡,实验显示在多个指标上表现优异,训练收敛速度提升4.64倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06568 2026-04-09 eess.IV cs.CV 83%

A Noise Constrained Diffusion (NC-Diffusion) Framework for High Fidelity Image Compression

一种面向高保真图像压缩的噪声约束扩散(NC-Diffusion)框架

Zhenyu Du, Yanbo Gao, Shuai Li, Yiyang Li, Hui Yuan, Mao Ye

机构 * Shandong University(山东大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出噪声约束扩散框架,通过将量化噪声作为扩散过程中的噪声,提升压缩效率和图像保真度,同时引入自适应频域滤波模块和零样本引导增强方法,实验证明其优于现有方法。

Comments Accepted by IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17812 2026-04-09 cs.CV cs.AI cs.LG 83%

ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation

ChopGrad:通过截断反向传播实现基于像素的潜在视频扩散模型

Dmitriy Rivkin, Parker Ewen, Lili Gao, Julian Ost, Stefanie Walz, Rasika Kangutkar, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出ChopGrad,通过截断反向传播减少视频生成的内存消耗,实现高效的像素级损失微调,适用于视频超分辨率、修复和增强等任务。

Comments Project website: https://light.princeton.edu/chopgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15510 2026-04-09 cs.CV cs.RO 83%

Exploring Conditions for Diffusion models in Robotic Control

探索扩散模型在机器人控制中的条件

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) NAVER AI Lab(NAVER人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。

Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14685 2026-04-09 cs.CV cs.AI 83%

DiffSketcher: Text Guided Vector Sketch Synthesis through Latent Diffusion Models

DiffSketcher: 通过潜在扩散模型实现文本引导的向量草图合成

Ximing Xing, Chuang Wang, Haitao Zhou, Jing Zhang, Qian Yu, Dong Xu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiffSketcher,通过扩展的SDS损失优化贝塞尔曲线,实现从自然语言提示直接生成向量草图,提升生成质量与可控性。

Comments Accepted by NeurIPS 2023. Project page: https://ximinng.github.io/DiffSketcher-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05906 2026-04-08 cs.CV cs.AI 83%

Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation

选择性聚合注意力图提升基于扩散的视觉解释

Jungwon Park, Jungmin Ko, Dongnam Byun, Wonjong Rhee

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过选择性聚合相关注意力头提升文本到图像生成模型的可解释性,相比DAAM方法在均值IoU上表现更优,并发现相关注意力头能更准确捕捉概念特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05524 2026-04-08 cs.CV 83%

Cross-Resolution Diffusion Models via Network Pruning

通过网络剪枝实现跨分辨率扩散模型

Jiaxuan Ren, Junhan Zhu, Huan Wang

机构 * Westlake University(西湖大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CR-Diff方法,通过参数剪枝提升扩散模型在不同分辨率下的视觉一致性,保持默认分辨率性能,支持提示特定优化。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03674 2026-04-07 cs.CV 83%

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

DiffSparse: 通过学习的令牌稀疏性加速扩散变换器

Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(超威半导体公司) Tsinghua University(清华大学) BNRist(北京信息科学与技术国家研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiffSparse框架,通过学习令牌稀疏性优化扩散变换器的推理效率,减少计算成本并提升生成质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01514 2026-04-03 cs.CL cs.CV 83%

Why Instruction-Based Unlearning Fails in Diffusion Models?

为何基于指令的反学习在扩散模型中失效?

Zeliang Zhang, Rui Sun, Jiani Liu, Qi Wu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) UCLA(加州大学洛杉矶分校) UCSB(加州大学圣塔芭芭拉分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究探讨了基于指令的反学习在扩散模型中的有效性,发现扩散模型在仅依赖自然语言反学习指令时无法有效抑制目标概念,揭示了提示级指令的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12094 2026-04-02 cs.CV 83%

Error Propagation Mechanisms and Compensation Strategies for Quantized Diffusion

量化扩散模型中的误差传播机制与补偿策略

Songwei Liu, Chao Zeng, Chenqian Yan, Xurui Peng, Xing Wang, Fangmin Chen, Xing Mei

机构 * ByteDance Inc.(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于理论框架的误差传播建模与补偿策略,通过数学推导得到每一步量化误差传播方程,并在多个图像数据集上验证了该策略对误差传播的抑制效果,显著提升了PTQ方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-04-01 cs.CV cs.AI 83%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14157 2026-04-01 cs.CV cs.AI cs.LG 83%

When Test-Time Guidance Is Enough: Fast Image and Video Editing with Diffusion Guidance

测试时指导足矣:基于扩散指导的快速图像和视频编辑

Ahmed Ghorbel, Badr Moufad, Navid Bagheri Shouraki, Alain Oliviero Durmus, Thomas Hirtz, Eric Moulines, Jimmy Olsson, Yazid Janati

机构 * CMAP, Ecole Polytechnique(巴黎综合理工学院CMAP实验室) Institute of Foundation Models(基础模型研究所) MBZUAI(穆罕默德·本·扎耶德人工智能大学) EPITA(法国高等信息技术学院) Sorbonne University(索邦大学) Lagrange Mathematics and Computing Research Center(拉格朗日数学与计算研究中心) EPITA Research Lab(EPITA研究实验室) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过测试时指导实现高效的图像和视频编辑,理论分析并扩展了现有方法,证明测试时指导能与训练时方法媲美甚至超越。

Journal ref ICLR 2026, ReALM-GEN workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28763 2026-03-31 cs.CV 83%

PoseDreamer: Scalable and Photorealistic Human Data Generation Pipeline with Diffusion Models

PoseDreamer:基于扩散模型的可扩展且逼真的人体数据生成管道

Lorenza Prospero, Orest Kupyn, Ostap Viniavskyi, João F. Henriques, Christian Rupprecht

机构 * The Podium Institute for Sports Medicine and Technology, University of Oxford(牛津大学体育医学与技术讲台研究所) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出PoseDreamer,通过扩散模型生成大规模合成数据,结合可控图像生成与偏好优化,提升3D人体数据质量与多样性,实现比传统合成数据更高的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15288 2026-03-31 cs.CV 83%

APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping

APPLE:基于扩散模型的属性保留伪标签面部交换

Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) SAMSUNG(三星)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出APPLE框架,通过条件去模糊和属性感知反向方案提升面部交换中属性保留能力,实现高保真属性与身份转移。

Comments Accepted at CVPR 2026. Project Page: https://cvlab-kaist.github.io/APPLE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27637 2026-03-31 cs.CV 83%

OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

OPRO:用于面板感知上下文图像生成的正交面板相对运算符

Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。

Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06178 2026-03-30 cs.CV 83%

Making Training-Free Diffusion Segmentors Scale with the Generative Power

利用生成能力使免训练扩散分割器扩展

Benyuan Meng, Qianqian Xu, Zitai Wang, Xiaochun Cao, Longtao Huang, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Cyber Science and Tech., Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Alibaba Group(阿里巴巴集团) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Key Laboratory of Big Data Mining and Knowledge Management, CAS(中国科学院大数据挖掘与知识管理重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了如何通过提升扩散模型的生成能力来改进免训练的图像分割方法,提出自动聚合和像素级重缩放技术以解决注意力图与全局表示不一致及文本标记间得分不平衡的问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21419 2026-03-30 cs.LG cs.CV 83%

Revisiting Diffusion Model Predictions Through Dimensionality

通过维度性重新审视扩散模型预测

Qing Jin, Chaoyang Wang

机构 * Independent Researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过理论框架解释高维数据中直接预测数据优于噪声和速度预测的原因,并提出k-Diff框架自动学习最优预测参数以提升生成性能。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25194 2026-03-27 cs.CV 83%

CardioDiT: Latent Diffusion Transformers for 4D Cardiac MRI Synthesis

CardioDiT:用于4D心脏MRI合成的潜在扩散变换器

Marvin Seyfarth, Sarah Kaye Müller, Arman Ghanaat, Isabelle Ayx, Fabian Fastenrath, Philipp Wild, Alexander Hertel, Theano Papavassiliu, Salman Ul Hassan Dar, Sandy Engelhardt

机构 * Institute for Artificial Intelligence in Cardiovascular Medicine, Medical Faculty of Heidelberg University, Heidelberg University(海德堡大学医学院心血管医学人工智能研究所,海德堡大学) Department of Cardiology, Angiology, Pneumology, Heidelberg University Hospital(海德堡大学医院心脏病学、血管学、肺病学系) DZHK (German Centre for Cardiovascular Research), Partner Site Heidelberg/Mannheim(德国心血管研究中心(DZHK),海德堡/曼海姆合作站点) Department of Radiology and Nuclear Medicine, University Medical Center Mannheim(曼海姆大学医学中心放射学与核医学系) Section for Invasive Cardiology and Electrophysiology, I. Medical Department, Cardiology, Hemostasiology and Intensive Care, University Medical Centre Mannheim(曼海姆大学医学中心第一内科(心脏病学、止血学与重症监护)介入心脏病学与电生理学科) University Medical Center of the Johannes Gutenberg-University Mainz(美因茨约翰内斯·古腾堡大学医学中心) Department of Cardiology, Angiology, Hemostasis, and Medical Intensive Care, University Medical Centre Mannheim, Medical Faculty Mannheim, University of Heidelberg(海德堡大学曼海姆医学院曼海姆大学医学中心心脏病学、血管学、止血学与内科重症监护系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CardioDiT,一种基于扩散变换器的4D潜在扩散模型,用于合成短轴 cine CMR,通过联合建模空间和时间实现连续心脏动态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17900 2026-03-27 cs.CV cs.RO 83%

Diffusion Forcing for Multi-Agent Interaction Sequence Modeling

扩散力场用于多智能体交互序列建模

Vongani H. Maluleke, Kie Horiuchi, Lea Wilken, Evonne Ng, Jitendra Malik, Angjoo Kanazawa

机构 * Sony Group Corporation(索尼集团公司) Meta UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出MAGNet框架,通过灵活的条件和采样生成多智能体运动序列,支持多种交互任务,实现长序列生成和智能体间协调。

Comments Project page: https://von31.github.io/MAGNet/ ; Code: https://github.com/Von31/MAGNet-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23022 2026-03-27 cs.CV 83%

DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis

DMAligner:通过扩散模型基于视角合成增强图像对齐

Xinglong Luo, Ao Luo, Zhengning Wang, Yueqi Yang, Chaoyu Feng, Lei Lei, Bing Zeng, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) Qianyuan Laboratory(钱元实验室) Southwest Jiaotong University(西南交通大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DMAligner通过扩散模型基于视角合成的方法提升图像对齐效果,解决传统光流方法在遮挡和光照变化下的局限性,提出动态感知扩散训练和动态场景图像对齐数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20012 2026-03-26 cs.CV 83%

Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

基于扩散模型的化妆转移与面部区域感知化妆特征

Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song

机构 * Queen Mary University of London(伦敦女王学院) Huawei London Research Center(华为伦敦研发中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FRAM方法,通过微调化妆CLIP和区域感知化妆注入,提升扩散模型在面部区域特定化妆转移中的可控性与效果。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 83%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV 83%

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22626 2026-03-25 cs.CV 83%

PIVM: Diffusion-Based Prior-Integrated Variation Modeling for Anatomically Precise Abdominal CT Synthesis

PIVM:基于扩散的先验集成变分建模用于解剖学精确的腹部CT合成

Dinglun He, Baoming Zhang, Xu Wang, Yao Hao, Deshan Yang, Ye Duan

机构 * Department of Electrical Engineering and Computer Science, University of Missouri, Columbia, MO, USA(密苏里大学电气工程与计算机科学系) Department of Computer Science, The University of Texas at Dallas, Richardson, TX, USA(德克萨斯大学达拉斯分校计算机科学系) Department of Radiation Oncology, Washington University in St. Louis, MO, USA(华盛顿大学圣路易斯分校放射肿瘤学系) Department of Radiation Oncology, Duke University, Durham, NC, USA(达特茅斯大学放射肿瘤学系) School of Computing, Clemson University, Clemson, SC, USA(克莱姆森大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PIVM框架,通过整合器官特定强度先验,实现高精度腹部CT图像合成,保留HU范围和细密解剖纹理。

Comments Accepted at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026 (Oral). Equal contribution by the first three authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22125 2026-03-24 cs.CV 83%

DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

DA-VAE:通过细节对齐实现扩散模型的插件式潜在压缩

Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DA-VAE,通过轻量级调整预训练扩散模型,实现潜在空间压缩,使1024×1024图像生成使用32×32 tokens,比原模型减少40%,并支持2048×2048生成,保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏