arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-10 至 2026-04-10 共收录 105 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2504.13378 2026-04-10 cs.GR cs.CV 91%

SMPL-GPTexture: Dual-View 3D Human Texture Estimation using Text-to-Image Generation Models

SMPL-GPTexture:利用文本到图像生成模型进行双视角3D人体纹理估计

Mingxiao Tu, Shuchang Ye, Hoijoon Jung, Jinman Kim

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);inpainting(abstract)

AI总结 本文提出SMPL-GPTexture方法,通过文本提示生成双视角图像,结合人体网格恢复模型和反向光栅化技术,生成高精度纹理映射,解决3D人体纹理生成中的隐私和数据获取难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08123 2026-04-10 cs.DC cs.AI 89%

LegoDiffusion: Micro-Serving Text-to-Image Diffusion Workflows

LegoDiffusion:微服务文本到图像扩散工作流

Lingyun Yang, Suyi Li, Tianyu Feng, Xiaoxiao Jiang, Zhipeng Di, Weiyi Lu, Kan Liu, Yinghao Yu, Tao Lan, Guodong Yang, Lin Qu, Liping Zhang, Wei Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract)

AI总结 LegoDiffusion通过将扩散工作流分解为松耦合的模型执行节点,实现高效管理与调度,提升请求率和突发流量容忍度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07427 2026-04-10 cs.CV 86%

Personalizing Text-to-Image Generation to Individual Taste

根据个人口味个性化文本到图像生成

Anne-Sofie Maerten, Juliane Verwiebe, Shyamgopal Karthik, Ameya Prabhu, Johan Wagemans, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Department of Brain and Cognition, KU Leuven(鲁汶大学大脑与认知系)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出PAMELA框架和数据集,通过个性化奖励模型提升文本到图像生成对个体偏好的适应性,展示了简单提示优化方法在引导生成个体偏好中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 85%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17489 2026-04-10 cs.CV 83%

LumiCtrl : Learning Illuminant Prompts for Lighting Control in Personalized Text-to-Image Models

LumiCtrl : 基于光照提示的学习以实现个性化文本到图像模型中的光照控制

Muhammad Atif Butt, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) City University of Hong Kong(香港城市大学) Computer Sciences Department, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出LumiCtrl方法,通过学习单个物体图像的光照提示,实现对文本到图像模型中光照的精准控制,提升生成图像的光照真实性、审美质量和场景一致性。

Comments Accepted to IEEE/CVF CVPR 2026 Workshop on AI for Creative Visual Content Generation, Editing, and Understanding (CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08008 2026-04-10 cs.CV cs.AI cs.LG 57%

SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

SearchAD:大规模稀有图像检索数据集用于自动驾驶

Felix Embacher, Jonas Uhrig, Marius Cordts, Markus Enzweiler

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃斯林根应用技术大学智能系统研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 SearchAD为自动驾驶提供大规模稀有图像检索数据集,包含423k帧和513k个标注框,针对稀有类别检索问题,支持文本到图像和图像到图像检索及少样本学习。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08637 2026-04-10 cs.CY cs.AI cs.CR 50%

How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets

数据所有者如何说不?Web抓取视觉-语言AI训练数据集中的数据同意机制案例研究

Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Amazon AWS AI/ML(亚马逊AWS AI/ML)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究探讨了数据所有者在AI训练数据集中的同意表达方式,分析了DataComp数据集中样本层面和网络层面的信息,揭示了当前数据收集流程对数据同意的不尊重问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2604.08536 2026-04-10 cs.CV cs.AI 70%

RewardFlow: Generate Images by Optimizing What You Reward

RewardFlow: 通过优化所奖励的内容生成图像

Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash, Adheesh Juvekar, Vedant Shah, Ayush Barik, Nabeel Bashir, Muntasir Wahed, Ritish Shrirao, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sony Research, India(索尼印度研究院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 RewardFlow通过多奖励Langevin动力学优化预训练扩散和流匹配模型,统一了语义对齐、感知保真度等不同可微奖励,并引入基于VQA的可微奖励提升语义监督。

Comments CVPR 2026. Project page: https://plan-lab.github.io/rewardflow

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 79 篇

2604.08301 2026-04-10 cs.CV 83%

GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis

GroundingAnomaly: 基于空间的扩散用于少样本异常合成

Yishen Liu, Hongcang Chen, Pengcheng Zhao, Yunfan Bao, Yuxi Tian, Jieming Zhang, Hao Chen, Zheng Zhi, Yongchun Liu, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) Beijing Jiaotong University(北京交通大学) Li Auto(理想汽车) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出GroundingAnomaly框架,通过空间条件模块和门控自注意力模块实现精准异常合成,提升少样本异常检测性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07879 2026-04-10 cs.CV cs.AI 83%

FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding

FlowGuard: 通过线性潜在解码实现扩散模型生成过程中的轻量级安全检测

Jinghan Yang, Yihe Fan, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 FlowGuard通过线性近似和课程学习方法,在生成过程中检测不安全内容,提升扩散模型的安全性和效率,F1分数优于现有方法30%以上,同时显著降低GPU内存占用和投影时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04678 2026-04-10 cs.CV 83%

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04335 2026-04-10 cs.DC 82%

GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads

GENSERVE:高效共服务异构扩散模型工作负载

Fanjiang Ye, Zhangke Li, Xinrui Zhong, Ethan Ma, Russell Chen, Kaijian Wang, Jingwei Zuo, Desen Sun, Ye Cao, Triston Cao, Myungjin Lee, Arvind Krishnamurthy, Yuke Wang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 GENSERVE通过利用扩散过程的可预测性,优化共服务效率,解决异构工作负载下的延迟SLA问题,实验表明其在多种配置下将SLA达成率提升44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10437 2026-04-10 cs.CV cs.GR cs.LG 81%

SVGFusion: A VAE-Diffusion Transformer for Vector Graphic Generation

SVGFusion:一种用于矢量图形生成的VAE-扩散变换器

Ximing Xing, Juncheng Hu, Ziteng Xue, Jing Zhang, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) Bambu AI The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出SVGFusion框架,结合VAE-扩散架构生成高质量可编辑SVG,通过融合矢量与像素信息提升结构理解与生成质量。

Comments project page: https://ximinng.github.io/SVGFusionProject/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08546 2026-04-10 cs.CV 79%

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08329 2026-04-10 eess.IV cs.MM 79%

DiV-INR: Extreme Low-Bitrate Diffusion Video Compression with INR Conditioning

DiV-INR:基于INR条件的极端低比特率扩散视频压缩

Eren Çetin, Lucas Relic, Yuanyi Xue, Markus Gross, Christopher Schroers, Roberto Azevedo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出一种结合隐式神经表示与预训练视频扩散模型的视频压缩框架,旨在解决极低比特率下的压缩问题,通过INR条件引导扩散过程,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08305 2026-04-10 eess.IV cs.AI cs.CV cs.ET cs.LG q-bio.QM 79%

HistDiT: A Structure-Aware Latent Conditional Diffusion Model for High-Fidelity Virtual Staining in Histopathology

HistDiT:一种结构感知的潜在条件扩散模型,用于病理学高保真的虚拟染色

Aasim Bin Saleem, Amr Ahmed, Ardhendu Behera, Hafeezullah Amin, Iman Yi Liao, Mahmoud Khattab, Pan Jia Wern, Haslina Makmur

机构 * Edge Hill University(埃奇希尔大学) University of Nottingham Malaysia(诺丁汉大学马来西亚分校) University of Southampton Malaysia(南安普顿大学马来西亚分校) Cancer Research Malaysia(马来西亚癌症研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HistDiT,一种新的潜在条件扩散变换器架构,通过双流条件策略和多目标损失函数提升虚拟组织染色的视觉保真度,解决传统方法在结构与染色平衡上的不足。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21366 2026-04-10 cs.CV cs.LG 79%

BADiff: Bandwidth Adaptive Diffusion Model

BADiff:带宽自适应扩散模型

Xi Zhang, Hanwei Zhu, Yan Zhong, Jiamang Wang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种带宽自适应扩散模型,通过端到端训练策略使模型根据实时网络带宽调整生成质量,提升带宽受限环境下的图像传输效率。

Comments NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08084 2026-04-10 cs.CV 79%

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

DiffVC: 一种基于扩散模型的非自回归框架用于视频描述生成

Junbo Wang, Liangyu Fu, Yuke Li, Yining Zhu, Ya Jing, Xuecheng Wu, Jiangbin Zheng

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Beijing University Of Technology(北京工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffVC,一种基于扩散模型的非自回归框架,解决视频描述生成中自回归方法速度慢和累积误差问题,通过并行解码和判别性条件扩散模型提升生成质量,实验表明其在多个数据集上优于非自回归方法并接近自回归方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08048 2026-04-10 cs.CV 79%

Guiding a Diffusion Model by Swapping Its Tokens

通过交换令牌引导扩散模型

Weijia Zhang, Yuehao Liu, Shanyan Guan, Wu Ran, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种简单方法,通过交换令牌实现条件和无条件生成的CFG引导,提升图像质量和提示对齐。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07273 2026-04-10 cs.CV 79%

GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos

GenLCA:从真实视频中生成全身体素的3D扩散模型

Yiqian Wu, Rawal Khirodkar, Egor Zakharov, Timur Bagautdinov, Lei Xiao, Zhaoen Su, Shunsuke Saito, Xiaogang Jin, Junxuan Li

机构 * Codec Avatars Lab, Meta(Meta Codec Avatars实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GenLCA,一种基于扩散的生成模型,能从文本和图像输入生成逼真全身体素并进行编辑。通过利用预训练的avatar重建模型作为可动画的3D分词器,解决视频中部分观测导致的模糊或透明问题,提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03134 2026-04-10 cs.CV 79%

SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation

SD-FSMIS:利用稳定扩散适应少样本医学图像分割

Meihua Li, Yang Zhang, Weizhao He, Hu Qu, Yisong Li

机构 * Computer Vision Institute, College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院计算机视觉研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SD-FSMIS框架,通过引入支持-查询交互和视觉到文本条件翻译模块,利用预训练的稳定扩散模型提升少样本医学图像分割的效率与鲁棒性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16570 2026-04-10 cs.CV 79%

Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration

Face2Scene:利用面部退化作为扩散基于场景恢复的 oracle

Amirhossein Kazerouni, Maitreya Suin, Tristan Aumentado-Armstrong, Sina Honari, Amanpreet Walia, Iqbal Mohomed, Konstantinos G. Derpanis, Babak Taati, Alex Levinshtein

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) AI Center–Toronto, Samsung Electronics(三星电子多伦多AI中心) University Health Network(大学健康网络) York University(约克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Face2Scene框架,通过面部作为感知oracle估计退化并指导全图恢复,有效恢复身体和背景。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06774 2026-04-10 cs.CV cs.AI 79%

RDSplat: Robust Watermarking for 3D Gaussian Splatting Against 2D and 3D Diffusion Editing

RDSplat: 3D高斯散射中针对2D和3D扩散编辑的鲁棒水印

Longjie Zhao, Ziming Hong, Zhenyang Ren, Runnan Chen, Mingming Gong, Tongliang Liu

机构 * The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RDSplat是首个能抵御2D和3D扩散编辑的3D高斯散射水印框架,通过在低频高斯基元中嵌入100位水印,结合频率感知基元选择和替代策略,实现高效训练和强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11435 2026-04-10 cs.CV cs.AI 79%

The Persistence of Cultural Memory: Investigating Multimodal Iconicity in Diffusion Models

文化记忆的延续:探究扩散模型中的多模态图标性

Maria-Teresa De Rosa Palmini, Eva Cetinic

机构 * University of Zurich(苏黎世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究扩散模型在文化共享视觉参考提示下的泛化与记忆模糊性,提出CRT指标评估模型对文化参考的识别与实现能力,揭示模型行为依赖于对参考的识别与再现方式,推动评估向更丰富的语境理解发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23310 2026-04-10 cs.CV 79%

Balanced Diffusion-Guided Fusion for Multimodal Remote Sensing Classification

多模态遥感分类的平衡扩散引导融合

Hao Liu, Yongjie Zheng, Yuhan Kang, Mingyang Zhang, Maoguo Gong, Lorenzo Bruzzone

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) College of Electrical and Information Engineering, Hunan University(湖南大学电气与信息工程学院) Key Laboratory of Collaborative Intelligent Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Academy of Artificial Intelligence, Inner Mongolia Normal University(内蒙古师范大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出平衡扩散引导融合框架,通过多模态扩散特征指导多分支网络进行土地覆盖分类,采用自适应模态掩码策略和跨模态注意力机制提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05398 2026-04-10 cs.GR 79%

2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching

2ndMatch: 通过二阶雅可比匹配进行剪枝扩散模型的微调

Caleb Zheng, Eli Shlizerman

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出2ndMatch框架,通过二阶雅可比匹配损失提升剪枝扩散模型性能,实验表明其能显著改善输出质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08637 2026-04-10 cs.CV cs.AI cs.LG 79%

DMin: Scalable Training Data Influence Estimation for Diffusion Models

DMin:用于扩散模型的可扩展训练数据影响估计

Huawei Lin, Yingjie Lao, Weijie Zhao

机构 * Rochester Institute of Technology(罗切斯特理工学院) Tufts University(塔夫茨大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DMin框架,用于高效估计扩散模型中每个训练样本对生成图像的影响,解决了传统方法在大规模模型上的计算限制问题,实现了存储和计算效率的显著提升。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00436 2026-04-10 cs.CV 79%

Diff-PCR: Diffusion-Based Correspondence Searching in Doubly Stochastic Matrix Space for Point Cloud Registration

Diff-PCR: 基于双随机矩阵空间的扩散对应搜索用于点云配准

Haihua Shi, Qianliang Wu

机构 * Jinling Institute of Technology(金陵科技学院) PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院,教育部高维信息智能感知与系统重点实验室,江苏省社会安全图像与视频理解重点实验室,PCA实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diff-PCR框架,利用去噪扩散模型在双随机矩阵空间中预测最优匹配矩阵的搜索梯度,通过迭代优化提升点云配准的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07404 2026-04-10 cond-mat.stat-mech cs.LG math.AP stat.ML 79%

Score Shocks: The Burgers Equation Structure of Diffusion Generative Models

分数冲击:扩散生成模型的伯格斯方程结构

Krisanu Sarkar

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文分析扩散生成模型的分数场,通过伯格斯型演化定律揭示其结构,探讨了分数转换的偏微分方程视图及对称二元高斯混合物中的临界扩散时间。

Comments 41 pages, 7 figures. Introduces a Burgers equation formulation of diffusion model score dynamics and a local binary-boundary theorem for speciation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08347 2026-04-10 math.NA cs.NA 78%

Meshfree GMsFEM-based exponential integration for multiscale 3D advection-diffusion problems

无网格GMsFEM基于指数积分的多尺度三维对流-扩散问题模拟

Djulustan Nikiforov, Leonardo A. Poveda, Dmitry Ammosov, Yesy Sarmiento, Juan Galvis, Mohammed Al Kobaisi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种无网格GMsFEM结合指数积分方法,用于多尺度三维对流-扩散问题的高效求解,提升了在高对比度介质中的稳定性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏