arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2602.00175 2026-05-08 cs.LG cs.AI cs.CV cs.CY 83%

The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization

遗忘的幻觉:通过初始潜在变量优化攻击未学习的扩散模型

Manyi Li, Yufan Liu, Lai Jiang, Bing Li, Yuming Li, Weiming Hu

机构 * School of Advanced Interdisciplinary Sciences, University of the Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Alipay, Ant Group(蚂蚁集团支付宝)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出IVO框架,通过优化初始潜在变量恢复未学习模型的噪声分布,揭示当前未学习方法的缺陷。

Comments 25 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05889 2026-05-08 cs.CV cs.AI cs.LG cs.NA math.NA 83%

DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation

DBMSolver: 一种无需训练的扩散桥采样器用于高质量图像到图像翻译

Sankarshana Venugopal, Mohammad Mostafavi, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 DBMSolver通过指数积分器利用DBM底层SDE和ODE的半线性结构,实现高效的一阶和二阶解,减少5倍采样次数并提升图像质量,适用于多种图像任务。

Comments Accepted to CVPR 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20650 2026-05-08 cs.CV cs.CR 83%

Gungnir: Exploiting Stylistic Features in Images for Backdoor Attacks on Diffusion Models

Gungnir: 利用图像中的风格特征对扩散模型进行后门攻击

Lei Zhang, Yu Pan, Bingrong Dai, Lin Wang

机构 * School of Economics and Management(经济管理学院) East China Normal University(华东师范大学) School of Information Science and Technology(信息科学与技术学院) Shanghai Tech University(上海理工大学) Shanghai Development Center of Computer Software Technology(上海计算机软件技术开发中心) School of Computer and Information Engineering(计算机与信息工程学院) Shanghai Polytechnic University(上海理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Gungnir通过嵌入图像中的风格特征触发扩散模型后门攻击,利用RAN和STTR保持触发器一致性,绕过检测并保持有效性,揭示了模型的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19182 2026-05-08 cs.CV cs.AI 83%

SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation

信息播种:利用大规模语言模型在图像生成中培养上下文一致性

Yuhan Pei, Ruoyu Wang, Yongqi Yang, Ye Zhu, Olga Russakovsky, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。

Comments Project page: https://pyh-129.github.io/SOW/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01653 2026-05-05 cs.CV 83%

SteeringDiffusion: A Bottlenecked Activation Control Interface for Diffusion Models

SteeringDiffusion: 一种瓶颈化激活控制接口用于扩散模型

Fangzheng Wu, Brian Summa

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SteeringDiffusion通过瓶颈化激活层控制扩散模型的内容-风格平衡,采用冻结的U-Net结构和小的提示条件潜在代码,实现可控且稳定的生成效果,优于LoRA、ControlNet等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01479 2026-05-05 cs.CV 83%

CSGuard: Toward Forgery-Resistant Watermarking in Diffusion Models via Compressed Sensing Constraint

CSGuard:通过压缩感知约束实现扩散模型中的抗伪造水印技术

Jiewei Lai, Lan Zhang, Chen Tang, Pengcheng Sun, Zhaopeng Zhang, Yunhao Wang, Hui Jin

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所,合肥国家科学中心) Lenovo Research(联想研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 CSGuard通过压缩感知约束实现扩散模型的抗伪造水印技术,确保只有持有秘密矩阵的用户才能正确嵌入或验证图像水印,有效防止伪造攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00526 2026-05-04 cs.CV 83%

IdentiFace: Multi-Modal Iterative Diffusion Framework for Identifiable Suspect Face Generation in Crime Investigations

IdentiFace:面向犯罪调查的可识别嫌疑人面部生成多模态迭代扩散框架

Weichen Liu, Yixin Yang, Changsheng Chen, Alex Kot

机构 * Southeast University(东南大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出IdentiFace框架,通过多模态输入设计和迭代生成流程提升可识别嫌疑人面部生成的条件控制与特征调整能力,贡献了面部身份损失函数和两个专用数据集,实验证明其在身份检索上的优越性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18654 2026-05-04 cs.LG cs.CV 83%

Diffusion Models for Solving Inverse Problems via Posterior Sampling with Piecewise Guidance

通过后验采样与分段引导的扩散模型解决逆问题

Saeed Mohseni-Sehdeh, Walid Saad, Kei Sakaguchi, Tao Yu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Virginia Tech(弗吉尼亚理工大学) Department of Electrical and Electronic Engineering(电气电子工程系) Institute of Science(科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出一种基于扩散模型的分段引导框架,用于解决逆问题,通过分段函数平衡计算效率与引导精度,有效整合测量噪声,实验显示在图像修复和超分辨率任务中提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26348 2026-04-30 cs.CV cs.AI 83%

ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance

ACPO:基于锚点的感知优化用于无参考质量引导的扩散模型

Yang Yang, Feifan Meng, Han Fang, Weiming Zhang

机构 * School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥国家综合科学中心人工智能研究院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过锚点约束优化提升扩散模型的感知质量,同时保持生成多样性和训练稳定性。

Comments 14 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25358 2026-04-29 cs.CV 83%

Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings

通过闭合和开放设置的统一语义-空间评估基准测试布局引导扩散模型

Luca Parolari, Nicla Faccioli, Lamberto Ballan

机构 * Department of Mathematics, University of Padova(帕多瓦大学数学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出C-Bench和O-Bench两种基准测试,结合语义和空间准确性评估布局引导扩散模型,通过大规模测试揭示模型性能与局限性。

Comments Accepted to CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24575 2026-04-28 cs.CV 83%

Diffusion Model as a Generalist Segmentation Learner

扩散模型作为通用分割学习者

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出DiGSeg,利用预训练扩散模型实现通用分割框架,通过编码图像和掩码到潜在空间,并结合CLIP对齐的文本路径,实现基于外观和任意文本提示的结构化分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24493 2026-04-28 cs.CV 83%

CA-IDD: Cross-Attention Guided Identity-Conditional Diffusion for Identity-Consistent Face Swapping

CA-IDD:跨注意力引导的身份条件扩散用于身份一致的面部交换

Md Shohel Rana, Tanoy Debnath

机构 * School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出CA-IDD,一种基于扩散的面部交换方法,通过多尺度交叉注意力整合 gaze、身份和面部解析,提升身份一致性和视觉真实性,实现稳定训练和精细区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23858 2026-04-28 cs.CV 83%

Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation

潜在帧剪枝:一种无训练方法,连接传统视频压缩与现代扩散变换器以实现高效生成

Dennis Menn, Chih-Hsien Chou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Futurewei Technologies, Inc.(未来科技公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的潜在帧剪枝方法,通过剪枝重复的潜在块来减少计算负担并提高生成速度,同时引入注意力恢复机制以解决训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11789 2026-04-28 stat.ML cs.CV cs.LG 83%

Statistical Test for Diffusion-Based Anomaly Localization via Selective Inference

基于选择性推断的扩散模型异常定位统计检验

Teruyuki Katsuoka, Tomohiro Shiraishi, Daiki Miwa, Vo Nguyen Le Duy, Ichiro Takeuchi

机构 * Nagoya University(名古屋大学) University of Information Technology(信息技术大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市) RIKEN(理化学研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出基于选择性推断的统计框架,用于量化检测到的异常区域显著性,通过提供p值评估假阳性率,提升异常定位的可靠性。

Comments 35 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23536 2026-04-28 cs.CV 83%

$Z^2$-Sampling: Zero-Cost Zigzag Trajectories for Semantic Alignment in Diffusion Models

$Z^2$-采样:用于扩散模型语义对齐的零成本zigzag轨迹

Haosen Li, Wenshuo Chen, Shaofeng Liang, Lei Wang, Kaishen Yuan, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Griffith University & Data61/CSIRO(格里菲斯大学及Data61/CSIRO)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出$Z^2$-采样,通过隐式代数坍缩与动态缓存的时间语义代理,实现零成本zigzag轨迹,提升采样效率并保持语义探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14897 2026-04-28 cs.CV 83%

Seer: Language Instructed Video Prediction with Latent Diffusion Models

Seer:基于潜在扩散模型的语言指导视频预测

Xianfan Gu, Chuan Wen, Weirui Ye, Jiaming Song, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai AI Lab(上海人工智能实验室) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Seer通过扩展预训练文本到图像扩散模型的时间轴,提出高效模型以实现文本条件视频预测,提升机器人未来预测能力,实验表明其在多个数据集上性能优越。

Comments 31 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22649 2026-04-27 cs.NE cs.CV 83%

Structure-Guided Diffusion Model for EEG-Based Visual Cognition Reconstruction

基于结构引导的扩散模型用于EEG视觉认知重建

Yongxiang Lian, Yueyang Cang, Pingge Hu, Yuchen He, Li Shi

机构 * China Academy of Information and Communications Technology(信息与通信技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出结构引导扩散模型(SGDM),通过整合结构信息提升EEG视觉重建的精度与泛化能力,实现更高质量的视觉内容解码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20816 2026-04-23 cs.LG cs.CV 83%

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

ParetoSlider:扩散模型后训练用于连续奖励控制

Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Lightricks(Lightricks公司) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 ParetoSlider提出多目标强化学习框架,通过连续变化的偏好权重训练单个扩散模型,实现推理时对冲突目标的精细控制。

Comments Project page: https://shelley-golan.github.io/ParetoSlider-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20796 2026-04-23 cs.CV 83%

LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

LLaDA2.0-Uni:通过扩散大语言模型统一多模态理解和生成

Inclusion AI, Tiwei Bie, Haoxing Chen, Tieyuan Chen, Zhenglin Cheng, Long Cui, Kai Gan, Zhicheng Huang, Zhenzhong Lan, Haoquan Li, Jianguo Li, Tao Lin, Qi Qin, Hongjun Wang, Xiaomei Wang, Haoyuan Wu, Yi Xin, Junbo Zhao

机构 * AGI Research Center, Inclusion AI(AGI研究中心,Inclusion AI)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LLaDA2.0-Uni结合全语义离散分词器、MoE-based dLLM和扩散解码器,实现多模态理解和生成,通过SigLIP-VQ离散化视觉输入,提升推理效率,支持交错生成与推理,展现强大的图像生成与编辑能力。

Comments LLaDA2.0-Uni Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18201 2026-04-21 cs.CV cs.LG 83%

DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery

DiffuSAM: 基于扩散的零样本目标定位用于遥感影像

Geet Sethi, Panav Shah, Ashutosh Gandhe, Soumitra Darshan Nayak

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiffuSAM,结合扩散模型与先进分割模型,提升遥感影像目标定位精度,实验显示在Acc@0.5上提升超14%。

Comments Accepted at ICLR 2026 ML4RS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17773 2026-04-21 cs.CV 83%

Structure-Adaptive Sparse Diffusion in Voxel Space for 3D Medical Image Enhancement

针对体素空间的结构自适应稀疏扩散用于3D医学图像增强

Hongxu Jiang, Fei Li, Boxiao Yu, Ying Zhang, Kaleb Smith, Kuang Gong, Wei Shao

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学电气与计算机工程系) Department of Medicine, University of Florida, Gainesville, FL, USA(佛罗里达大学医学系) Department of Biomedical Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学生物医学工程系) Research Computing, University of Florida, Gainesville, FL, USA(佛罗里达大学研究计算中心) NVIDIA, Santa Clara, CA, USA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种稀疏体素空间扩散框架,通过结构感知轨迹调制模块实现结构自适应去噪,提升3D医学图像的去噪和超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17492 2026-04-21 cs.CV 83%

Coevolving Representations in Joint Image-Feature Diffusion

联合图像-特征扩散中的共进化表示

Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes, Athena RC(阿基米德,雅典RC) University of Crete(克里特大学) National Technical University of Athens(雅典技术大学) IACM-Forth(IACM-第四研究机构)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CoReDi框架,通过共进化语义空间提升图像生成质量,实验显示其收敛更快且样本质量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16483 2026-04-21 cs.CV cs.AI 83%

Dynamic Eraser for Guided Concept Erasure in Diffusion Models

动态擦除器:扩散模型中的引导概念擦除

Qinghui Gong

机构 * Southwest Jiaotong university(西南交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出动态语义引导(DSS)框架,通过敏感语义边界建模和敏感语义引导实现可控的概念擦除,提升安全内容生成效果。

Comments 26 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15911 2026-04-20 cs.CV 83%

Efficient Video Diffusion Models: Advancements and Challenges

高效视频扩散模型:进展与挑战

Shitong Shao, Lichen Bai, Pengfei Wan, James Kwok, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文综述了高效视频扩散模型的进展与挑战,分析了四种主要范式,探讨了减少函数调用次数和降低每步开销的核心目标,并讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15521 2026-04-20 cs.CV 83%

Frequency-Aware Flow Matching for High-Quality Image Generation

面向频率的流匹配用于高质量图像生成

Sucheng Ren, Qihang Yu, Ju He, Xiaohui Shen, Alan Yuille, Liang-Chieh Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance(字节跳动)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FreqFlow,通过时间依赖的自适应加权将频率感知条件融入流匹配框架,以提升图像生成的全局结构和细节质量,在ImageNet-256上取得最佳FID成绩。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14570 2026-04-17 cs.CV 83%

Deepfake Detection Generalization with Diffusion Noise

基于扩散噪声的深度伪造检测泛化

Hongyuan Qi, Wenjin Hou, Hehe Fan, Jun Xiao

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出利用扩散噪声特征提升深度伪造检测的泛化能力,通过引入注意力引导的噪声学习框架,增强模型对真实与合成图像差异的捕捉,实验表明在多个基准上取得最佳性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07069 2026-04-17 cs.CV cs.AI 83%

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

Bird-SR:双向奖励引导扩散用于现实世界图像超分辨率

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, School of Information Science and Technology, University of Science and Technology of China(脑启发智能感知与认知MoE实验室,信息科学与技术学院,中国科学技术大学) iFlytek Research, iFlytek Co., Ltd., Hefei, China(科大讯飞研究院,科大讯飞股份有限公司,合肥,中国)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Bird-SR通过双向奖励引导扩散框架,结合合成和真实图像数据,提升现实世界超分辨率的结构一致性与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21045 2026-04-15 cs.CV cs.AI 83%

LPNSR: Optimal Noise-Guided Diffusion Image Super-Resolution Via Learnable Noise Prediction

LPNSR: 通过可学习噪声预测实现最优噪声引导扩散图像超分辨率

Shuwei Huang, Shizhuo Liu, Zijun Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LPNSR,通过可学习噪声预测器替代随机高斯噪声,优化扩散模型中的中间噪声,实现高感知性能,无需依赖大规模文本到图像先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21697 2026-04-15 cs.CV cs.LG 83%

Visual Diffusion Models are Geometric Solvers

视觉扩散模型是几何求解器

Nir Goren, Shai Yehezkel, Omer Dahary, Andrey Voynov, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文展示视觉扩散模型可直接解决几何问题,通过像素空间推理,解决四边形内接问题及Steiner树问题等,将几何推理转化为图像生成。

Comments Project page: https://kariander1.github.io/visual-geo-solver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17384 2026-04-15 cs.LG cs.CV stat.ML 83%

Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling

变分自编码离散扩散与增强的维度相关性建模

Tianyu Xie, Shuchen Xue, Zijin Feng, Tianyang Hu, Jiacheng Sun, Zhenguo Li, Cheng Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Statistical Science, Peking University(北京大学统计科学中心) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Huawei Foundation Model Dept(华为基金会模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出VADD框架,通过潜在变量建模增强离散扩散,提升样本质量,尤其在少量去噪步骤时表现优异。

Comments ICLR 2026 Poster; 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏