arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-14 至 2026-04-14 共收录 151 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 10 篇

2511.12968 2026-04-14 cs.CV 88%

GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

GrOCE:基于图的在线概念擦除用于文本到图像扩散模型

Ning Han, Zhenyu Ge, Feng Han, Yuhua Sun, Chengqing Li, Jingjing Chen

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 GrOCE提出一种无需训练的框架,通过动态语义图和适应性聚类识别实现精准的在线概念擦除,提升文本到图像扩散模型的语义准确性和稳定性。

Comments Accepted to CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09923 2026-04-14 cs.AI cs.CV 85%

GLEaN: A Text-to-image Bias Detection Approach for Public Comprehension

GLEaN:一种面向公众理解的文本到图像偏见检测方法

Bochu Ding, Brinnae Bent, Augustus Wendell

机构 * Duke University(杜克大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 GLEaN通过生成图像和面部特征分析,直观展示文本到图像模型的偏见,使公众能快速理解模型对不同身份提示的偏见表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 79%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06313 2026-04-14 cs.CV cs.CY 79%

Text-to-Image Models and Their Representation of People from Different Nationalities Engaging in Activities

文本到图像模型及其对不同民族参与活动的人的表示

Abdulkareem Alsudais

机构 * Prince Sattam bin Abdulaziz University(沙特王子萨塔姆·本·阿卜杜勒阿齐兹大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究分析了DALL-E 3和Gemini 3 Pro Preview在生成日常活动图像时对206个民族的表示,发现传统服饰在某些活动中不适用,且与地区和收入组相关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10949 2026-04-14 cs.CV cs.AI 77%

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

伪统一:熵探测揭示统一多模态模型中分歧的信息模式

Songlin Yang, Xianghao Kong, Anyi Rao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究揭示统一多模态模型中伪统一现象的根源,通过信息论方法分析输入编码和输出生成,发现模态不对称编码和响应模式分裂是导致分歧的主要原因,强调信息流一致性对真实多模态协同的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-04-14 cs.LG cs.CV 70%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09850 2026-04-14 cs.CV 70%

Training-Free Object-Background Compositional T2I via Dynamic Spatial Guidance and Multi-Path Pruning

无需训练的物体-背景组合性T2I通过动态空间引导和多路径剪枝

Yang Deng, David Mould, Paul L. Rosin, Yu-Kun Lai

机构 * Cardiff University(卡迪夫大学) Carleton University(卡尔顿大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需训练的框架,通过动态空间引导和多路径剪枝,提升文本到图像扩散模型中背景与物体的组合性与平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17458 2026-04-14 cs.CV cs.CL 70%

CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration

CARINOX:推理时间缩放与基于类别感知的奖励驱动初始噪声优化与探索

Seyed Amir Kasaei, Ali Aghayari, Arash Marioriyad, Niki Sepasian, Shayan Baghayi Nejad, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CARINOX框架,结合噪声优化与探索,通过基于人类判断的奖励选择提升文本到图像扩散模型的对齐性能,在两个基准测试中分别提升16%和11%。

Comments Accepted at TMLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05217 2026-04-14 cs.CV 57%

Organizing Unstructured Image Collections using Natural Language

用自然语言组织无结构图像集合

Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ENSTA Paris, Institut Polytechnique de Paris(巴黎高等先进技术学院,巴黎综合理工学院) Hefei University of Technology(合肥工业大学) University of Bergamo(贝加莫大学) Technical University of Munich(慕尼黑工业大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出OpenSMC任务,通过自然语言发现图像的多种语义聚类标准,并实现自动组织。X-Cluster框架通过文本推理代理,发现多种聚类标准并生成有意义的簇。

Comments Accepted to CVPR 2026 Findings. Project page: https://oatmealliu.github.io/xcluster.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09706 2026-04-14 quant-ph 50%

Hybrid Quantum-Classical Generative Adversarial Networks with Transfer Learning

混合量子-经典生成对抗网络与迁移学习

Asma Al-Othni, Saif Al-Kuwari, Mohammad Mahdi Nasiri Fatmehsari, Kamila Zaman, Ebrahim Ardeshir-Larijani

专题命中 文生图 :image synthesis(abstract)

AI总结 本文研究了结合迁移学习的混合量子-经典GAN架构,探讨了在生成器、判别器或两者中加入变分量子电路对性能的影响,发现全混合模型在图像质量和量化指标上表现更优。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2604.10268 2026-04-14 cs.CV 89%

EditCrafter: Tuning-free High-Resolution Image Editing via Pretrained Diffusion Model

EditCrafter:基于预训练扩散模型的无调优高分辨率图像编辑

Kunho Kim, Sumin Seo, Yongjun Cho, Hyungjin Chung

机构 * NC AI Medipixel, Inc.(Medipixel公司) EverEx

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出EditCrafter,利用预训练文本到图像扩散模型实现无需调优的高分辨率图像编辑,解决了传统方法在处理任意宽高比和高分辨率图像时的局限性。

Comments Accepted to CVPRW 2026 Proceeding Track. Project page: https://editcrafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10954 2026-04-14 cs.CV 70%

FineEdit: Fine-Grained Image Edit with Bounding Box Guidance

FineEdit: 基于边界框引导的细粒度图像编辑

Haohang Xu, Lin Liu, Zhibo Zhang, Rong Cong, Xiaopeng Zhang, Qi Tian

机构 * Huawei Inc(华为公司)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FineEdit,通过多级边界框注入方法提升图像编辑的精确度与背景一致性,结合120万对精细标注图像数据集和FineEdit-Bench基准测试,验证其在指令遵循和背景保留方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10454 2026-04-14 cs.CV 57%

AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control

AIM-Bench:通过细粒度分层控制进行情感图像操纵的基准测试与改进

Shi Chen, Xuecheng Wu, Heli Sun, Yunyun Shi, Xinyi Yin, Fengjian Xue, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi'an Jiaotong University(西安交通大学) Zhengzhou University(郑州大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出AIM-Bench,通过细粒度分层控制进行情感图像操纵的基准测试,改进了现有图像编辑基准的不足,提出了AIM-40k数据集并提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06849 2026-04-14 cs.CV cs.LG 57%

Hide-and-Seek Attribution: Weakly Supervised Segmentation of Vertebral Metastases in CT

隐匿与寻找归因:基于弱监督的CT椎体转移瘤分割

Matan Atad, Alexander W. Marka, Lisa Steinhelfer, Anna Curto-Vilalta, Yannik Leonhardt, Sarah C. Foreman, Anna-Sophia Walburga Dietrich, Robert Graf, Alexandra S. Gersing, Bjoern Menze, Daniel Rueckert, Jan S. Kirschke, Hendrik Möller

机构 * Institute of Neuroradiology, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院神经放射学研究所,医学与健康学院,慕尼黑工业大学) Chair for AI in Healthcare and Medicine, TUM and TUM University Hospital(慕尼黑工业大学及大学医院医疗与医学人工智能教席) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Institute of Diagnostic and Interventional Radiology, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院诊断与介入放射学研究所,医学与健康学院,慕尼黑工业大学) Department of Neuroradiology, University Hospital Munich (LMU)(慕尼黑大学医院神经放射学系) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Diagnostic and Interventional Radiology, University Hospital Frankfurt(法兰克福大学医院诊断与介入放射学系) Department of Orthopedics and Sports Orthopedics, TUM University Hospital, School of Medicine and Health, Technical University of Munich (TUM)(慕尼黑工业大学大学医院骨科与运动骨科,医学与健康学院,慕尼黑工业大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于椎体级别标签的弱监督分割方法,通过扩散自编码器和像素差异图识别可疑病变区域,利用隐匿与寻找归因机制在数据流形上投影并量化恶性贡献,实现高精度的椎体转移瘤分割。

Comments Accepted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 101 篇

2509.05342 2026-04-14 cs.CV cs.LG 89%

Delta Rectified Flow Sampling for Text-to-Image Editing

Delta Rectified Flow Sampling 用于文本到图像编辑

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) Computer Science Department, Harvard University(哈佛大学计算机科学系) Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 扩散模型 :text-to-image(title,abstract);image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10675 2026-04-14 cs.CV 85%

HiddenObjects: Scalable Diffusion-Distilled Spatial Priors for Object Placement

HiddenObjects: 用于物体放置的可扩展扩散-蒸馏空间先验

Marco Schouten, Ioannis Siglidis, Serge Belongie, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(人工智能先锋中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型蒸馏学习显式的类别条件空间先验,用于自然场景中的物体放置。通过自动化框架构建大规模数据集,实验表明其优于人类标注和现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09861 2026-04-14 cs.AI cs.NE 85%

Evolutionary Token-Level Prompt Optimization for Diffusion Models

扩散模型的进化令牌级提示优化

Domício Pereira Neto, João Correia, Penousal Machado

机构 * University of Coimbra(科英布拉大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于遗传算法的扩散模型令牌级提示优化方法,通过进化CLIP模型的token向量提升生成质量,实验显示比基线方法提升23.93%。

Comments 17 pages, 3 figures, 2 tables, 6 appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20128 2026-04-14 cs.GR cs.AI cs.CV cs.MM 82%

KSDiff: Keyframe-Augmented Speech-Aware Dual-Path Diffusion for Facial Animation

KSDiff: 关键帧增强型语音感知双路径扩散模型用于面部动画

Tianle Lyu, Junchuan Zhao, Ye Wang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文提出KSDiff框架,通过双路径语音编码器和关键帧建立学习模块,提升语音驱动面部动画的唇同步和头部姿态自然度。

Comments Paper accepted at ICASSP 2026, 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11559 2026-04-14 cs.CV physics.med-ph 79%

Progressively Texture-Aware Diffusion for Contrast-Enhanced Sparse-View CT

逐步纹理感知扩散用于对比增强稀疏视图CT

Tianqi Wang, Wenchao Du, Hongyu Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出逐步纹理感知扩散模型,通过粗到细框架提升稀疏视图CT重建的结构相似性和视觉效果,仅需少量采样步即可实现高质量与高保真度的平衡。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11097 2026-04-14 cs.CV 79%

CDPR: Cross-modal Diffusion with Polarization for Reliable Monocular Depth Estimation

CDPR:基于极化交叉模态扩散的可靠单目深度估计

Rongjia Yu, Tong Jia, Hao Wang, Xiaofang Li, Xiao Yang, Zinuo Zhang, Cuiwei Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CDPR框架,通过融合RGB和极化图像信息提升单目深度估计鲁棒性,尤其在复杂场景中表现优异。

Comments preprint version of IEEE TMM 2026 Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01390 2026-04-14 cs.CV 79%

FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution

FRAMER:基于扩散先验的频率对齐自蒸馏与自适应调制的现实世界图像超分辨率

Seungho Choi, Jeahun Sung, Jihyong Oh

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FRAMER通过利用扩散先验,采用频率对齐自蒸馏和自适应调制方法,提升现实世界图像超分辨率的PSNR/SSIM及感知指标。

Comments CVPR 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/FRAMER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13292 2026-04-14 cs.CV 79%

DiffClean: Diffusion-based Makeup Removal for Accurate Age Estimation

DiffClean: 基于扩散模型的化妆去除用于准确年龄估计

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffClean,通过文本引导的扩散模型去除化妆痕迹,提升年龄估计和面部验证的准确性,有效对抗化妆攻击。

Comments Revised version with minor changes and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10465 2026-04-14 cs.LG cs.AI cs.CV 79%

Rethinking the Diffusion Model from a Langevin Perspective

从兰格罕视角重新思考扩散模型

Candi Zheng, Yuan Lan

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从兰格罕视角系统整理扩散模型,提供更直观的解释,探讨ODE和SDE模型统一框架及扩散模型优于VAE的理论依据。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12156 2026-04-14 cs.GR 79%

SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models

SmokeSVD:通过扩散模型进行渐进式新视角合成与细化实现单视角烟雾重建

Chen Li, Shanshan Dong, Sheng Qiu, Jianmin Han, Yibo Zhao, Zan Gao, Taku Komura, Kemeng Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出SmokeSVD框架,结合扩散模型生成能力与物理引导优化,实现单视角动态烟雾重建,通过多阶段渐进过程生成高质量多视角序列,提升重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20704 2026-04-14 cs.CV cs.LG 79%

HFI: A unified framework for training-free detection and implicit watermarking of latent diffusion model generated images

HFI:一种用于训练自由检测和隐式水印的潜在扩散模型生成图像的统一框架

Sungik Choi, Hankook Lee, Jaehoon Lee, Seunghyun Kim, Stanley Jungkyu Choi, Moontae Lee

机构 * LG AI Research(LG AI研究院) Sungkyunkwan University(成均馆大学) University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HFI框架,用于训练自由检测和隐式水印,通过分析潜在扩散模型生成图像的高频信息畸变,有效检测复杂背景图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17163 2026-04-14 cs.CV 79%

OSDFace: One-Step Diffusion Model for Face Restoration

OSDFace:面向面部修复的一步扩散模型

Jingkai Wang, Jue Gong, Lin Zhang, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。

Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10085 2026-04-14 cs.CV 79%

Particle Diffusion Matching: Random Walk Correspondence Search for the Alignment of Standard and Ultra-Widefield Fundus Images

粒子扩散匹配:用于标准和超宽场视网膜图像对齐的随机游走对应搜索

Kanggeon Lee, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电气与计算机工程系ASRI) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种稳健的对齐技术,通过扩散模型引导的迭代随机游走对应搜索(RWCS)实现标准视网膜图像(SFIs)和超宽场视网膜图像(UWFIs)的对齐,解决了尺度、外观差异和特征稀少的问题,展示了在多个视网膜图像对齐基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10084 2026-04-14 cs.CV 79%

Active Diffusion Matching: Score-based Iterative Alignment of Cross-Modal Retinal Images

主动扩散匹配:基于分数模型的跨模态视网膜图像迭代对齐

Kanggeon Lee, Su Jeong Song, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电子与计算机工程系ASRI) Dept. of Ophthalmology, Kangbuk Samsung Hospital, Sungkyunkwan University(成均馆大学三星首尔医院眼科) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出主动扩散匹配方法,通过迭代 Langevin 马尔可夫链联合估计全局和局部变换,实现视网膜图像的跨模态对齐,实验表明其在对齐精度上达到最先进的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10040 2026-04-14 cs.CV 79%

Intra-finger Variability of Diffusion-based Latent Fingerprint Generation

基于扩散模型的指纹生成内部手指变异性研究

Noor Hussein, Anil K. Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文系统评估了使用先进扩散模型生成的合成指纹(特别是潜在指纹)的内部手指变异性,通过构建包含七种多样数据集的潜在风格库,提高了生成模型的潜在风格多样性,并分析了生成指纹中ridge和 minutiae的完整性。

Comments Accepted at the 2nd Workshop on Foundation and Generative Models in Biometrics (FoundGen-Bio), held in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09838 2026-04-14 cs.CV 79%

Vector Field Synthesis with Sparse Streamlines Using Diffusion Model

基于扩散模型的稀疏流线向量场合成

Nguyen K. Phan, Ricardo Morales, Sebastian D. Espriella, Guoning Chen

机构 * University of Houston(休斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的向量场合成方法,利用稀疏流线输入生成符合物理规律的2D向量场,通过条件去噪扩散模型和分类器自由引导,实现几何和物理约束的保真重建。

Comments 5 pages, 4 figures; published at IEEE VIS 2025

Journal ref 2025 IEEE Visualization and Visual Analytics (VIS), pp. 296-300

详情

展开后加载摘要…

URL PDF HTML 收藏