arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-21 至 2026-07-21 共收录 80 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2607.17634 2026-07-21 cs.CV 新提交 93%

MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis

MixDiffusion:用于多条件图像合成的基于混合扩散的单条件文本到图像生成模型

Pengcheng Wan, Liang Han, Lin Xu, Bowen Xiao, Liqiang Nie

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract)

AI总结 研究针对现有基于扩散的文本到图像生成方法控制条件单一的问题,提出MixDiffusion框架,通过集成多个预训练单条件模型,支持多条件图像合成,具有无需训练、易部署和可扩展新模态的特点。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 88%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16307 2026-07-21 cs.CV 新提交 88%

CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation

CoBind:用于无训练文本到图像生成的阶段感知组合绑定

Kaijie Chen, Ethan Caldwell, Mira Vossen, Julian Hartwell, Serena Whitlock, Adrian Bellamy

机构 * Mind Lab(思维实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散文本到图像模型处理复杂提示失败的问题,提出CoBind框架,先解析提示为组合图,利用多种约束建立布局、绑定属性,去噪时调整引导强度,无需重新训练或注释,实验证明其在多方面有改进且视觉质量有竞争力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17779 2026-07-21 cs.AI 新提交 85%

Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

动态防御剖析实现文本到图像模型的认知越狱

Dongdong Yang, Deyue Zhang, Zhao Liu, Zonghao Ying, Wenzhuo Xu, Jiankai Jin, Xiangzheng Zhang, Quanchen Zou

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn)

AI总结 研究文本到图像模型易受对抗性滥用问题,提出MIND认知越狱框架,将对抗提示生成重构为信念状态推理,集成多模态判断器等组件,经实验验证其在多个防御设置下显著优于现有方法,有效实现越狱生成。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2607.16291 2026-07-21 cs.CV 新提交 88%

Beyond Target Scores: Measuring Off-Target Drift in Diffusion-Based Medical Image Editing

超越目标分数:测量基于扩散的医学图像编辑中的偏离目标漂移

Todd Zhou

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 研究基于扩散的医学图像编辑中偏离目标漂移问题,引入CIB-Med-1基准及受约束扩散引导基线,通过多指标评估编辑效果,实验显示能保留目标进展并减少偏离目标漂移,强调应从轨迹级语义控制角度评估医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17768 2026-07-21 cs.CV 新提交 79%

To Blend In, First Decouple: Rethinking Camouflage Image Generation via Context-Decoupled Representations

为了融入,首先解耦:通过上下文解耦表示重新思考伪装图像生成

Wenzhuang Wang, Yifan Zhao, Mingcan Ma, Yunlong Che, Haoran Chen, Ming Liu, Jia Li

机构 * Beihang University(北京航空航天大学) Geely Automobile Research Institute (Ningbo) Co., Ltd(吉利汽车研究院(宁波)有限公司)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 研究伪装图像生成问题,提出上下文解耦生成范式CamoDreamer,通过设计对比感知上下文桥等方法,将潜在伪装特征解耦为物体和背景控制流,实验证明其显著优于现有方法且设计轻量。

Comments 14 pages, 11 figures, ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17140 2026-07-21 cs.CV 新提交 70%

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-07-21 cs.CV 新提交 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 61 篇

2607.17411 2026-07-21 cs.GR cs.LG 新提交 79%

Feature-Guided Diffusion for Non-Differentiable Inverse Rendering

用于不可微逆渲染的特征引导扩散

Andrei-Timotei Ardelean, Michael Fischer, Tim Weyrich, Tomáš Iser

机构 * Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 研究逆渲染问题,提出完全黑箱框架FIDE,通过特征引导,利用视觉Transformer提取特征训练扩散模型,结合CMA进化策略优化,在多种逆问题上验证,显著提升收敛速度并逃离局部最小值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16656 2026-07-21 cs.CV 新提交 79%

DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes

DORS:用于密集场景中基于扩散的目标移除的动态注意力路由

Haitong Tang, Haipeng Liu, Yang Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对密集场景目标移除中因语义干扰致移除不完整的问题,提出基于动态注意力路由机制的DORS框架,含实例过滤注意力和上下文引导路由组件,经实验验证其性能优于现有方法。

Comments 16 pages, 10 figures, to appear in ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16300 2026-07-21 cs.CV 新提交 79%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16685 2026-07-21 stat.ML cs.LG 新提交 78%

Semi-Supervised Conditional Diffusion via Label Augmentation

通过标签增强实现半监督条件扩散

Jin Su, Yuan Gao, Yong Zhou, Jian Huang

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) School of Statistics and Data Science, Nankai University(统计与数据科学学院,南开大学) School of Statistics, East China Normal University(统计学院,华东师范大学) Department of Data Science and AI, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究如何利用未标记数据改进条件扩散模型,提出标签增强条件扩散方法(LACD),通过给未标记数据赋平凡标签并联合去噪,在理论上保证可识别性和收敛速度,实验证明该方法在样本效率和生成性能上优于纯监督估计器。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17972 2026-07-21 cs.LG 新提交 78%

DiFA: Inference-Time Forward-Process Alignment for Diffusion Models

DiFA:扩散模型的推理时间前向过程对齐

Shigui Li, Delu Zeng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出DiFA框架,将扩散模型推理时的数据预测细化转为顺序状态估计问题,受卡尔曼滤波启发建立前向对齐时间一致性,引入偏差引导机制,实验表明该方法在多个指标上显著提升CIFAR-10和ImageNet的生成保真度。

Comments Accepted to ICML 2026. 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交 78%

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17652 2026-07-21 cs.AI 新提交 78%

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models

FlowBlock:用于自校正扩散语言模型的波前并行解码

Bing Tian, Haikun Liu, Xiaocheng Zhong, Zhuohui Duan, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Xiaofei Liao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对块级扩散大语言模型块间解码串行问题,提出无需训练的\flowblock{}并行解码框架,基于门控波前解码和异构波前打包机制,相比串行模型提升了每秒令牌数、降低延迟并提高准确率,优于基于训练的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交 78%

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17037 2026-07-21 cs.LG cs.CE 新提交 78%

Apeliotes: A Diffusion-Based Modeling Framework for km-scale Multi-Level Atmospheric Fields

Apeliotes:一种用于千米尺度多层大气场的基于扩散的建模框架

Evangelia Rafaela Frastali, Achyut Paudel, Maryam Golbazi, Frank Liu

机构 * Old Dominion University(奥多明尼昂大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对高分辨率大气数据受限问题,Apeliotes框架基于全球再分析等数据构建,能提供千米尺度天气变量和多层大气场,经评估性能极具竞争力,预测垂直风廓线等有高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 78%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16674 2026-07-21 cs.LG 新提交 78%

CLDRoute: Conditional Latent Diffusion for Routability Map Generation in Physical Design

CLDRoute:用于物理设计中可布线性映射生成的条件潜扩散

Kiran Thorat, Nicole Meng, Caiwen Ding, Yingjie Lao, Zhijie Jerry Shi

机构 * University of Connecticut(康涅狄格大学) Tufts University(塔夫茨大学) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对物理设计中可布线性估计问题,提出CLDRoute框架,将其作为条件生成问题,用物理感知条件和特定任务潜变量建模,支持样本推理,在CircuitNet 2.0上取得较好实验结果,能生成预期结果及其不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16207 2026-07-21 cs.AI cs.CR 新提交 78%

JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models

JUMP:微调扩散语言模型的单通道成员推理

Yeachan Jun, Albert No

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究微调离散扩散语言模型的成员推理攻击,提出JUMP单通道评分攻击,利用dLLMs任意顺序可解码性和并行可解码性,在六个MIMIR域上的微调LLaDA - 8B - Base上提升了平均ROC - AUC并改善低FPR检测,且减少查询次数。

Comments 24 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16204 2026-07-21 cs.AI cs.LG 新提交 78%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17522 2026-07-21 cs.LG cs.AI cs.IT math.IT math.PR 新提交 78%

One-step lowest-variance selection in a Gaussian random-field model motivated by masked diffusion: Total correlation and a square root collision threshold

由掩码扩散驱动的高斯随机场模型中的一步最低方差选择:总相关性和平方根碰撞阈值

Linjun Li

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 受掩码离散扩散启发,研究高斯随机场模型单步选择,用局部相关非负分数场表示不确定性,通过距离相关高斯模型衡量所选位置相关性,建立两个互补结果,为理解相关因素对掩码离散扩散中基于置信度一步选择的影响提供基线。

Comments 27 pages; welcome comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17396 2026-07-21 math.PR 新提交 78%

Diffusion approximation of a sequence of critical branching processes with dependent immigration

具有相关迁入的临界分支过程序列的扩散近似

Sadillo Sharipov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究具有相关迁入的临界分支过程序列的扩散近似,在一般假设下,证明其缩放和归一化序列依分布收敛到扩散过程,扩展了魏和温尼基(1989)的泛函极限定理。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17087 2026-07-21 math.PR 新提交 78%

Transportation-cost inequalities for invariant measures of stochastic reaction-diffusion equations driven by space-time white noise

由时空白噪声驱动的随机反应扩散方程不变测度的运输成本不等式

Shijie Shang, Tusheng Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究由乘性时空白噪声驱动的随机反应扩散方程不变测度的运输成本不等式,通过获取随机卷积矩估计,建立随机控制方程解的利普希茨连续性,最终证明了不同度量下的运输成本不等式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16238 2026-07-21 cs.LG cs.AI physics.comp-ph physics.flu-dyn 新提交 78%

Diffusion-corrected Autoregressive Fourier Neural Operator for Droplet Evolution Prediction

用于液滴演化预测的扩散校正自回归傅里叶神经算子

Jinghao Cao, Minsung Kang, Hongyue Sun, Chi Zhou, Jihoon Chung, Xubo Yue, Sanchoy Das, Bo Shen

机构 * New Jersey Institute of Technology(新泽西理工学院) University of Georgia(佐治亚大学) University at Buffalo(纽约州立大学布法罗分校) Hanyang University(汉阳大学) Northeastern University(东北大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究材料喷射中液滴演化预测难题,提出DiffARFNO两阶段框架,结合自回归傅里叶 - MIONet与DDIM校正器,经实验验证该方法显著优于现有模型,能为长期预测提供高保真结果。

Comments 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16491 2026-07-21 physics.med-ph 新提交 78%

Continuous 3-D Latent Diffusion for Medical Generation and Reconstruction

用于医学生成与重建的连续3D潜扩散

Youness Mellak, Antoine De Paepe, Dimitris Visvikis, Alexandre Bousse

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对高分辨率三维医学扩散模型成本问题,提出连续3D潜扩散模型框架,核心是含特定解码器的紧凑自动编码器,经实验评估,该框架在计算效率、内存使用和重建效果间达平衡,能支持多种医学影像任务。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17837 2026-07-21 nucl-th 新提交 78%

Dissipative properties of a Fermi system within the diffusion approximation of kinetic theory

动力学理论扩散近似下费米系统的耗散性质

Sergiy V. Lukyanov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究球形原子核模型费米系统在动力学理论扩散近似下的耗散性质,通过非线性扩散方程解析解表明分布函数趋近平衡费米分布,得出不同弛豫时间,解释了弛豫时间差异。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17871 2026-07-21 cond-mat.stat-mech math-ph math.MP math.PR quant-ph 新提交 78%

On the use of the Belopol'skaya-Daletskii representation of a diffusion on a Riemann manifold to construct path integrals

关于在黎曼流形上使用扩散的别洛波尔斯卡娅 - 达列茨基表示来构建路径积分

Paolo Muratore-Ginanneschi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究利用黎曼流形上随机微分方程的别洛波尔斯卡娅 - 达列茨基公式,通过指数映射描述扩散增量,构建扩散路径测度有限维近似的等变表示。

Comments 20 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17976 2026-07-21 astro-ph.SR 新提交 78%

Evidence for elemental diffusion in the eclipsing binary star AI Phoenicis

食双星AI Phoenicis中元素扩散的证据

Pierre F. L. Maxted, Nicholas Storm, Andreas J. Korn, Marília Carlos, Matthew R. Gent, Sviatoslav B. Borisov, Paula Jofré, Maria Bergemann, Hans-Günter Ludwig, Nicola J. Miller

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究食双星AI Phoenicis,通过获取其光谱测量铁和镁丰度,与M67星团恒星比较,发现F7V恒星有元素扩散特征,可用于测试含元素扩散和混合的单星模型。

Comments Accepted for publication in MNRAS. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16294 2026-07-21 cs.CV cs.AI 新提交 77%

A${}^2$BM: Alignment-Aware Bridge Matching for Image-to-Image Translation

A²BM:用于图像到图像翻译的对齐感知桥接匹配

Aimi Okabayashi, Georges Le Bellier, Nicolas Audebert, Charlotte Pelletier, Thomas Corpetti, Nicolas Courty

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image editing(abstract);分类 cs.CV

AI总结 研究图像到图像翻译中弱对齐数据问题,提出A²BM方法利用图像对对齐,在训练中纳入对齐分数区分真实对应,推理时控制翻译保真度,实验验证该方法比基线表现优,为弱对齐数据的图像翻译提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏