arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-24 至 2026-03-24 共收录 145 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 10 篇

2603.20828 2026-03-24 cs.CV 91%

EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis

EruDiff:在扩散模型中重构知识以实现高级文本到图像合成

Xiefan Guo, Xinzhu Ma, Haoxiang Ma, Zihao Zhou, Di Huang

机构 * Beihang University(北航大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 本文提出EruDiff,通过Diffusion Knowledge Distribution Matching和Negative-Only Reinforcement Learning提升扩散模型处理隐式提示的能力,增强科学和世界知识生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 89%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20741 2026-03-24 cs.CV 89%

CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration

CTCal: 通过跨时间步自校准重新思考文本到图像扩散模型

Xiefan Guo, Xinzhu Ma, Haiyu Zhang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CTCal,通过利用早期时间步的准确文本-图像对齐来校准后期时间步的表示学习,提升文本到图像生成的对齐精度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21886 2026-03-24 cs.IR cs.CV 88%

ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval

ADaFuSE: 适应性扩散生成图像与文本融合用于交互式文本到图像检索

Zhuocheng Zhang, Xingwu Zhang, Kangheng Liang, Guanxuan Li, Richard Mccreadie, Zijun Long

机构 * Hunan University(湖南大学) University of Glasgow(格拉斯哥大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ADaFuSE通过引入双分支融合机制,结合自适应门控和语义感知专家混合,提升交互式文本到图像检索的性能,实现更稳健的多模态融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20880 2026-03-24 cs.CV 88%

When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance

当安全碰撞时:通过自适应安全引导解决文本到图像扩散中的多类别有害冲突

Yongli Xiang, Ziming Hong, Zhaoqing Wang, Xiangyu Zhao, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) City University of Hong Kong(香港城市大学) TMLR Group, Hong Kong Baptist University(Baptist大学TMLR小组)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CASG框架,通过动态识别并应用类别对齐的安全方向,解决文本到图像扩散模型中多类别有害冲突问题,实验表明其能有效降低有害率。

Comments CVPR 2026; Code is released at CVPR_CASG" target="_blank" rel="noopener">https://github.com/tmllab/2026_CVPR_CASG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20470 2026-03-24 cs.AI 88%

DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成

Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, Jun Liu

机构 * Lancaster University(兰卡斯特大学) University of Bristol(布里斯托大学) Adobe Research(Adobe研究院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract)

AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。

Comments CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20201 2026-03-24 cs.MM cs.CV cs.CY 81%

FIGURA: A Modular Prompt Engineering Method for Artistic Figure Photography in Safety-Filtered Text-to-Image Models

FIGURA:一种用于安全过滤文本到图像模型中艺术人物摄影的模块化提示工程方法

Luca Cazzaniga

机构 * Independent Researcher(独立研究员)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出FIGURA方法,通过模块化提示工程系统解决安全过滤文本到图像模型中艺术人物摄影的限制问题,通过200+测试验证其有效性,揭示安全过滤机制的运作原理并提供系统解决方案。

Comments 10 pages, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21213 2026-03-24 cs.CV cs.AI 79%

Positional Segmentor-Guided Counterfactual Fine-Tuning for Spatially Localized Image Synthesis

基于位置分割器的反事实微调用于空间局部化图像合成

Tian Xia, Matthew Sinclair, Andreas Schuh, Fabio De Sousa Ribeiro, Raghav Mehta, Rajat Rasal, Esther Puyol-Antón, Samuel Gerber, Kersten Petersen, Michiel Schaap, Ben Glocker

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部,英国) HeartFlow, Inc., Mountain View, CA, USA(HeartFlow 公司,美国加州山景城)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出Positional Seg-CFT,通过将每个结构细分为区域并独立测量每个区域,实现空间局部化的反事实生成,提升冠状动脉CT血管造影中疾病建模的精细空间控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI 57%

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12018 2026-03-24 cs.HC cs.AI cs.ET 50%

An Intent of Collaboration: On Agencies between Designers and Emerging (Intelligent) Technologies

协作的意图:设计者与新兴(智能)技术之间的机构

Pei-Ying Lin, Julie Heij, Iris Borst, Britt Joosten, Kristina Andersen, Wijnand IJsselsteijn

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究探讨设计者与智能技术协作中的权力动态,提出通过反思创作过程、理解技术特性及调整人机关系来恢复创作自主性。

Comments Accepted by IASDR Conference 2025, Taipei, Taiwan 16 pages excluding references, 8 figures

Journal ref Proceedings of IASDR 2025: Design Next

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2603.21176 2026-03-24 cs.CV 88%

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21615 2026-03-24 cs.CV 79%

AdaEdit: Adaptive Temporal and Channel Modulation for Flow-Based Image Editing

AdaEdit: 一种基于流的图像编辑中的自适应时间与通道调节

Guandong Li, Zhaobin Chu

机构 * iFLYTEK

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出AdaEdit框架,通过自适应的渐进注入策略和通道选择性潜在扰动,解决流匹配模型中源特征注入与目标特征生成的矛盾,提升图像编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01755 2026-03-24 cs.CV 79%

FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing

FreqEdit: 为鲁棒多轮图像编辑保留高频特征

Yucheng Liao, Jiajun Liang, Kaiqian Cui, Baoquan Zhao, Haoran Xie, Wei Liu, Qing Li, Xudong Mao

机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) Lingnan University(岭大大学) Video Rebirth The Hong Kong Polytechnic University(香港理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出FreqEdit框架,通过高频特征注入、自适应注入策略和路径补偿机制,解决多轮图像编辑中高频信息丢失问题,提升编辑稳定性和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 97 篇

2603.22275 2026-03-24 cs.CV 85%

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22125 2026-03-24 cs.CV 83%

DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

DA-VAE:通过细节对齐实现扩散模型的插件式潜在压缩

Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DA-VAE,通过轻量级调整预训练扩散模型,实现潜在空间压缩,使1024×1024图像生成使用32×32 tokens,比原模型减少40%,并支持2048×2048生成,保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 83%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21348 2026-03-24 cs.CV 83%

Efficient Coarse-to-Fine Diffusion Models with Time Step Sequence Redistribution

高效粗到细扩散模型与时间步序列重分布

Yu-Shan Tai, An-Yeu, Wu

机构 * Graduate Institute of Electrical Engineering(电气工程研究所) National Taiwan University(台湾大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出粗到细扩散模型与时间步序列重分布方法,通过减少粗特征生成计算和优化采样轨迹,实现CIFAR10和LSUN-Church上80%-90%的计算量减少,近无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21085 2026-03-24 cs.CV 83%

Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models

通过方差扩展损失镇定采样扰动以提升潜在扩散模型

Qifan Li, Xingyu Zhou, Jinhua Zhang, Weiyi You, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出方差扩展损失,通过对抗重建与方差扩展的交互,提升潜在空间鲁棒性,改进扩散生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10634 2026-03-24 cs.CV cs.AI 83%

Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models

对称流匹配:基于分数生成模型的统一图像生成、分割与分类

Francisco Caetano, Christiaan Viviers, Peter H. N. De With, Fons van der Sommen

专题命中 扩散模型 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出对称流匹配方法,通过联合建模正反向变换实现图像生成、分割和分类的统一,采用对称学习目标确保双向一致性并保留生成多样性,实验表明其在多个基准上取得SOTA性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04058 2026-03-24 cs.LG 82%

Unlearning in Diffusion models under Data Constraints: A Variational Inference Approach

在数据约束下扩散模型的卸载:一种变分推断方法

Subhodip Panda, Varun M S, Shreyans Jain, Sarthak Kumar Maharana, Prathosh A. P

机构 * Department of ECE, Indian Institute of Science(印度科学研究院电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出变分扩散卸载方法,用于在数据受限条件下防止预训练扩散模型生成不良内容,通过优化损失函数中的可塑性诱导器和稳定性正则化器来提高效率。

Journal ref Transaction on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02929 2026-03-24 q-bio.QM 82%

Microscopy image reconstruction with physics-informed denoising diffusion probabilistic model

利用物理信息的去噪扩散概率模型进行显微图像重建

Rui Li, Gabriel della Maggiora, Vardan Andriasyan, Anthony Petkidis, Artsemi Yushkevich, Mikhail Kudryashev, Artur Yakimovich

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本文提出将显微成像物理问题融入模型损失函数,通过合成数据训练,改进DDPM以减少伪影,提升显微图像重建质量。

Comments 16 pages, 5 figures

Journal ref Communications Engineering 3, no. 1 (2024): 186

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01003 2026-03-24 cs.LG cs.RO 82%

Contractive Diffusion Policies: Robust Action Diffusion via Contractive Score-Based Sampling with Differential Equations

收缩扩散策略:通过微分方程的收缩分数基采样实现鲁棒动作扩散

Amin Abyaneh, Charlotte Morissette, Mohamad H. Danesh, Anas El Houssaini, David Meger, Gregory Dudek, Hsiu-Chin Lin

机构 * Department of Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系) Department of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila–Quebec AI Institute(魁北克人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出收缩扩散策略,通过引入收缩行为提升扩散采样动态的鲁棒性,减少求解和分数匹配误差,降低动作方差,在数据稀缺情况下表现优异。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21978 2026-03-24 cs.CV cs.GR 81%

GeoFusion-CAD: Structure-Aware Diffusion with Geometric State Space for Parametric 3D Design

GeoFusion-CAD:基于几何状态空间的结构感知扩散模型用于参数化3D设计

Xiaolei Zhou, Chuangjie Fang, Jie Wu, Jingyi Yang, Boyi Lin, Jianwei Zheng

机构 * Zhejiang University of Technology(之江大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北航)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出GeoFusion-CAD,一种端到端扩散框架,通过几何状态空间建模实现长序列参数化3D设计生成,解决了传统方法在复杂几何拓扑依赖下的扩展性问题。

Comments Accepted to CVPR 2026 (Findings). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02246 2026-03-24 cs.CV cs.AI cs.LG stat.ML 80%

Conditional Variational Diffusion Models

条件变分扩散模型

Gabriel della Maggiora, Luis Alberto Croquevielle, Nikita Deshpande, Harry Horsley, Thomas Heinis, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(先进系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗斯托克亥姆霍尔茨研究中心) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Bladder Infection and Immunity Group (BIIG), UCL Centre for Kidney and Bladder Health(膀胱感染与免疫组(BIIG),UCL肾与膀胱健康中心) Division of Medicine, University College London(伦敦大学学院医学系) Institute of Computer Science, University of Wrocław(沃斯克大学计算机科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种在训练过程中学习方差调度的方法,用于解决逆问题,适用于超分辨率显微镜和定量相成像,实现高质量解决方案。

Comments Denoising Diffusion Probabilistic Models, Inverse Problems, Generative Models, Super Resolution, Phase Quantification, Variational Methods

Journal ref In The Twelfth International Conference on Learning Representations. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21856 2026-03-24 cs.CV 79%

Climate Prompting: Generating the Madden-Julian Oscillation using Video Diffusion and Low-Dimensional Conditioning

气候提示:利用视频扩散和低维条件生成 Madden-Julian 振荡

Sulian Thual, Feiyang Cai, Jingjing Wang, Feng Luo

机构 * School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成MJO序列,通过低维指标条件化生成MJO,并通过理想化条件分析其物理驱动机制,为热带大气预测提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21547 2026-03-24 cs.CV 79%

PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models

PROBE: 诊断 erased 文本到视频扩散模型中的残余概念容量

Yiwei Xie, Zheng Zhang, Ping Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Computer Science and Engineering, University of Nevada(内华达大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PROBE 通过多级评估框架揭示文本到视频扩散模型中被擦除概念的残余容量,发现所有测试方法留有可测量的残余能力,且其鲁棒性与干预深度相关,指出当前擦除方法仅实现输出级抑制而非表征移除。

Comments This preprint was posted after submission to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG 79%

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV 79%

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17699 2026-03-24 cs.CV cs.LG 79%

GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver

GAS:通过通用对抗求解器改进扩散ODE的离散化

Aleksandr Oganov, Ilya Bykov, Eva Neudachina, Mishan Aliev, Alexander Tolmachev, Alexander Sidorov, Aleksandr Zuev, Andrey Okhotin, Denis Rakitin, Aibek Alanov

机构 * HSE University(俄罗斯高等经济学院) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通用对抗求解器,通过结合原蒸馏损失与对抗训练,提升扩散模型细节保真度,无需复杂训练技巧,实现更高效的ODE离散化。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04597 2026-03-24 cs.CV 79%

DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models

DisPatch:基于扩散模型的物体检测对抗性补丁消除方法

Jin Ma, Mohammed Aldeen, Christopher Salas, Feng Luo, Mashrur Chowdhury, Mert Pesé, Long Cheng

机构 * Clemson University(克莱姆森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DisPatch,一种基于扩散模型的物体检测防御框架,通过再生和修正策略消除对抗性补丁,有效提升检测鲁棒性,实验表明其在隐藏攻击和生成攻击中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏