arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-02 至 2026-06-02 共收录 195 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 195 篇

2603.00133 2026-06-02 cs.CV cs.AI 89%

You Don't Need All That Attention: Surgical Memorization Mitigation in Text-to-Image Diffusion Models

你不需要所有注意力:文本到图像扩散模型中的外科记忆缓解

Kairan Zhao, Eleni Triantafillou, Peter Triantafillou

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出GUARD框架,通过吸引-排斥动力学调整去噪过程,结合交叉注意力衰减机制,在不损害图像质量的前提下有效缓解文本到图像扩散模型中的记忆问题。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13273 2026-06-02 cs.AI cs.LG 89%

EMoE: Training-Free Expert Disagreement for Uncertainty-Aware Text-to-Image Diffusion

EMoE: 面向不确定性感知的文本到图像扩散的无训练专家分歧方法

Lucas Berry, Axel Brando, Wei-Di Chang, Juan Camilo Gamboa Higuera, David Meger

机构 * McGill University(麦吉尔大学) Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心 (BSC)) Ideogram AI

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract)

AI总结 提出EMoE方法,通过预训练MoE扩散模型中早期MoE层的专家分歧,无需训练即可估计认知不确定性,用于提示风险诊断和生成质量排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02153 2026-06-02 cs.CV cs.GR 88%

Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking From Sparse Inertial Sensors and Ranging-Based Between-Sensor Distances

超扩散姿态估计器:基于扩散的从稀疏惯性传感器和测距传感器间距离的人体运动跟踪

Dominik Hollidt, Tommaso Bendinelli, Christian Holz

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV、cs.GR

AI总结 提出Ultra Diffusion Poser扩散模型,通过显式建模UWB测距的几何约束(空间布局模块解析重建传感器位置)和引入UWB扩散引导,在扩散采样中强制预测姿态与实测距离对齐,将关节位置误差降低22%。

Comments CVPR 2026 - Computer Vision and Pattern Recognition

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, pp. 7036-7046

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG 87%

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(abstract)

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07152 2026-06-02 cs.MA 87%

Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)

扩散代理:利用多智能体强化学习增强扩散语言模型以生成结构化数据(扩展版)

Aja Khanal, Kaushik T. Ranade, Rishabh Agrawal, Kalyan S. Basu, Apurva Narayan

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Agents of Diffusion (AoD)框架,通过多智能体强化学习结合扩散语言模型与自回归模型的推理能力,实现高语义新颖性和结构保真度的结构化数据生成。

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01380 2026-06-02 cs.CV 85%

Training-free image inversion for one-step diffusion models

无需训练的一步扩散模型图像反演

Tao Wu, Senmao Li, Yaxing Wang, Shiqi Yang, Kai Wang, Joost van de Weijer

机构 * CVC, University of Alabama in Birmingham(CVC,阿拉巴马大学伯明翰分校) Machine Intelligence Institute, Masdar Institute of Science and Technology(机器智能研究所,马斯达尔科技 institute) Jilin University(吉林大学) City University of Hong Kong, Department of Geography(香港城市大学地理系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 提出一种无需训练的反演框架TFinv,通过迭代噪声对齐和后缀学习解决一步扩散模型中真实图像反演与编辑的关键挑战,实现高效编辑。

Comments Accepted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06453 2026-06-02 cs.CV 85%

Pinterest Canvas: Large-Scale Image Generation at Pinterest

Pinterest Canvas: Pinterest 的大规模图像生成系统

Yu Wang, Eric Tzeng, Raymond Shiau, Jie Yang, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出 Pinterest Canvas,一个基于扩散模型的大规模图像生成系统,通过基础模型微调为特定任务(如背景增强和宽高比外扩)生成专用模型,并在线上实验中分别获得18.0%和12.5%的参与度提升。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02331 2026-06-02 cs.CV cs.LG 83%

Hallucination-Aware Diffusion Sampling for Inverse Problems via Robust Prior Updates

基于鲁棒先验更新的幻觉感知扩散采样用于逆问题

Pengfei Jin, Yiqi Tian, Kailong Fan, Bingjie Qi, Quanzheng Li

机构 * Center for Advanced Medical Computing and Analysis, Massachusetts General Hospital and Harvard Medical School(先进医学计算与分析中心,麻省总医院和哈佛医学院) Department of Industrial Engineering, University of Pittsburgh(工业工程系,匹兹堡大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出鲁棒先验更新模块,通过探测扩散先验更新的局部稳定性并重新锚定位移,减少逆问题求解中的测量条件幻觉,提升实例保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00689 2026-06-02 cs.CV 83%

Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning

小波融合扩散模型用于多模态脑MRI合成,具有模态和元数据条件

Muhammad Nabi Yasinzai, Remika Mito, Mangor Pedersen

机构 * Department of Psychology & Neuroscience, Auckland University of Technology(心理学与神经科学系,奥克兰技术大学) Department of Psychiatry, University of Melbourne(精神病学系,墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种小波融合扩散模型(WFDM),结合小波融合变分自编码器(WF-VAE)和条件3D U-Net扩散模型,通过显式模态和元数据条件实现多模态脑MRI合成,解决了数据集模态覆盖不均和异质性问题,在分布对齐上优于现有方法。

Comments 51 pages, 7 figures, including supplementary material. Submitted to Imaging Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00377 2026-06-02 cs.CV 83%

Score-Control for Hallucination Reduction in Diffusion Models

扩散模型中减少幻觉的分数控制

Mahesh Bhosale, Naresh Kumar Devulapally, Abdul Wasi, Chau Pham, Vishnu Suresh Lokhande, David Doermann

机构 * University at Buffalo(布法罗大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型中的幻觉问题,提出基于方差引导的分数调制策略,通过控制分数雅可比矩阵减少幻觉,在保持高保真度和多样性的同时将幻觉降低约25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01865 2026-06-02 cs.RO 82%

Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections

集合监督扩散策略:通过修正学习动作分块扩散

Zhaoting Li, Gang Chen, Javier Alonso-Mora, Cosimo Della Santina, Jens Kober

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出集合监督扩散策略(SDP),利用人类修正中的对比动作分块数据,通过构建期望动作分块集合来训练扩散策略,有效缓解分布偏移并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01658 2026-06-02 cs.CR 82%

CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models

CoreUnlearn: 通过解耦组件级擦除重新思考文本引导扩散模型中的概念遗忘

Mengnan Zhao, Lihe Zhang, Baocai Yin

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 提出CoreUnlearn方法,通过组件提取模块和交换解耦策略,在文本引导扩散模型中解耦并移除目标概念的关键组件,实现有效概念遗忘且最小化模型性能影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09651 2026-06-02 stat.ML cs.LG 82%

The Entropic Signature of Class Speciation in Diffusion Models

扩散模型中类别分化的熵特征

Florian Handke, Dejan Stančević, Felix Koulischer, Thomas Demeester, Luca Ambrogioni

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过追踪潜在语义变量的类别条件熵,检测扩散模型中的语义转变区间,并验证其在高斯混合模型和实际模型中的有效性。

Comments Accepted at International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03211 2026-06-02 cs.LG cs.AI 82%

Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models

前瞻样本奖励引导用于扩散模型的测试时缩放

Yeongmin Kim, Donghyeok Shin, Byeonghu Na, Minsang Park, Richard Lee Kim, Il-Chul Moon

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种高效测试时缩放方法LiDAR采样,通过前瞻几步采样和精确求解器引导粒子向高奖励区域移动,无需反向传播,在GenEval上达到与最新梯度引导方法相同性能且加速9.5倍。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22651 2026-06-02 cs.LG cs.AI 82%

GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning

GUDA: 基于反事实的扩散模型分组训练数据归因方法

Naoki Murata, Yuhta Takida, Chieh-Hsin Lai, Toshimitsu Uesaka, Bac Nguyen, Stefano Ermon, Yuki Mitsufuji

机构 * University of Tokyo(东京大学) Toyota Central Research Laboratory(丰田中央研究所) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出GUDA方法,利用机器遗忘近似反事实模型,通过似然评分规则(ELBO)量化组别影响,实现高效的分组训练数据归因。

Comments Accepted at ICML 2026. Code is available at https://github.com/sony/guda

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10339 2026-06-02 cs.AI 82%

On the Collapse of Generative Paths: A Criterion and Correction for Diffusion Steering

生成路径的崩溃:扩散引导的准则与修正

Ziseok Lee, Minyeong Hwang, Wooyeol Lee, Sanghyun Jo, Jihyung Ko, Young Bin Park, Jae-Mun Choi, Eunho Yang, Kyungsu Kim

机构 * Department of Biomedical Sciences, Seoul National University, Seoul, South Korea(首尔国立大学生物医学科学系) School of Transdisciplinary Innovations, Seoul National University, Seoul, South Korea(首尔国立大学跨学科创新学院) Interdisciplinary Program in AI, Seoul National University, Seoul, South Korea(首尔国立大学人工智能交叉学科项目) Kim Jaechul Graduate School of AI, Seoul, South Korea(金 Jaechul人工智能研究生院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对扩散和流模型推理时引导中出现的边缘路径崩溃问题,提出路径存在准则和自适应路径修正方法ACE,通过时变指数控制中间分布的分位数半径,在药物设计和图像生成任务中优于固定指数基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01615 2026-06-02 cs.CV cs.MM 81%

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。

Comments Published in ACM MM 2025. Address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02532 2026-06-02 cs.CV 79%

Improving Combined Detection and Classification of TEM Defects via Mask-Conditioned Latent Diffusion Augmentation

通过掩码条件潜在扩散增强改善TEM缺陷的联合检测与分类

Ni Li, Nuohao Liu, Ryan Jacobs, Ajay Annamareddy, Maciej P. Polak, Kevin Field, Izabela Szlufarska, Dane Morgan

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Michigan-Ann Arbor(密歇根大学安娜堡分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于掩码条件潜在扩散模型(LDM)的生成式数据增强方法,用于合成可控、自动标注的多类缺陷掩码的TEM图像,以提升小样本下Mask R-CNN模型的缺陷检测与分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02129 2026-06-02 cs.CV 79%

Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization

均衡扩散:面向均衡图像定制的频率感知文本嵌入

Liyuan Ma, Xueji Fang, Guo-Jun Qi

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出均衡扩散方法,通过频率空间分解概念特征并独立优化嵌入,实现风格与主体解耦,提升定制图像的保真度和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02105 2026-06-02 cs.CV 79%

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving

多模态动作扩散用于鲁棒的端到端自动驾驶

Jorge Daniel Rodríguez-Vidal, Diego Porres, Gabriel Villalonga Pineda, Antonio M. López Peña

机构 * Computer Vision Center (CVC)(计算机视觉中心) Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出动作扩散变换器(ADT),通过多模态动作建模和最近邻匹配,在闭环Bench2Drive基准上超越先前最优方法,同时延迟降低十倍。

Comments Preprint. June 1st, 2026. Corresponding author: Jorge Daniel Rodríguez-Vidal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02000 2026-06-02 cs.CV cs.AI eess.IV 79%

Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization

迈向3D感知视频扩散模型:基于网格标记化的无渲染人体运动控制

Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团大模型实验室) Hupan Lab(虎盘实验室) Zhejiang University(浙江大学) INSAIT

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无渲染框架,通过压缩的3D人体网格标记直接条件化视频生成,实现精确的人体运动控制,减少2D引导伪影并提升3D结构建模能力。

Comments Project page: https://jingyunliang.github.io/MeshToken/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01048 2026-06-02 cs.CV 79%

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

解耦残差去噪扩散模型用于统一且数据高效的图像到图像翻译

Ziyue Lin, Jiahe Hou, Hongyu Xia, Xinrui Xie, Feifei Wang, Yuyin Zhou, Wei Wang, Jiawei Liu, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出解耦残差去噪扩散模型(DRDD),通过将扩散过程解耦为随机噪声扩散和确定性残差扩散两个独立阶段,实现统一且数据高效的图像到图像翻译。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00957 2026-06-02 cs.CV 79%

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers

面向大规模文生视频扩散Transformer的边界保护W8A8 HiFloat8量化

Yiming Zhao

机构 * Yiming Zhao(赵毅铭)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对Wan2.1-T2V-14B模型,提出一种边界保护策略的W8A8 HiF8后训练量化方法,通过保留首尾边界块为BF16而量化中间块,在VBench五个维度上匹配或略优于BF16基线。

Comments 6 pages, 5 figures. Accepted to ICME 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00803 2026-06-02 astro-ph.CO cs.CV cs.LG 79%

Generative Diffusion Priors for 3D Mapping of the Dark Universe

用于暗宇宙三维映射的生成扩散先验

Brandon Zhao, Diana Scognamiglio, Olivier Doré, Katherine L. Bouman

机构 * Department of Computing and Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学系) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室) Department of Physics, Duke University(杜克大学物理系) Cahill Center for Astronomy and Astrophysics, California Institute of Technology(加州理工学院卡希尔天文与天体物理中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 利用扩散模型学习宇宙模拟中的先验分布,结合物理正向模型解决弱引力透镜三维暗物质反问题,显著提升重建精度并生成统计一致的后验样本。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00798 2026-06-02 cs.CV cs.AI cs.LG 79%

DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models

DASH: 用于引导校准紧凑扩散模型的双分支分数蒸馏

Abdullah Al Shafi, Kazi Saeed Alam, Sk Imran Hossain, Engelbert Mephu Nguifo

机构 * Khulna University of Engineering & Technology(Khulna 工程与技术大学) University Clermont Auvergne(克莱蒙特-奥弗涅大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对类条件扩散模型参数压缩中无监督无条件分数分支导致引导失效的问题,提出双分支蒸馏框架DASH,通过独立监督两个分支并引入锚点正则化和课程迁移,在5.9倍压缩下保持与教师模型相近的FID和引导保真度。

Comments 14 pages, 7 figures, 4 tables; appendix with additional ablations and qualitative results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00393 2026-06-02 eess.IV cs.CV 79%

AutoIQ: An Ensemble Framework for Automatic Assessment of Geometric Distortion in Prostate Diffusion-Weighted Imaging

AutoIQ:前列腺扩散加权成像中几何畸变自动评估的集成框架

Haoran Sun, Lixia Wang, Yin-Chen Hsu, Hsu-Lei Lee, Chang Gao, Fei Han, Robert Grimm, Vibhas Deshpande, Ziyang Long, Hsin-Jung Yang, Rola Saouaf, Alessandro D'Agnolo, Timothy Daskivich, Hyung Kim, Debiao Li, Yibin Xie

机构 * Biomedical Imaging Research Institute, Cedars-Sinai Medical Center(生物医学成像研究 institute, Cedars-Sinai 医疗中心) Department of Bioengineering, University of California(生物工程系,加州大学) Siemens Medical Solutions USA Inc.(西门子医疗解决方案美国公司) Siemens Healthineers AG(西门子健康影像股份有限公司) Department of Imaging, Cedars-Sinai Medical Center(成像部,Cedars-Sinai 医疗中心) Department of Nuclear Medicine, Cedars-Sinai Medical Center(核医学部,Cedars-Sinai 医疗中心) Department of Urology, Cedars-Sinai Medical Center(泌尿科,Cedars-Sinai 医疗中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出AutoIQ集成机器学习框架,结合分割和配准方法量化DWI几何畸变,用于自动分类畸变严重程度,在独立测试集上达到0.95准确率。

Comments Original research; 11 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00299 2026-06-02 cs.CV cs.AI 79%

Real2SAM2Real: Generative 3D Caches as Complementary Context for Video Diffusion

Real2SAM2Real: 生成式3D缓存作为视频扩散的互补上下文

Jiayi Wu, Haoming Cai, Cornelia Fermuller, Christopher Metzler, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Real2SAM2Real框架,通过3D提升模型提取可编辑的3D缓存作为几何支架,结合软空间对齐注入和微调策略,实现视频扩散模型对相机轨迹和多实体运动的精确解耦控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00153 2026-06-02 cs.CV cs.AI 79%

DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion

DiffCrossGait:基于潜在扩散的2D-3D跨模态步态识别轨迹级对齐

Zhiyang Lu, Ming Cheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对2D-3D跨模态步态识别中的域差异问题,提出DiffCrossGait,通过潜在扩散空间中的轨迹级对齐实现连续模态对齐,并引入三阶段对齐策略确保身份锚定、动态一致性和跨模态结构可恢复性,在SUSTech1K和FreeGait基准上达到最优性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00109 2026-06-02 cs.CV cs.AI cs.LG 79%

VDSB-GWSyn: Diffusion Schrödinger Bridge for Controllable and Anatomically Feasible Guidewire Synthesis in Coronary Angiography

VDSB-GWSyn: 用于冠状动脉造影中可控且解剖学可行的导丝合成的扩散薛定谔桥

Haoyuan Tang, Zhuo Zhang, Jialin Li, Shuai Xiao, Jiachen Yang

机构 * Tianjin University(天津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散薛定谔桥的VDSB-GWSyn框架,通过形状先验和血管分割约束生成可控、高保真导丝样本,显著提升下游导丝端点定位精度。

Comments Early accept to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31162 2026-06-02 cs.CV cs.LG 79%

Guidance for Low-Level Perceptual Editing in Unconditional Diffusion Models

无条件扩散模型中低级感知编辑的引导

Shreyansh Modi, Akshat Tomar, Aarush Aggarwal

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对无条件扩散模型在美学和感知增强中难以进行全局低级变换的问题,提出一种无需训练的推理时机制,通过提取退化概念向量并结合瓶颈修补与无分类器引导,实现图像编辑与质量提升。

Comments 11 pages, 12 figures, Generative Models for Computer Vision Workshop CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏