arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-28 至 2026-04-28 共收录 120 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2404.10141 2026-04-28 cs.CV cs.CL cs.MM 88%

ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis

ANCHOR:基于大语言模型的文本到图像合成中的主体条件化

Aashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee

机构 * Optum AI The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV、cs.MM

AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 79%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14888 2026-04-28 cs.CV cs.AI 70%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08598 2026-04-28 cs.IR cs.CV 57%

Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search

预训练后再适应:面向基于文本的人脸搜索的不确定性感知测试时间适应

Jiahao Zhang, Shaofei Huang, Yaxiong Wang, Zhedong Zheng

机构 * University of Macau(澳门大学) Hefei University of Technology(合肥工业大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种预训练后再适应方法,通过离线测试时间适应减少对目标域标注数据的依赖,引入不确定性感知测试时间适应框架以提升人像搜索系统的鲁棒性和效率。

Comments Accepted to ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2510.14978 2026-04-28 cs.CV cs.LG 83%

Learning an Image Editing Model without Image Editing Pairs

无需图像编辑配对学习图像编辑模型

Nupur Kumari, Sheng-Yu Wang, Nanxuan Zhao, Yotam Nitzan, Yuheng Li, Krishna Kumar Singh, Richard Zhang, Eli Shechtman, Jun-Yan Zhu, Xun Huang

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需配对数据的图像编辑模型训练方法,通过扩散模型解卷积和视觉语言模型反馈实现端到端优化,同时结合分布匹配损失提升视觉真实性。

Comments project page: https://nupurkmr9.github.io/npedit/ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24625 2026-04-28 cs.CV cs.AI cs.LG cs.MM 81%

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

Meta-CoT:提升图像编辑的粒度与泛化能力

Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun Dai, Yunlong Lin, Chunyu Wang, Qinglin Lu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Hunyuan, Tencent(腾讯 Hunyuan)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 Meta-CoT通过双重分解提升图像编辑的粒度和泛化能力,通过任务-目标-理解能力三元组分解和五元基本元任务训练策略,显著提高编辑性能。

Comments Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI 79%

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24104 2026-04-28 cs.CL 50%

Factual and Edit-Sensitive Graph-to-Sequence Generation via Graph-Aware Adaptive Noising

通过图感知自适应噪声生成事实和编辑敏感的图到序列生成

Aditya Hemant Shahane, Anuj Kumar Sirohi, Tanmoy Chakraborty, Prathosh A P, Sandeep Kumar

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里分校电子工程系) Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度)

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出DLM4G框架,通过自适应噪声策略提升图到序列生成的事实性和编辑敏感性,在多个数据集上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 96 篇

2604.24351 2026-04-28 cs.LG cs.AI cs.CV cs.SE 90%

Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion

扩散模板:一种统一的插件框架,用于可控扩散

Zhongjie Duan, Hong Zhang, Yingda Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,summary_cn);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出Diffusion Templates框架,通过解耦基础模型推理与可控能力注入,统一了扩散模型的可控能力,支持多种任务和不同backbone的兼容性,提升了模块化和可扩展性。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23609 2026-04-28 cs.RO 87%

Tube Diffusion Policy: Reactive Visual-Tactile Policy Learning for Contact-rich Manipulation

管扩散策略:面向富接触操作的反应式视觉-触觉策略学习

Teng Xue, Alberto Rigo, Bingjian Huang, Jiayi Shen, Zhengtong Xu, Nick Colonnese, Amirhossein H. Memar

机构 * Meta Reality Labs Research(Meta现实实验室) Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) University of Toronto(多伦多大学) Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Tube Diffusion Policy,通过结合扩散模型与管反馈控制,解决富接触操作中对不确定性和高频触觉反馈的快速反应需求,实验验证其在多种任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24575 2026-04-28 cs.CV 83%

Diffusion Model as a Generalist Segmentation Learner

扩散模型作为通用分割学习者

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出DiGSeg,利用预训练扩散模型实现通用分割框架,通过编码图像和掩码到潜在空间,并结合CLIP对齐的文本路径,实现基于外观和任意文本提示的结构化分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24493 2026-04-28 cs.CV 83%

CA-IDD: Cross-Attention Guided Identity-Conditional Diffusion for Identity-Consistent Face Swapping

CA-IDD:跨注意力引导的身份条件扩散用于身份一致的面部交换

Md Shohel Rana, Tanoy Debnath

机构 * School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出CA-IDD,一种基于扩散的面部交换方法,通过多尺度交叉注意力整合 gaze、身份和面部解析,提升身份一致性和视觉真实性,实现稳定训练和精细区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23858 2026-04-28 cs.CV 83%

Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation

潜在帧剪枝:一种无训练方法,连接传统视频压缩与现代扩散变换器以实现高效生成

Dennis Menn, Chih-Hsien Chou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Futurewei Technologies, Inc.(未来科技公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的潜在帧剪枝方法,通过剪枝重复的潜在块来减少计算负担并提高生成速度,同时引入注意力恢复机制以解决训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11789 2026-04-28 stat.ML cs.CV cs.LG 83%

Statistical Test for Diffusion-Based Anomaly Localization via Selective Inference

基于选择性推断的扩散模型异常定位统计检验

Teruyuki Katsuoka, Tomohiro Shiraishi, Daiki Miwa, Vo Nguyen Le Duy, Ichiro Takeuchi

机构 * Nagoya University(名古屋大学) University of Information Technology(信息技术大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市) RIKEN(理化学研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出基于选择性推断的统计框架,用于量化检测到的异常区域显著性,通过提供p值评估假阳性率,提升异常定位的可靠性。

Comments 35 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23536 2026-04-28 cs.CV 83%

$Z^2$-Sampling: Zero-Cost Zigzag Trajectories for Semantic Alignment in Diffusion Models

$Z^2$-采样:用于扩散模型语义对齐的零成本zigzag轨迹

Haosen Li, Wenshuo Chen, Shaofeng Liang, Lei Wang, Kaishen Yuan, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Griffith University & Data61/CSIRO(格里菲斯大学及Data61/CSIRO)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出$Z^2$-采样,通过隐式代数坍缩与动态缓存的时间语义代理,实现零成本zigzag轨迹,提升采样效率并保持语义探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14897 2026-04-28 cs.CV 83%

Seer: Language Instructed Video Prediction with Latent Diffusion Models

Seer:基于潜在扩散模型的语言指导视频预测

Xianfan Gu, Chuan Wen, Weirui Ye, Jiaming Song, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai AI Lab(上海人工智能实验室) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Seer通过扩展预训练文本到图像扩散模型的时间轴,提出高效模型以实现文本条件视频预测,提升机器人未来预测能力,实验表明其在多个数据集上性能优越。

Comments 31 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24487 2026-04-28 cs.RO 82%

Guiding Vector Field Generation via Score-based Diffusion Model

通过基于分数的扩散模型引导向量场生成

Zirui Chen, Shiliang Guo, Shiyu Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) WINDY Lab, Department of Artificial Intelligence, Westlake University(西湖大学人工智能系WINDY实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于分数的引导向量场(SGVF),利用生成模型直接从数据分布构建向量场,解决传统方法在复杂路径中的不足,实验表明其在机器人导航中表现优异。

Comments 8 pages, 6 figrues, ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13312 2026-04-28 cs.RO cs.AI cs.LG 82%

EL3DD: Extended Latent 3D Diffusion for Language Conditioned Multitask Manipulation

EL3DD:扩展的潜在3D扩散用于语言条件的多任务操作

Jonas Bode, Raphael Memmesheimer, Sven Behnke

机构 * Autonomous Intelligent Systems, University of Bonn(博恩大学自主智能系统)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出EL3DD模型,通过结合视觉和文本输入,利用扩散模型生成精确的机器人轨迹,提升多任务操作的性能和长周期成功率。

Comments 10 pages; 2 figures; 1 table

Journal ref European Robotics Forum 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24719 2026-04-28 cs.CV 79%

DiffuSAM: Diffusion-Based Prompt-Free SAM2 for Few-Shot and Source-Free Medical Image Segmentation

DiffuSAM: 基于扩散的无提示SAM2用于少样本和源无关医学图像分割

Tal Grossman, Noa Cahan, Lev Ayzenberg, Hayit Greenspan

机构 * School of Electrical Engineering, Tel Aviv University, Israel(特拉维夫大学电气工程学院) School of Biomedical Engineering, Tel Aviv University, Israel(特拉维夫大学生物医学工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffuSAM通过轻量级扩散先验生成SAM2兼容的分割掩码嵌入,实现无提示医学图像分割,无需用户输入,在BTCV和CHAOS数据集上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24407 2026-04-28 cs.CV 79%

AD-Relight: Training-Free Banner Relighting via Illumination Translation with Diffusion Priors

AD-Relight:通过扩散先验进行无训练横幅照明转换的免训练横幅重照明

Rameshwar Mishra, A V Subramanyam

机构 * Indraprastha Institute of Information Technology(印度理工学院信息技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AD-Relight,一种无训练的多阶段框架,利用扩散模型在测试时适应重照明新插入的Photoshop横幅,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06166 2026-04-28 cs.CV 79%

B-FIRE: Binning-Free Diffusion Implicit Neural Representation for Hyper-Accelerated Motion-Resolved MRI

B-FIRE:无分组扩散隐式神经表示用于超加速运动分辨MRI

Di Xu, Hengjie Liu, Yang Yang, Mary Feng, Jin Ning, Xin Miao, Jessica E. Scholey, Alexandra E. Hotca-cho, William C. Chen, Michael Ohliger, Martina Descovich, Huiming Dong, Wensha Yang, Ke Sheng

机构 * Radiation Oncology, University of California, San Francisco, California(加州大学旧金山分校放射肿瘤学系) Radiology and Biomedical Imaging, University of California, San Francisco, California(加州大学旧金山分校放射学与生物医学成像系) Siemens Medical Solutions USA, Inc., Cleveland, Ohio(西门子医疗解决方案美国公司,克利夫兰,俄亥俄) Radiology at Children’s Hospital Los Angeles, Keck School of Medicine, University of Southern California, Los Angeles, California(洛杉矶儿童医院放射学,美国南加州大学凯克医学院,洛杉矶,加利福尼亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 B-FIRE通过扩散隐式神经表示框架实现超加速MRI重建,解决运动分辨信息模糊问题,提升3D腹部解剖的即时重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23709 2026-04-28 cs.CV eess.IV 79%

ZID-Net: Zero-Inference Diffusion Prior Decoupling Network for Single Image Dehazing

ZID-Net:零推理扩散先验解耦网络用于单图像去雾

Xinheng Li, Minghao Chen, Mengqing Wu, Yan Liu, Guanying Huo

机构 * College of Information Science and Engineering, Hohai University(河海大学信息科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ZID-Net通过解耦扩散监督与前馈推理,提出一种高效去雾框架,结合频率-空间解耦前馈骨干网络和物理先验,实现高PSNR和低延迟的去雾效果。

Comments Submitted to Neurocomputing. Includes 12 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23651 2026-04-28 cs.CV 79%

Geometry-Conditioned Diffusion for Occlusion-Robust In-Bed Pose Estimation

基于几何条件的扩散模型用于抗遮挡的卧床姿态估计

Navid Aslankhani Khameneh, Marco Carletti, Cigdem Beyan

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) EVS - Embedded Vision Systems Srl(嵌入式视觉系统股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于几何条件的扩散模型,解决卧床姿态估计中遮挡问题,通过生成模型直接从骨骼关键点生成遮挡图像,提升遮挡鲁棒性。

Comments This is the preprint version of the paper. The final version has been accepted for publication in the Proceedings of the 20th IEEE International Conference on Automatic Face and Gesture Recognition (IEEE FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23636 2026-04-28 cs.CV 79%

Discriminator-Guided Adaptive Diffusion for Source-Free Test-Time Adaptation under Image Corruptions

判别器引导的自适应扩散用于无源测试时间适应下的图像损坏

Francesco Olivato, Cigdem Beyan, Vittorio Murino

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) AI for Good (AIGO), Istituto Italiano di Tecnologia(意大利技术研究院人工智能与善部(AIGO))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于扩散的输入级适应框架,在测试时保持所有源训练模型冻结,通过判别器引导的自适应扩散策略动态控制每个测试样本的扰动量,以抑制特定域的损坏,提升鲁棒性。

Comments This is the preprint (submitted version) of the paper. The final version has been accepted for publication in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04749 2026-04-28 cs.CV 79%

Mitigating Long-Tail Bias via Prompt-Controlled Diffusion Augmentation

通过提示控制的扩散增强缓解长尾偏差

Buddhi Wijenayake, Nichula Wasalathilake, Roshan Godaliyadda, Vijitha Herath, Parakrama Ekanayake, Vishal M. Patel

机构 * University of Peradeniya(珀德尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于提示控制的扩散增强框架,通过生成带标签的图像样本来增强少数类,提升遥感图像分割中长尾不平衡问题的处理效果。

Comments Accepted to Publication at 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06904 2026-04-28 cs.CV 79%

BIR-Adapter: A parameter-efficient diffusion adapter for blind image restoration

BIR-Adapter:一种参数高效的扩散适配器用于盲图像恢复

Cem Eteke, Alexander Griessel, Wolfgang Kellerer, Eckehard Steinbach

机构 * Chair of Media Technology, Munich Institute of Robotics and Machine Intelligence(媒体技术教授会,慕尼黑机器人与机器智能研究所) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BIR-Adapter,一种参数高效的扩散适配器,用于盲图像恢复。通过减少训练参数数量和引入采样引导机制,提升恢复可靠性,实验表明其在多个设置中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22808 2026-04-28 cs.CV cs.AI eess.IV 79%

FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers

FreqFormer:具有自适应频谱路由的分层频域注意力机制用于长序列视频扩散变换器

Haopeng Jin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FreqFormer通过分层频域注意力机制,利用视频特征的频谱结构,采用不同操作符处理不同频段,降低长序列视频扩散变换器的计算与内存开销。

Comments 24 pages, 17 figures, 14 tables, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21066 2026-04-28 cs.CV cs.LG stat.ME 79%

Optimizing Diffusion Priors in Image Reconstruction from a Single Observation

从单个观测重建图像中优化扩散先验

Frederic Wang, Katherine L. Bouman

机构 * Caltech(加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过结合现有扩散先验生成单专家先验并优化指数,以提升单观测图像重建的可靠性,验证了在黑洞成像和文本条件去模糊中效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18836 2026-04-28 eess.IV cs.AI cs.CV 79%

Dual-domain Multi-path Self-supervised Diffusion Model for Accelerated MRI Reconstruction

双域多路径自监督扩散模型用于加速MRI重建

Yuxuan Zhang, Jinkui Hao, Bo Zhou

机构 * Department of Radiology, Northwestern University(放射科,西北大学) Department of Biomedical Engineering, Huazhong University of Science and Technology(生物医学工程系,华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双域多路径自监督扩散模型,通过自监督训练方案、轻量混合注意力网络和多路径推理策略,提升MRI重建的准确性、效率和可解释性,克服传统模型依赖全采样数据的局限。

Comments Accepted at IEEE-TNNLS, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24692 2026-04-28 cs.LG 78%

Diffusion-Guided Feature Selection via Nishimori Temperature: Noise-Based Spectral Embedding

基于尼希莫里温度的扩散引导特征选择:基于噪声的谱嵌入

Vasiliy S. Usatyuk, Denis A. Sapozhnikov, Sergey I. Egorov

机构 * Department of Computer Science(计算机科学系) South-West State University(西南州大学) T8 LLC Moscow, Russia(T8 LLC莫斯科俄罗斯) South-West State University Kursk, Russia(西南州大学库尔斯克俄罗斯)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于噪声的谱嵌入方法,通过构建稀疏相似图并识别尼希莫里温度,实现高维数据中信息特征的选择,实验表明其在压缩下保持分类精度优于传统方法。

Comments 8 pages, 3 figures, extended version (with noise shift proof) of DSPA2026 article

详情

展开后加载摘要…

URL PDF HTML 收藏