arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-16 至 2026-06-16 共收录 142 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 142 篇

2603.17353 2026-06-16 cs.LG cs.AI 版本更新 87%

Learning Permutation Distributions via Reflected Diffusion on Ranks

通过秩上的反射扩散学习排列分布

Sizhuang He, Yangtian Zhang, Shiyang Zhang, David van Dijk

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Soft-Rank Diffusion框架,通过将排列松弛为软秩实现平滑扩散,并引入上下文广义Plackett-Luce去噪器,在排序和组合优化任务上优于现有扩散方法。

Comments 18 pages including the appendix, 7 figures, 9 tables, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14727 2026-06-16 cs.CV 新提交 86%

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis

FairGen: 用于人口统计公平医学图像生成的偏好对齐扩散模型

Zhimin Li, Ruichen Zhang, Zhen Tan, Howard J Aizenstein, Jingtong Hu, Tianlong Chen

机构 * University of Pittsburgh, Swanson School of Engineering(匹兹堡大学斯旺森工程学院) The University of North Carolina at Chapel Hill, Department of Computer Science(北卡罗来纳大学教堂山分校计算机科学系) Arizona State University, School of Computing and Augmented Intelligence(亚利桑那州立大学计算与增强智能学院) University of Pittsburgh, Department of Psychiatry(匹兹堡大学精神病学系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 提出FairGen框架,通过将医生偏好嵌入扩散模型生成过程,合成人口统计平衡的医学图像,在皮肤、胸片和脑MRI任务上分别实现95.9%、80.0%和35.2%的公平性提升,同时保持诊断准确性。

Comments Accepted for publication in npj Digital Medicine. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15590 2026-06-16 cs.CV 新提交 85%

Unlocking Diffusion Hierarchies: Adaptive Timestep Selection for Zero-Shot Segmentation

解锁扩散层次:自适应时间步选择用于零样本分割

Ramin Nakhli, Mahesh Ramachandran, Luca Ballan

机构 * Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出自适应时间步选择机制,利用扩散模型去噪过程中的层次语义进展,结合上下文相似度图融合高分辨率注意力与U-Net特征,实现零样本分割性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15796 2026-06-16 cs.CV cs.AI 新提交 83%

DifFRACT: Diffusion Feature Reconstruction and Attribution for Circuit Tracing

DifFRACT:用于电路追踪的扩散特征重构与归因

Artyom Mazur, Nina Konovalova, Aibek Alanov

机构 * HSE University(高等经济学院) FusionBrain Lab(FusionBrain实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文扩展了基于转码器的电路追踪方法到多模态扩散Transformer,通过训练时间步条件转码器近似MLP子层,实现精确的特征级归因并恢复可解释电路,揭示了属性绑定和跨流语义传播机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14792 2026-06-16 cs.CV cs.AI 新提交 83%

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

基于离散扩散模型的视觉-文本思维高效强化学习

Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai, Eunho Yang, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼AI) AITRICS Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出用离散扩散模型替代自回归模型进行多模态强化学习,通过局部视觉编辑减少计算量,并设计分解奖励分配策略解决跨模态干扰问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14756 2026-06-16 cs.CV cs.AI cs.LG 新提交 83%

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models

分而除噪:一种公平组合扩散模型的博弈论方法

Abhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski, Tommi Jaakkola

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出Divide-and-Denoise方法,通过公平分配博弈协调多个预训练扩散模型,在采样时划分区域并引导各模型去噪,解决模型主导或冲突问题,在条件图像生成中优于基线。

Comments Accepted as spotlight at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00352 2026-06-16 cs.CV cs.AI 83%

Detecting AI-Generated Images via Diffusion Snap-Back Reconstruction: A Forensic Approach

通过扩散快回重建检测AI生成图像:一种取证方法

Mohd Ruhul Ameen, Akif Islam

机构 * Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(1 计算机科学与工程系,孟加拉国工程与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过扩散模型重建图像时的响应行为来检测AI生成图像,利用LPIPS等指标分析图像与扩散模型去噪行为的匹配程度,实验显示方法在识别准确率上表现优异。

Comments Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence and Networking (QPAIN 2026)

Journal ref 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10389 2026-06-16 cs.CV cs.AI 版本更新 83%

Region-Adaptive Sampling for Diffusion Transformers

扩散变压器的区域自适应采样

Ziming Liu, Yifan Yang, Chengruidong Zhang, Yiqi Zhang, Lili Qiu, Yang You, Yuqing Yang

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RAS,一种无需训练的自适应采样策略,通过动态分配不同采样比例到图像区域,实现扩散变压器2.36-2.51倍加速且质量损失极小。

Comments CVPR'26 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18324 2026-06-16 cs.CV cs.AI cs.GR cs.LG stat.ML 版本更新 82%

Improved Baselines with Representation Autoencoders

改进的基于表示自动编码器的基线

Jaskirat Singh, Boyang Zheng, Zongze Wu, Richard Zhang, Eli Shechtman, Saining Xie

机构 * Adobe Research(Adobe研究院) ANU(澳大利亚国立大学) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 本文研究了基于表示自动编码器(RAE)的设计选择,发现三个见解,简化并改进了RAE。首先,研究了一种通用公式,将表示定义为最后k个编码器层的总和,而不是仅最终层。其次,研究了RAE与表示对齐(REPA)的假设,发现两者具有互补的工作机制。最后,改进了RAE在无分类器指导(CFG)中的表现,通过重新参数化DiT模型输出,实现了无需训练第二个模型的指导效果。RAEv2在ImageNet-256上达到了1.06的gFID,且训练效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16700 2026-06-16 cs.CL 新提交 82%

Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models

多轮反射掩码激发掩码扩散模型中的推理能力

Yanming Zhang, Yihan Bian, Jingyuan Qi, Yuguang Yao, Lifu Huang, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Virginia Tech(弗吉尼亚理工大学) Intuit UC Davis(加州大学戴维斯分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)

AI总结 提出反射掩码(RM)方法,通过轻量级后训练使掩码扩散模型具备多轮掩码与去噪能力,实现迭代局部修正,无需架构改变,在文本生成、数独和图像编辑等任务中优于基线。

Comments 22 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15154 2026-06-16 cs.RO 新提交 82%

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

任务感知的环境增强:通过屏蔽条件扩散实现可靠导航

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15023 2026-06-16 physics.flu-dyn cs.LG 新提交 82%

Multiscale Hypersonic Boundary Layer Reconstruction via Spectral Binning and Subdomain-wise Conditional Diffusion

基于频谱分箱和子域条件扩散的高超声速边界层多尺度重构

Hojin Kim, Dibyajyoti Chakraborty, Takahiko Toki, Carlo Scalo, Romit Maulik

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Mathematics and Computer Science Division, Argonne National Laboratory(阿贡国家实验室数学与计算机科学部)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出多尺度概率重构框架,通过条件扩散模型从顶部壁面有限观测推断近壁状态,采用软重叠修复策略和边界频谱损失实现高超声速库埃特流全场重构。

Comments 33 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03212 2026-06-16 cs.LG 版本更新 82%

Bayesian Tensor Decomposition with Diffusion Model Prior

贝叶斯张量分解与扩散模型先验

Zerui Tao, Qibin Zhao

机构 * Zerui Tao(泽瑞·陶) Qibin Zhao(赵启斌)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出DiffBCP框架,结合累积收缩过程先验和预训练扩散模型,通过分裂吉布斯采样实现贝叶斯CP分解,在图像修复和去噪任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14732 2026-06-16 cs.CV cs.AI cs.LG cs.MM 新提交 81%

Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion

Steady-Forcing: 长时程自然视频扩散中空间持久性与运动连续性的平衡

Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong, Unsang Park

机构 * Department of Computer Science and Engineering, Sogang University(西江大学计算机科学与工程系) Department of Artificial Intelligence, Sogang University(西江大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Steady-Forcing框架,通过视觉锚点、运动记忆和蒸馏等技术,在长时程固定相机自然视频生成中平衡背景稳定与运动连续性,优于现有方法。

Comments Project page: https://minar09.github.io/steadyforcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13655 2026-06-16 cs.CV cs.GR 新提交 81%

Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction

Flex4DHuman:面向4D人体重建的灵活多视角视频扩散模型

Jen-Hao Cheng, Yipeng Wang, Hao Zhang, Gengshan Yang, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学) World Labs

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出Flex4DHuman,一种基于相对相机位姿条件化的多视角视频扩散模型,无需显式几何先验即可将单目或稀疏多视角视频转换为密集多视角视频,并用于4D高斯溅射重建。

Comments Project Page: https://andy-cheng.github.io/Flex4DHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16255 2026-06-16 cs.CV 新提交 79%

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

UniDDT: 使用解耦扩散变换器统一多模态理解与生成

Shuai Wang, Liang Li, Yang Chen, Ruopeng Gao, Yao Teng, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Seed(字节跳动Seed) University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。

Comments This work was completed in \textbf{November 2025}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15486 2026-06-16 cs.CV 新提交 79%

ST-DiffEye: Diffusion-based Continuous Gaze Generation via Joint Scanpath-Trajectory Modeling

ST-DiffEye: 基于扩散的连续注视生成通过联合扫描路径-轨迹建模

Brian Nlong Zhao, Ozgur Kara, Junho Kim, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ST-DiffEye,一种联合轨迹-扫描路径扩散框架,通过将两者拼接为额外输入通道进行联合建模,并引入基于连续排序概率得分(CRPS)的评估方法,在视觉搜索和自由观看任务上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15457 2026-06-16 cs.CV cs.LG 新提交 79%

Lesion-DDPM: Lesion-Enhanced 3D Diffusion for MS MRI Synthesis

Lesion-DDPM:用于MS MRI合成的病灶增强3D扩散模型

Weidong Zhang, Yongchan Jung, Shafayat Mowla Anik, Furen Xiao, Vasudevan Janarthanan, Enkhzaya Chuluunbaatar, Byeong Kil Lee, Jeeho Ryoo

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) University of Texas at Dallas(德克萨斯大学达拉斯分校) National Taiwan University Hospital(国立台湾大学医院) National University of Mongolia(蒙古国立大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Lesion-DDPM,一种3D条件扩散框架,通过多级解剖掩膜注入和病灶加权重建损失,实现病灶感知的FLAIR合成,在MS病灶分割下游任务中显著提升Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15389 2026-06-16 cs.CV 新提交 79%

Timestep Rescheduling in Diffusion Inversion

扩散反演中的时间步重调度

Shangquan Sun, Ting Gong, Zhirui Liu, Jiamin Wu, Runkai Zhao, Mianxin Liu, Wenqi Ren, Xiaochun Cao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散反演中时间步选择影响反演精度的问题,提出一种基于全局重缩放和局部动态规划的非均匀时间步调度器,有效降低反演误差,提升图像重建与编辑性能。

Comments Accepted by ICML 2026. 23 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15323 2026-06-16 cs.CV 新提交 79%

PPDM: Pixel Puzzling Diffusion Model for Speed and Memory Efficient Volumetric Medical Image Translation

PPDM: 像素拼图扩散模型用于速度和内存高效的体积医学图像翻译

Tianqi Chen, Jun Hou, Yinchi Zhou, James S. Duncan, Chi Liu, Bo Zhou

机构 * Department of Radiology, Northwestern University(西北大学放射学系) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology and Biomedical Imaging, Yale School of Medicine(耶鲁医学院放射学与生物医学影像系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出像素拼图扩散模型(PPDM),通过可逆像素拼图操作和直接桥接扩散公式,在降低内存和加速推理的同时保持全局一致性,用于3D医学图像翻译。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15304 2026-06-16 cs.CV 新提交 79%

HemExp: Clinically-Guided Latent Diffusion for Modeling Hematoma Expansion

HemExp: 临床引导的潜在扩散模型用于血肿扩展示建模

Orhun Utku Aydin, Satoru Tanioka, Tzu I Chuang, Alexander Koch, Dimitrios Rallios, Marie Gultom, Begum Tahhan, Fujimaro Ishida, Dietmar Frey, Adam Hilbert

机构 * CLAIM – Charité Lab for AI in Medicine, Charité – Universitätsmedizin Berlin, corporate member of Freie Universität Berlin and Humboldt-Universität zu Berlin(柏林夏里特医学院人工智能医学实验室(CLAIM),柏林夏里特医学院,柏林自由大学和柏林洪堡大学成员) Department of Neurosurgery, Mie Chuo Medical Center(三重中央医疗中心神经外科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出临床引导的潜在扩散模型HemExp,通过生成患者特异性随访CT图像及血肿分割,实现血肿扩展示的空间概率预测,支持临床变量扰动下的不确定性建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15048 2026-06-16 cs.LG cs.CV 新提交 79%

Temporal Difference Learning for Diffusion Models

扩散模型的时间差分学习

Qizhen Ying, Yangchen Pan, Victor Adrian Prisacariu, Junfeng Wen

机构 * Department of Engineering Science, University of Oxford, Oxford, United Kingdom(牛津大学工程科学系) School of Computer Science, Carleton University, Ottawa, Canada(卡尔顿大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出时间差分(TD)目标函数,通过将扩散过程视为马尔可夫奖励过程并利用强化学习中的策略评估,强制去噪轨迹上的跨时间一致性,显著提升少步采样下的生成质量。

Comments 15 pages, 4 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14879 2026-06-16 cs.RO cs.CV cs.LG 新提交 79%

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

VANDERER: 基于未来感知与视觉好奇心引导扩散策略的无地图探索

Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy, Farshad Khorrami

机构 * Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学坦登工程学院电气与计算机工程系控制/机器人研究实验室(CRRL)) New York University Abu Dhabi (NYUAD) Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心(CAIR))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出VANDERER框架,利用视觉好奇心模块引导预训练扩散策略,仅依赖单目图像实现高效无地图探索,在多种模拟环境中平均探索面积比NoMaD多13.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25449 2026-06-16 cs.CV 版本更新 79%

Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion

Pantheon360: 通过3D感知的360°视频扩散驯服数字孪生生成

Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu, Jie-Ying Lee, Cho-Ying Wu, Fangzhou Lin, Hengyuan Zhang, David Paz, Xinyu Huang, Yuliang Guo, Yu-Lun Liu, Yue Wang, Liu Ren

机构 * University of Southern California(南加州大学) National Yang Ming Chiao Tung University(国家阳明交通大学) Cornell University(康奈尔大学) Bosch Research(博世研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Pantheon360框架,利用显式3D缓存从稀疏360°输入生成高保真视频,实现全局几何一致性和可控相机路径,解决传统透视视频生成器视野受限导致的跨视图不一致和时间漂移问题。

Comments Accepted to CVPR 2026. Project page: https://koi953215.github.io/pantheon360_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04239 2026-06-16 cs.CV 版本更新 79%

DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers

DiverseDiT:扩散Transformer中的多样化表示学习

Mengping Yang, Zhiyu Tan, Binglei Li, Xiaomeng Yang, Hesen Chen, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过分析扩散Transformer的表示动力学,发现块间表示多样性是关键,提出DiverseDiT框架,利用长残差连接和多样性损失促进多样特征学习,在ImageNet上提升性能并加速收敛。

Comments Accepted in CVPR 2026, GitHub Code: https://github.com/kobeshegu/DiverseDiT, Project Page: https://forevermamba.work/projects/DiverseDiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20202 2026-06-16 cs.CV 79%

An Efficient Watermarking Method for Latent Diffusion Models via Low-Rank Adaptation and Dynamic Loss Weighting

通过低秩适应与动态损失加权实现潜在扩散模型的高效水印方法

Dongdong Lin, Yue Li, Benedetta Tondi, Kaiqing Lin, Bin Li, Mauro Barni

机构 * Xiamen Key Laboratory of Data Security and Blockchain Technology, Huaqiao University, Xiamen 361021, China(厦门数据安全与区块链技术重点实验室,华侨大学,厦门361021,中国) Department of Information Engineering and Mathematics of the University of Siena, Italy(意大利锡耶纳大学信息工程与数学系) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, Shenzhen 518060, China(广东省智能信息处理重点实验室,深圳大学,深圳518060,中国) Shenzhen Key Laboratory of Media Security, Shenzhen University, Shenzhen 518060, China(深圳媒体安全重点实验室,深圳大学,深圳518060,中国) SZU-AFS Joint Innovation Center for AI Technology, Shenzhen University, Shenzhen 518060, China(深圳大学人工智能技术联合创新中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于低秩适应的潜在扩散模型高效水印方法,通过动态损失加权平衡生成质量与水印保真度,实现快速准确的水印嵌入且不影响生成图像质量。

Journal ref Expert Systems with Applications. 331 (2026) 133172

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06637 2026-06-16 cs.CV 版本更新 79%

CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning

CLAD: 面向视觉-语言程序规划的约束潜在动作扩散模型

Lei Shi, Andreas Bulling

机构 * Machine Perception and Interaction group, Örebro University(机器感知与交互组,奥雷布罗大学) Collaborative Artificial Intelligence group, University of Stuttgart(协作人工智能组,斯图加特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CLAD模型,利用变分自编码器学习动作和观测的潜在表示作为约束,引导扩散模型生成动作,在三个数据集上大幅超越现有方法。

Comments Accepted at RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16925 2026-06-16 cs.AI 新提交 78%

RAID: Semantic Graph Diffusion for True Cold-Start and Cross-Lingual Forecasting

RAID: 面向真正冷启动和跨语言预测的语义图扩散

Arunkumar V, Manoranjan Gandhudi, Gangadharan G. R., Arun Prakash, S. Senthilkumar

机构 * University College of Engineering, Anna University Tiruchirappalli(安娜大学蒂鲁吉拉伯利工程学院) Central University of Karnataka(卡纳塔克中央大学) National Institute of Technology Tiruchirappalli(蒂鲁吉拉伯利国立理工学院) Jawaharlal Nehru University(贾瓦哈拉尔·尼赫鲁大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对时间序列基础模型在无历史数据时失效的问题,提出RAID框架,利用元数据语义检索和图条件扩散实现冷启动预测,在准确性和推理速度上超越现有方法,并支持零样本跨语言迁移。

Comments 25 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16908 2026-06-16 cs.CL 新提交 78%

LESS Is More: Mutual-Stability Sampling for Diffusion Language Models

LESS Is More: 扩散语言模型的互稳定采样

Amr Mohamed, Guokan Shang, Michalis Vazirgiannis

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Ecole Polytechnique(巴黎综合理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语言模型固定步数采样效率低的问题,提出无训练的自适应采样器LESS,通过互稳定规则动态决定掩码位置何时解码,在7个基准上平均准确率提升且步数减少72.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16904 2026-06-16 math.AP 新提交 78%

Carleman estimates for backward Cahn-Hilliard-reaction-diffusion problems

向后Cahn-Hilliard-反应-扩散问题的Carleman估计

Abramo Agosti, Elena Beretta, Cecilia Cavaterra, Matteo Fornoni, Masahiro Yamamoto

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对耦合Cahn-Hilliard-反应-扩散系统的向后逆问题,通过建立四阶/二阶抛物系统的Carleman估计,推导出从单一最终时间观测重构过去状态的Hölder稳定性和对数稳定性,并应用于肿瘤生长模型获得早期状态的向后唯一性和定量稳定性。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏