arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-31 至 2026-07-31 共收录 57 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 57 篇

2607.28489 2026-07-31 cs.IT math.IT 新提交 83%

Forecasting Land Art Under Climate Scenarios

气候情景下的大地艺术预测

Alev Cinbarci, Sean Kalaycioglu

专题命中 扩散模型 :diffusion(summary_cn,abstract);image synthesis(abstract)

AI总结 本文基于《螺旋防波堤》的遥感数据,构建两阶段预测流程,结合IPCC气候情景与Stable Diffusion XL模型,预测该大地艺术的图像复杂性及暴露状态,并探讨文化遗产伦理问题。

Comments 15 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19139 2026-07-31 cs.CV 版本更新 83%

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

文本模板令牌是扩散Transformer中的隐式语义寄存器

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像扩散Transformer中内部计算,引入因果可解释性框架,发现结构模板令牌充当隐式语义寄存器,据此设计剪枝规则,还揭示其生成计算组织方式,提供了DiTs内部机制的因果视图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27386 2026-07-31 cs.AI cs.LG 新提交 82%

Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models

超越双向承诺:重新评估扩散语言模型的鲁棒性

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran

机构 * Microsoft(微软公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究评估了扩散语言模型的鲁棒性,发现其虽能抵御部分对抗攻击但易受自然噪声影响,存在过度自信问题,脆弱性源于解码器路由故障,需将鲁棒性整合入迭代解码循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09454 2026-07-31 cs.CR 82%

ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models

ShapeMark: 用于扩散模型的鲁棒且保持多样性水印技术

Yuqi Qian, Yun Cao, Haocheng Fu, Meiyang Lv, Meineng Zhu

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 ShapeMark通过将水印编码到结构化噪声模式中,提高了扩散模型的鲁棒性和生成多样性,实现了在多种有损场景下的高质量生成。

Journal ref In Proceedings of the 34th ACM International Conference on Multimedia (MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28164 2026-07-31 cs.CV cs.GR 新提交 81%

S-Avatar: Diffusion-Guided Gaussian Head Avatars from a Single Image

S-Avatar:基于单张图像的扩散引导高斯头部化身

Hail Song, Seokhwan Yang, Jiwon Yang, Woojin Cho, Woontack Woo

机构 * KAIST(韩国科学技术院) KAIST KI-ITC ARRC(韩国科学技术院KI-ITC ARRC)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 S-Avatar通过三阶段流水线,结合扩散引导3DGS生成与FLAME控制,从单张图像生成高逼真3D头部化身,提升了3D一致性,在新视点和表情生成上优于现有方法,适用于VR/AR应用。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23159 2026-07-31 cs.AI cs.CV cs.MM 版本更新 81%

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

CachedSearch:用于视频扩散测试时搜索的免训练缓存探索

Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交 79%

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交 79%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28058 2026-07-31 cs.CV 新提交 79%

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

基于回退误差的时间集中:文本到视频扩散的隐式偏好优化

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。

Comments project page: https://henglin-liu.github.io/cIPO_vis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27842 2026-07-31 cs.CV cs.LG 新提交 79%

FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference

FeatFix:通过局部精确特征校正重用已验证特征以实现更快的缓存扩散模型推理

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Qianli Ma, Fanshuai Meng, Weijia Jia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对扩散模型推理计算密集的问题,提出FeatFix方法,通过重用已验证的局部精确特征校正草稿,实现最高6.70倍的生成加速且保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27800 2026-07-31 cs.CV 新提交 79%

FDDWAN: A Frequency-Decoupled Diffusion Network for Watermarking Attack

FDDWAN:用于水印攻击的频率解耦扩散网络

Chunpeng Wang, Yuxin Li, Xiaoyu Wang, Jidong Yang, Suo Gao, Qi Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有水印去除方法的权衡缺陷,提出FDDWAN框架,经实验验证其在水印去除与视觉保真度间的表现优于传统及学习型攻击方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27537 2026-07-31 cs.CV 新提交 79%

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction

ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer

Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24731 2026-07-31 cs.CV cs.AI cs.LG 版本更新 79%

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

重新思考策略性扩散蒸馏中的无分类器引导

Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴的通义千问业务部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究策略性扩散蒸馏在无分类器引导下的表现,指出现有方法存在负分支不对称问题,引入正向匹配方法,通过分支感知分别约束正预测和条件方向,应用于视频控制实现更有效知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27075 2026-07-31 cs.CV 版本更新 79%

BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration

SoftCap: 扩散Transformer加速的软预算控制

Yuhang Zhang, Junxiang Qiu, Huixia Ben, Zhenhua Tang, Lin Liu, Shuo Wang, Yanbin Hao

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Anhui University of Science and Technology(安徽理工大学) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需训练的软预算控制层SoftCap,通过轨迹漂移观测器和软预算PI控制器动态调整全步触发阈值,在保持计算预算软上限的同时提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18801 2026-07-31 cs.CV 版本更新 79%

PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

PartDiffuser:通过离散扩散实现部件级3D网格生成

Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang

机构 * Beihang University(北航) Communication University of China(中国通信大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11325 2026-07-31 cs.CV 版本更新 79%

ReDiff: Reliability-Guided Diffusion for Trustworthy Ultra-Low-Field to High-Field MRI Synthesis

迈向可信的选择性生成:用于超低场到高场MRI合成的可靠性引导扩散

Zhenxuan Zhang, Peiyuan Jing, Ruicheng Yuan, Liwei Hu, Anbang Wang, Fanwen Wang, Yinzhe Wu, Kh Tohidul Islam, Zhaolin Chen, Zi Wang, Peter Lally, Guang Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDiff框架,通过可靠性引导的采样策略和多候选选择方案,提升MRI合成的鲁棒性和解剖学一致性,减少伪影并提高结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21628 2026-07-31 cs.AI eess.IV 版本更新 79%

Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation

用于结构和语义一致的模拟到真实翻译的小波相位扩散

Kaiwen Wang, Frank Bieder, Yinzhe Shen, Carlos Fernandez, Jan-Hendrik Pauls, Omer Sahin Tas

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究模拟到真实翻译中弥合合成与真实域外观差距并保持结构语义一致的问题,提出小波相位扩散方法,通过双树复小波包变换域操作及低频随机化,在未配对数据训练,提升了图像和视频翻译的真实感与一致性。

Comments Project Page: https://kit-mrt.github.io/Wavelet-Phase-Diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28596 2026-07-31 cs.RO 新提交 78%

FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation

FA-RDP:用于接触丰富操作的频率自适应反应式扩散策略

Lifeng Zhuo, Wendi Chen, Han Xue, Shirun Tang, Jun Lv, Cewu Lu, Chuan Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺玛特里斯有限公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FA-RDP 是一种频率自适应反应式扩散策略,通过多频率视觉-力 Transformer 和多模态指标动态调整采样策略,结合流形一致性蒸馏,在接触丰富操作任务中兼顾多模态保留与反应性,实现最高成功率。

Comments Project page: https://fa-rdp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27557 2026-07-31 cs.CL 新提交 78%

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自监督语义扩散将技能像参数一样训练

Mo Li, Zixin Yin, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28344 2026-07-31 math.CA cs.LG math.AP math.PR 新提交 78%

Reflected diffusion, no-flux continuity equations and confined Lagrangian flows in bounded domains

有界域中的反射扩散、无通量连续性方程与受限拉格朗日流

Rama Cont

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对有界域中反射扩散的边际分布流,给出密度/通量对存在正则拉格朗日流的充分条件,构造反例说明边界假设不可放松,还建立无通量Fokker-Planck方程的唯一性结果,为反射扩散模型的ODE采样提供数学依据。

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28578 2026-07-31 math.PR cond-mat.stat-mech math-ph math.MP 新提交 78%

On two differing geometric descriptions of the passage from microscopy to macroscopy in Markov diffusion theory

马尔可夫扩散理论中从显微学到宏观学过渡的两种不同几何描述

Dalton A R Sakthivadivel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对马尔可夫扩散理论中显微学到宏观学的过渡,构造协调两种几何描述的核心对象,实现了马尔可夫分析中微观-介观-宏观层级的部分普适化。

Comments 52+3 pages. The main text consists of 49 pages and appendices comprise the remainder

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28325 2026-07-31 cond-mat.soft 新提交 78%

Influence of Rotational Diffusion on Macromolecular Self-Assembly Kinetics

旋转扩散对大分子自组装动力学的影响

Prabeen Kumar Pattnayak, Aloke Kumar, Gaurav Tomar

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究通过匹配平动扩散系数分离旋转扩散的影响,发现大分子结合概率依赖内部结构,自组装路径受旋转扩散系数影响,建立了大分子平衡动力学与自组装动力学的关联。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18997 2026-07-31 cs.LG 版本更新 78%

DIPHINE: Diffusion-based $Φ$-ID Neural Estimator

DIPHINE: 基于扩散的 $\Phi$ID 神经估计器

Simon Pedro Galeano Munoz, Mustapha Bounoua, Giulio Franzese, Pietro Michiardi, Maurizio Filippone

机构 * KAUST(卡塔尔科学与技术部) EURECOM(欧雷康)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出首个基于扩散模型的神经估计器 DIPHINE,用于计算连续非高斯动力系统的集成信息分解($\Phi$ID),通过单个摊销网络联合估计所有互信息项,并利用 Möbius 逆变换恢复十六个原子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05117 2026-07-31 cs.RO 版本更新 78%

SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation

SeedPolicy: 通过自进化扩散策略实现机器人操控的水平扩展

Youqiang Gui, Yuxuan Zhou, Shen Cheng, Xinyang Yuan, Haoqiang Fan, Peng Cheng, Shuaicheng Liu

机构 * Sichuan University(四川大学) Dexmal Inc.(Dexmal公司) Independent Researcher(独立研究员) UESTC

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SEGA模块,通过门控注意力机制提升扩散策略在长时域操控中的表现,实验表明其在RoboTwin 2.0基准上优于现有方法,具有更高的效率和性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13707 2026-07-31 cs.RO cs.AI cs.LG 版本更新 78%

REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning

REFINE-DP:通过强化学习实现人形机器人的动态-操作协调政策微调

Zhaoyuan Gu, Yipu Chen, Zimeng Chai, Alfred Cueva, Thong Nguyen, Yifan Wu, Huishu Xue, Minji Kim, Isaac Legene, Fukang Liu, KyoungMok Kim, Ayan Barula, Yongxin Chen, Ye Zhao

机构 * The Institute for Robotics and Intelligent Machines(机器人与智能机械研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出REFINE-DP框架,通过联合优化扩散政策高层规划器和基于强化学习的低层动态-操作控制器,提升人形机器人在复杂环境中的任务成功率与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07285 2026-07-31 math.AP math-ph math.MP 78%

Solutions of time fractional anomalous diffusion equations with coefficients depending on both time and space variables

Ganbileg Bat-Ochir, Khongorzul Dorjgotov, Uuganbayar Zunderiya

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27551 2026-07-31 cs.CR 新提交 71%

AnchorMark: Robust Diffusion Watermarking via Latent-Space Rotation Synchrony

AnchorMark:基于隐空间旋转同步的鲁棒扩散水印

Yuqi Qian, Yun Cao, Haocheng Fu, Haochen Zhao, Hong Zhang, Meineng Zhu

专题命中 扩散模型 :diffusion(title)

AI总结 针对现有反转水印在旋转等复合攻击下鲁棒性不足的问题,提出无训练的AnchorMark,利用隐空间旋转同步属性嵌入同步锚点,提升旋转及复合攻击下的比特准确率且对图像质量影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24974 2026-07-31 physics.chem-ph 版本更新 71%

Ultrafast configuration changes and anomalous diffusion of an aromatic adsorbate on rare-gas nanoparticles

芳香吸附质在稀有气体纳米颗粒上的超快构型变化与反常扩散

Arne Morlok, Philipp Elsässer, Yilin Li, Ulrich Bangert, Felix Riedel, Tanja Schilling, Frank Stienkemeier, Lukas Bruder

专题命中 扩散模型 :diffusion(title)

AI总结 研究稀有气体团簇上酞菁吸附质,结合高分辨率二维电子光谱和分子动力学模拟,揭示吸附质构型动力学,发现其亚扩散表面运动和捕获,为理解分子吸附质在纳米物体上的超快结合动力学提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00434 2026-07-31 cs.CR 71%

CIF: A Constrained Inversion Framework for Reliable Message Extraction in Diffusion-Based Generative Steganography

CIF:一种用于扩散基生成隐写术中可靠信息提取的约束反演框架

Yuqi Qian, Yun Cao, Meiyang Lv, Haocheng Fu

专题命中 扩散模型 :diffusion(title)

AI总结 CIF通过约束反演框架提高扩散基生成隐写术中信息提取的准确性,减少潜在重构误差超过35%。

Journal ref Proceedings of the 14th ACM Workshop on Information Hiding and Multimedia Security (IH&MMSec '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12753 2026-07-31 cs.CV 版本更新 70%

RFMSR: Residual Flow Matching for Image Super-Resolution

RFMSR:用于图像超分辨率的残差流匹配

Shuwei Huang, Tianyao Luo, Jicheng Liu, Pan Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan University(武汉大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对图像超分辨率,提出残差流匹配框架RFMSR,将源分布集中于LQ潜变量以减少传输距离并保留结构先验,采用两阶段训练策略,实验证明该方法相比SOTA实现了相当甚至更优的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏