arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-15 至 2026-07-15 共收录 26 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 20 篇

2606.16241 2026-07-15 cs.CV 版本更新 83%

Structure-Semantic Co-optimized Latent Diffusion Model for Fast Visual Anagram Synthesis

结构-语义协同优化的潜扩散模型用于快速视觉字谜合成

Xiang Gao, Yunpeng Jia

机构 * School of Digital Media and Design Arts, Beijing University of Posts and Telecommunications(北京邮电大学数字媒体与设计艺术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出结构-语义协同优化框架S2CO-Anagram,通过空文本结构对齐、语义增强和注意力引导噪声融合,在极低计算成本下生成高分辨率、高视觉和谐度与语义保真度的视觉字谜图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 79%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01841 2026-07-15 cs.CV 版本更新 79%

Leveraging Prior Knowledge of Diffusion Model for Person Search

利用扩散模型的先验知识进行行人搜索

Giyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom

机构 * GSAIM, Chung-Ang University(Chung-Ang大学图像信息研究所) IPAI, Seoul National University(首尔国立大学图像感知研究所) Department of Mathematical Sciences and RIMS, Seoul National University(首尔国立大学数学科学系和RIMS)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对行人搜索中现有方法的不足,提出DiffPS框架,利用预训练扩散模型,消除子任务优化冲突,通过分析扩散先验属性设计三个专门模块,在CUHK-SYSU和PRW数据集上取得新的最优成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09122 2026-07-15 cs.CV 版本更新 79%

LVMark: Robust Watermark for Latent Video Diffusion Models

LVMark:用于潜在视频扩散模型的鲁棒水印

Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim

机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10094 2026-07-15 cs.CV cs.LG 版本更新 79%

Beyond Perceptual Distance: Discrepancy Assessment on Deep Representation for Out-of-Distribution Detection with Diffusion Model

超越感知距离:基于扩散模型的分布外检测深度表示差异评估

Kun Fang, Zuopeng Yang, Haibo Hu, Xiaolin Huang, Jie Yang, Qinghua Tao

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) The Intsig Information Co., Ltd., Shanghai, China(上海Intsig信息有限公司) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散模型的分布外检测差异评估,提出以分类器相关方式评估,利用其表示空间量化特征级和logit级差异,设计优化策略构成DDR框架,实验表明DDR在ImageNet-1K数据集上检测性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16847 2026-07-15 cs.CL cs.AI 版本更新 78%

Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens

遵循潜在路径:利用锚定令牌导航扩散LLM的可撤销解码

Yizhen Yao, Qinglin Zhu, Runcong Zhao, Xiangxiang Dai, Yanzheng Xiang, Yulan He, Lin Gui

机构 * King's College London(伦敦国王学院) The Chinese University of Hong Kong(香港中文大学) The Alan Turing Institute, UK(英国艾伦·图灵研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散大语言模型解码速度与质量的权衡,提出无训练框架ASRD,通过锚定令牌解耦上下文,结合锚定引导生成与锚定扰动验证,在数学和编码基准上提升准确率6.4%,加速推理7.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10829 2026-07-15 cs.CL cs.AI 版本更新 78%

Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models

注意力折扣自适应采样器用于掩码扩散语言模型

Yusuf Sahin, Ahmed Rockey Saikia, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对掩码扩散语言模型并行解码中候选词交互导致的不安全问题,提出训练无关的重排序规则ADAS,通过注意力折扣软惩罚改进子集构建,在多个基准上提升低NFE性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00180 2026-07-15 eess.AS cs.SD eess.SP 版本更新 78%

DiffAU: Diffusion-Based Ambisonics Upscaling

DiffAU: 基于扩散的Ambisonics升阶

Amit Milstein, Nir Shlezinger, Boaz Rafaely

机构 * Technion - Israel Institute of Technology(技术学院 - 以色列理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DiffAU方法,利用扩散模型和空间音频适配,从一阶Ambisonics生成三阶Ambisonics,实现快速可靠的升阶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14037 2026-07-15 math.ST stat.TH 版本更新 78%

On a Universal Strictly Decreasing Nonparametric Estimator Applied to the Drift Function of a Recurrent Diffusion Process Estimation

关于递归扩散过程漂移函数的严格递减非参数估计器

Nicolas Marie

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种严格递减的非参数估计器,用于估计递归扩散过程的漂移函数,通过非渐近L1风险界和带宽选择方法提高估计精度。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21245 2026-07-15 cs.RO cs.LG 版本更新 78%

Diffusion Denoiser-Aided Gyrocompassing

扩散去噪器辅助的陀螺罗经法

Gershy Ben-Arie, Daniel Engelsman, Rotem Dror, Itzik Klein

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对低成本陀螺仪准确及时陀螺罗经法的挑战,提出扩散去噪器辅助的陀螺罗经法,集成扩散去噪框架与航向估计模型,处理原始传感器信号,实验证明相比其他方法显著提高了陀螺罗经精度,对自主平台导航意义重大。

Comments 8 pages, 8 figures

Journal ref Measurement, Measurement, Volume 287, 2026, Article 122370

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14125 2026-07-15 stat.ML cs.LG 版本更新 78%

Spectral Diffusion Processes

谱扩散过程

Angus Phillips, Thomas Seror, Michael Hutchinson, Valentin De Bortoli, Arnaud Doucet, Emile Mathieu

机构 * University of Oxford(牛津大学) ENS, CNRS, PSL University Paris(巴黎高等师范学院、国家科学研究中心、巴黎大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究将扩散模型应用于函数空间上的随机过程,通过谱表示分离随机部分与时空结构,用有限维扩散模型建模谱系数,经截断确保模型有效性,投影回原空间对应相关噪声扩散模型,还展示了方法在多模态数据建模及条件采样上的有效性。

Comments This version (v3) extends the previous workshop version (v2) with conditional sampling and theoretical results. Work carried out in 2022/23. V2 appeared in Score-based Methods Workshop at the 36th Conference on Neural Information Processing Systems (NeurIPS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19632 2026-07-15 cs.CV 版本更新 70%

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

CreatiParser: 从位图图形设计生成可编辑的图层

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ByteDance Intelligent Creation(字节跳动智能创作) School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13421 2026-07-15 cs.LG cs.CV 版本更新 57%

Generalization and Memorization in Rectified Flow

修正流中的泛化与记忆化

Mingxing Rao, Daniel Moyer

机构 * Vanderbilt University(范德比大学)

专题命中 扩散模型 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究修正流模型的记忆行为,通过成员推断攻击测试统计量揭示其记忆机制,并提出复杂度校准指标,提升攻击性能并抑制记忆化以保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09925 2026-07-15 cs.CV 版本更新 57%

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS:基于高斯的稀疏多视图捕获逆渲染

Patrick Noras, Jun Myeong Choi, Didier Stricker, Pieter Peers, Roni Sengupta

机构 * University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) College of William & Mary(威廉与玛丽学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对稀疏视图设置下基于高斯的逆渲染精度下降问题,提出GAINS两阶段逆渲染框架,利用基础模型先验稳定几何和材质估计,经实验验证其在提升材质参数精度等方面效果显著,尤其在稀疏视图下优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25104 2026-07-15 math.AP 版本更新 50%

The Financial Bubble Model with Lévy Jump Processes

具有Lévy跳跃过程的金融泡沫模型

Avetik Arakelyan, Rafayel Barkhudaryan, Vigen Khalatyan, Michael Poghosyan

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过引入Lévy跳跃过程扩展BMS模型,利用最优停止理论和Itô-Lévy公式推导出非局部偏积分微分方程,建立了完整粘性解理论并设计了数值格式。

Comments 37 pages, 6 Figures, Keywords: Financial Bubbles, Levy Process, Viscosity Solutions, Free Boundary

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22434 2026-07-15 cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

The influence of implantation conditions on dopant activation in Al-implanted 4H-SiC: A MD study applying an Al potential fitted to DFT barriers

掺杂条件对Al掺杂4H-SiC中掺杂剂激活的影响:应用拟合DFT势垒的Al势的分子动力学研究

Sabine Leroch, Robert Stella, Andreas Hössinger, Lado Filipovic

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分子动力学模拟揭示了掺杂温度和剂量对4H-SiC中Al掺杂激活的影响,发现高温抑制了弗伦克尔对的生成,但高剂量下退火呈现非单调行为,揭示了掺杂剂溶解极限下的两种不同机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21427 2026-07-15 physics.plasm-ph astro-ph.EP physics.space-ph 版本更新 50%

Collisionless Phase Mixing Mimics Diffusive Transport in Radiation Belt Observations

无碰撞相混模拟辐射带观测中的扩散输运

Adnane Osmane, Xin An, Anton Artemyev, Oliver Allanson, Jay Albert, Miroslav Hanzelka

专题命中 扩散模型 :diffusion(abstract)

AI总结 辐射带观测中,无碰撞相混效应可产生类似扩散输运的观测信号,挑战传统扩散模型解释。

Comments Accepted in Physical Review Research, 45 pages, 4 Figures. Shortened abstract

Journal ref Phys. Rev. Research 8, 033104, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05574 2026-07-15 cond-mat.mtrl-sci 版本更新 50%

A coupled fully kinetic hydrogen transport and ductile phase-field fracture framework for modeling hydrogen embrittlement

一种耦合完全动能氢传输与韧性相场断裂框架用于建模氢脆

Abdelrahman Hussein, Yann Charles, Jukka Kömi, Vahid Javaheri

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种耦合完全动能氢传输模型与几何相场断裂方法的综合框架,用于建模氢脆问题,重点研究氢在位错处的输运动力学及韧性断裂与氢诱导脆性断裂的相互作用。

Comments 16 pages, 8 figures

Journal ref International Journal of Plasticity (2026): 104765

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01230 2026-07-15 quant-ph 版本更新 50%

Entropy Flow of a Laser Beam

激光束的熵流

Howard M. Wiseman

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了理想激光束的熵流特性,通过相位扩散率和粒子流计算熵流,对比了热束与激光束的差异。

Comments 3 pages

Journal ref Optics Letters 51, 3977-3979 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21326 2026-07-15 math.NA cs.NA 版本更新 50%

Discontinuous in time Virtual Element method for Darcy equations coupled with Multi Species Transport with First Order Reaction Network

用于耦合一阶反应网络的多物种输运的达西方程的时间不连续虚拟单元法

Ruben Caraballo, Franco Dassi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究化学反应物种输运现象,用虚拟单元法离散速度场和物种浓度,通过不连续伽辽金格式进行时间积分,对完整模型简化后推导误差估计,数值实验验证其在时空上的任意阶精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2607.06058 2026-07-15 quant-ph 版本更新 71%

SQGen: Structured Quantum Image Generation with Latent-Modulated Quantized Tensor Trains

SQGen:基于潜变量调制量化张量列车的结构化量子图像生成

Guang Lin, Qibin Zhao

专题命中 可控生成 :image generation(title)

AI总结 研究旨在解决NISQ硬件上直接从量子系统生成图像的问题,核心方法是提出基于潜变量调制量化张量列车的SQGen,主要贡献为能稳定训练,端到端生成图像且无需经典解码器,在真实量子硬件上有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-07-15 cs.RO 版本更新 50%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 17 pages, 5 figures, 8 tables. Project page: https://advanced-robotics-lab.github.io/SANTS/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2505.16157 2026-07-15 cs.CV 版本更新 57%

Fast and Accurate Image Restoration and Generation with Rank Enhanced Linear Attention

基于秩增强线性注意力的快速准确图像恢复与生成

Yuang Ai

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决Transformer自注意力二次复杂度问题,提出秩增强线性注意力(RELA)及高效视觉Transformer(LAformer),通过集成深度卷积丰富特征表示,经实验验证LAformer在图像恢复和生成任务中性能优且计算高效。

Comments Code: https://github.com/shallowdream204/LAformer

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2606.09076 2026-07-15 cs.CV 版本更新 57%

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

超越标量奖励:将推理内化到分数分布中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao, Yuming Jiang, Xiangpeng Yang, Chunle Guo, Peng Gao, Ming-Ming Cheng, Steven C. H. Hoi

机构 * Alibaba Group(阿里巴巴集团) Nankai University(南开大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。

Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06796 2026-07-15 cs.RO 版本更新 50%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 图像生成评测 :image generation(abstract)

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 1 篇

2603.25233 2026-07-15 math.NA cs.NA 版本更新 50%

Highly Efficient Rank-Adaptive Sweep-based SI-DSA for the Radiative Transfer Equation via Mild Space Augmentation

通过温和的空间增强实现高效且适应性的秩适应性扫掠SI-DSA用于辐射传输方程

Wei Guo, Zhichao Peng

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种高效的秩适应性扫掠SI-DSA方法,通过温和的空间增强实现低秩求解,减少内存和计算时间,适用于多尺度问题。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏