arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-05 至 2026-08-05 共收录 96 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 76 篇

2608.03087 2026-08-05 cs.LG cs.AI 新提交 78%

SynEnergy: Anomaly Semantic-Guided Diffusion for Synthetic Energy Data Generation

SynEnergy:面向合成能源数据生成的异常语义引导扩散模型

Lin Jiang, Dahai Yu, Ravikumar Gelli, Guang Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SynEnergy,一种两阶段扩散框架,通过HG-ASL提取异常语义、AS-Diff生成数据,在四个真实能源数据集上较11种基线提升异常保留与下游质量,可扩展至城市级场景。

Comments 24 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03032 2026-08-05 cs.SD 新提交 78%

DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

DDSynth-RL:结合强化学习的离散扩散音频合成器逆问题求解

Tristan Wu, Daniel Chin, Junan Zhang, Junyan Jiang, Yansen Jing, Gus Xia

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对合成器逆问题的两大挑战,提出结合掩码离散扩散与GRPO风格音频域奖励微调的DDSynth-RL方法,在Dexed上验证了其性能优势。

Comments Accepted to the 27th International Society for Music Information Retrieval Conference (ISMIR 2026). 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02625 2026-08-05 cs.CL cs.AI 新提交 78%

Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models

推测校正:扩散语言模型的草稿后精炼解码

Brian K Chen, Chong Wu, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散语言模型提出草稿后精炼解码方案,通过 Flash-Flash 和 Mini-Flash 配置在 GSM8K、MBPP、MATH 数据集上提升准确率并加快推理速度,为双向精炼及快速生成提供新路径。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03398 2026-08-05 cond-mat.stat-mech 新提交 78%

The intermediate scattering function of an interacting adlayer as a characteristic function: a closed-form theory of Ising lattice-gas surface diffusion

作为特征函数的相互作用吸附层中间散射函数:Ising格气表面扩散的闭式理论

S. Miret-Artés

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出了Ising格气表面扩散的闭式理论,推导了中间散射函数的闭式形式,经KMC模拟验证,可用于Na/Cu(111)和H/Pt(111)等体系的分析。

Comments 34 pages; 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03180 2026-08-05 cond-mat.stat-mech math-ph math.MP physics.class-ph quant-ph 新提交 78%

Exact Resonances Are Not Sufficient for Phonon Energy Diffusion

精确共振不足以实现声子能量扩散

Wei Lin, Yong Zhang, Hong Zhao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究指出精确共振匹配等运动学条件不足以实现声子能量扩散,需准共振维持能量扩散,且热力学与弱非线性极限不可交换,明确了声子能量扩散的动力学判据。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02916 2026-08-05 cond-mat.mes-hall cond-mat.dis-nn 新提交 78%

Chaos and Diffusion in Twisted Bilayer Graphene

扭曲双层石墨烯中的混沌与扩散

Olga Arroyo-Gascón, Manuel Pino

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过数值分析实验相关的扭曲双层石墨烯模型,发现公度与非公度旋转角下的有限系统均存在混沌,边界作为单粒子散射机制强于单层石墨烯,可诱导混沌与扩散。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01774 2026-08-05 cs.LG cs.AI 版本更新 78%

FLARE: Diffusion for Hybrid Language Model

FLARE: 混合语言模型的扩散方法

Yuchen Zhu, Jing Shi, Chongjian Ge, Hao Tan, Yiran Xu, Wanrong Zhu, Jason Kuen, Koustava Goswami, Rajiv Jain, Yongxin Chen, Molei Tao, Jiuxiang Gu

机构 * Adobe Research(Adobe研究院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出FLARE框架,通过结合自回归和扩散目标、硬件感知内核和统一推理,将混合注意力LLM转换为支持并行解码的扩散模型,在保持能力的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01370 2026-08-05 cs.LG cs.AI cs.NA math.NA stat.ML 版本更新 78%

PRISMA: Improving the Accuracy-Latency Frontier of Diffusion-based PDE Solvers Using Physics-Informed Spectral Attention

超越损失引导:利用PDE残差作为频域中的频谱注意力在扩散神经算子中

Medha Sawhney, Abhilash Neog, Mridul Khurana, Anuj Karpatne

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PRISMA通过将PDE残差作为频谱注意力机制整合到扩散神经算子中,实现了无需梯度下降的快速、稳健和准确的PDE求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10221 2026-08-05 math.NA cs.NA 版本更新 78%

On $τ$-preconditioners for a quasi-compact difference scheme to Riesz fractional diffusion equations with variable coefficients

关于变系数Riesz分数阶扩散方程拟紧致差分格式的τ-预条件子

Zi-Hang She, Xue Zhang, Xian-Ming Gu, Stefano Serra-Capizzano

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对变系数Riesz分数阶扩散方程离散的非对称线性系统,提出τ预条件子加速GMRES收敛,理论与数值结果验证其有效性。

Comments 23 pages, 3 figures, we improve some contexts and simplify some mathematical equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03057 2026-08-05 cs.CV 新提交 74%

TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

TASQ:用于扩散模型的时间自适应比特稀疏化量化

Seokho Han, Dongwei Wang, Jinhee Kim, Yiran Chen, Kang Eun Jeon, Huanrui Yang, Jong Hwan Ko

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 针对扩散模型静态量化的计算开销问题,提出TASQ方法,结合时间精度引擎,在保持质量的同时显著降低执行周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10671 2026-08-05 cs.CV 版本更新 74%

FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

FadeMem: 面向自回归视频扩散的距离感知记忆巩固

Yu Lu, Junjie Yang, Piotr Koniusz, YuXin Song, Yi Yang

机构 * Zhejiang University(浙江大学) University of New South Wales (UNSW)(新南威尔士大学) Data61/CSIRO Baidu Inc(百度公司)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 提出FadeMem,一种距离感知的KV记忆巩固机制,在固定缓存预算下将历史KV块组织成时间层次,通过幂律分配实现近密远疏的记忆,提升长视频生成中的主体一致性和时间连贯性。

Comments 14 pages, 9 figures. Substantially revised manuscript with expanded experiments and integrated supplementary material. Project page: https://fademem.github.io/FadeMem_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06606 2026-08-05 cs.CV 版本更新 74%

MaterialFusion: High-Quality, Zero-Shot, and Controllable Material Transfer with Diffusion Models

MaterialFusion:基于扩散模型的高质量零样本可控材质迁移

Kamil Garifullin, Maxim Nikolaev, Andrey Kuznetsov, Aibek Alanov

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 MaterialFusion是基于扩散模型的新型材质迁移框架,可零样本实现高质量可控材质迁移,在质量、可控性等方面优于现有方法,代码公开。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03215 2026-08-05 eess.AS cs.AI cs.CL 新提交 71%

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

GROW:用于自回归扩散文本到语音模型的组相对优势加权在线策略强化学习

Guanrou Yang, Tian Tan, Qian Chen, Ziyang Ma, Yakun Song, Zhikang Niu, Qi Chen, Wenming Tu, Haitao Li, Shan Yang, Xie Chen

专题命中 扩散模型 :diffusion(title)

AI总结 本研究提出GROW方法,将其应用于DiTAR模型,在LibriSpeech和Seed-TTS数据集上提升TTS的WER和说话人相似度,且训练速度更快,计划开源相关代码与模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03135 2026-08-05 cs.CV cs.AI 新提交 70%

Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds

先校正再扩散:去噪轨迹展开前解耦概念

Ning Zhu, An Chen, Mengfei Zhao, Juntao Xu, Jingze Liang, Boyuan Gu, Liang-Jian Deng

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型多概念生成时的遗漏或合并错误,提出无训练框架RTD,通过SOD和IGR校正初始概念分配,在AE-Bench上实现组合保真度与效率的显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新 70%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03330 2026-08-05 cs.AI 新提交 67%

Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving

自动驾驶中基于多项式表示的长期交通场景预测

Yue Yao

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本研究提出基于多项式表示的自动驾驶交通场景预测模型,结合理论分析与实证验证,在标准基准上接近最优准确率,提升分布偏移下的泛化能力,生成更合理的多智能体场景,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08834 2026-08-05 cs.LG cs.AI stat.ML 版本更新 67%

Rex: A Family of Reversible Exponential (Stochastic) Runge-Kutta Solvers

Rex: 一族可逆指数(随机)龙格-库塔求解器

Zander W. Blasingame, Chen Liu

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出Rex求解器族,通过Lawson方法将显式(随机)龙格-库塔格式转化为代数可逆形式,用于扩散ODE和SDE,实现近机器精度重建并提升流模型和扩散模型的性能。

Comments Accepted as an Oral presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01597 2026-08-05 cs.LG stat.AP stat.ML 版本更新 67%

Heteroscedasticity of Denoising Score Matching with Generalised Smooth Noise

带广义平滑噪声的去噪得分匹配的异方差性

Juyan Zhang, Rhys Newbury, Xinyang Zhang, Tin Tran, Dana Kulic, Michael Burke

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究指出去噪得分匹配(DSM)存在固有的异方差性,推导了理想加权函数并给出实用近似方案,为各向同性高斯扩散的启发式权重提供了理论依据,在多分布和高阶得分上验证了理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 62%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03517 2026-08-05 cs.CV 新提交 57%

GVCCTurbo: Rate-Compute Quality Scheduling for Codebook Driven Generative Compression

GVCCTurbo:基于码本驱动生成压缩的码率-计算量质量调度

Ziyue Zeng, Dingjie Peng, Xun Su, Hiroshi Watanabe

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GVCCTurbo是一种BPP驱动的调度器,分离生成压缩的先验刷新与码本校正,降低解码时间,在低码率下提升压缩性能且兼容多种生成压缩模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03422 2026-08-05 cs.CV 新提交 57%

HyperbolicDiffusion: Sharp & Scalable Tiled Generation on the Hyperbolic Plane

HyperbolicDiffusion:双曲平面上的清晰且可扩展的平铺生成

Hugo Caselles-Dupré

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出无需训练的HyperbolicDiffusion方法,通过Hyperbolic Blooming Cover与几何修复阶段,在双曲平面H²上生成清晰、可重投影且跨视点一致的视觉场,为埃舍尔《圆极限》系列提供生成对应物。

Comments Work in progress. Updated version incoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03198 2026-08-05 cs.CV cs.RO 新提交 57%

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

通过可微物理渲染连接在线与离线手写文字

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出统一在线-离线手写生成框架,通过物理画笔模型与可微渲染模块解决两类手写生成范式的缺陷,经实验验证实现了结构与视觉保真度。

Comments Accepted at ECCV 2026, Project page: https://seonmip.github.io/onoff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03046 2026-08-05 cs.CV 新提交 57%

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation

CAPE-T2V:面向文本到视频生成中双侧条件对齐的以字幕生成器为锚点的提示增强方法

Yizhuo Jia, Jingyun Hua, Yuanxing Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到视频生成中存在的PE-字幕 gap,提出CAPE-T2V框架,通过两步微调PE与DiT,在多个基准数据集上实现了更高的生成综合得分,有效缩小了训练与推理间的条件不匹配。

Comments Includes appendix; 11 figures. Project page: https://github.com/yizzz927/CAPE-T2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15065 2026-08-05 cs.RO cs.CV cs.LG 版本更新 57%

DriftWorld: Fast World Modeling through Drifting

DriftWorld:通过漂移实现快速世界建模

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对预测性世界模型生成展开慢的问题,提出基于漂移生成模型的DriftWorld,训练时学习动作条件漂移以快速生成未来帧,在机器人操作基准测试中实现快速准确决策,还能作离线模拟器,性能优于基于扩散的基线。

Comments Website at https://susie-lu.github.io/driftworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14019 2026-08-05 cs.CV 版本更新 57%

RISE: Single Static Radar-based Indoor Scene Understanding

RISE:基于单静态雷达的室内场景理解

Kaichen Zhou, Laura Dodds, Sayed Saad Afzal, Fadel Adib

机构 * Massachusetts Institute of Technology(麻省理工学院) Cartesian Systems

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出RISE系统,利用毫米波雷达的多径反射(传统视为噪声)编码几何线索,通过双角度多径增强和模拟到现实的分层扩散框架,实现布局重建和物体检测,在50,000帧数据集上布局重建倒角距离降低60%,首次实现基于毫米波雷达的物体检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18792 2026-08-05 cs.CV 版本更新 57%

Rethinking Uncertainty Quantification and Entanglement in Image Segmentation

重新思考图像分割中的不确定性量化与纠缠

Jakob Lønborg Christensen, Vedrana Andersen Dahl, Morten Rieger Hannemose, Anders Bjorholm Dahl, Christian F. Baumgartner

机构 * Technical University of Denmark, DTU Compute(丹麦技术大学,DTU计算学院) University of Lucerne, Faculty of Health Sciences and Medicine(卢塞恩大学,医学与健康科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了图像分割中不确定性量化的分解与纠缠问题,分析了不同模型组合的不确定性纠缠程度,并提出量化指标,评估了不同任务下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03011 2026-08-05 eess.AS eess.SP 新提交 50%

Towards Real-world Environment-aware Zero-shot Text-to-speech Synthesis via Disentangled Audio Infilling

面向真实环境感知的零样本文本到语音合成:基于解耦音频填充的研究

Ye-Xin Lu, Xin Wang, Yang Ai, Hui-Peng Du, Zhen-Hua Ling, Junichi Yamagishi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出扩展版DAIEN-TTS框架,解耦建模语音、噪声与混响,通过分离模块与引导机制实现环境感知零样本TTS,实验验证其自然度、相似度与可控性优于现有系统。

Comments Submitted to IEEE Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03925 2026-08-05 q-fin.MF q-fin.PR 新提交 50%

Option Pricing with Time-Changed Fractional Brownian Motion: A Fractional Variance Gamma Model

基于时间变换分数布朗运动的期权定价:分数方差伽马模型

Robert Jarrow, Jayen Tan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对分数布朗运动非半鞅导致传统期权定价方法无法适用的问题,提出时间变换分数布朗运动,开发分数方差伽马模型并采用广义矩估计,对标普500实证得到约0.45的赫斯特指数,为期权定价提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02844 2026-08-05 stat.ML cs.LG stat.CO 新提交 50%

Particle-based Generalised Stochastic Optimisation

基于粒子的广义随机优化

Jiechen Jackie Zhang, O. Deniz Akyildiz

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对梯度难处理的损失函数,提出一类基于扩散的随机粒子优化方法,引入平均场动力学及其交互粒子近似,证明其指数收敛性与非渐近误差界,并通过变体在相关任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03904 2026-08-05 cs.CY 新提交 50%

Why do we need social singularity? A mechanism-based critique of gradual scenarios in AI existential-risk discourse

我们为何需要社会奇点?对AI生存风险论述中渐进式情景的基于机制的批判

Petr O. Jedlicka

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文批判AI生存风险论述中的渐进式情景,提出社会奇点概念,指出AI扩散伴随的社会机制将重塑其未来轨迹,核心扰乱或源于对AI到来的预期引发的社会动态。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏