arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-24 至 2026-07-24 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2604.11052 2026-07-24 cs.SD 版本更新 78%

LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation

LaDA-Band:语言扩散模型用于人声到伴奏生成

Qi Wang, Zhexu Shen, Meng Chen, Guoxin Yu, Chaoxu Pang, Weifeng Zhao, Wenjiang Zhou

机构 * State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所人工智能安全国家重点实验室) Lyra Lab, Tencent Music Entertainment(腾讯音乐娱乐集团Lyra实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LaDA-Band通过引入离散掩码扩散模型,解决了人声到伴奏生成中保持音质真实、维持全局连贯性和产生动态编曲的三重挑战,提升了长距离结构一致性和时间同步性。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06846 2026-07-24 cs.SD 版本更新 78%

DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos

DynFOA: 基于条件扩散的动态和声学复杂的360度视频生成一阶混响

Ziyu Luo, Lin Chen, Qiang Qu, Xiaoming Chen, Yiran Shen

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University, Beijing, China(计算机与人工智能学院,北京技术与商业大学) School of Computer Science, The University of Sydney, Sydney, NSW, Australia(计算机科学学院,悉尼大学) School of Software, Shandong University, Jinan, China(软件学院,山东大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DynFOA通过动态声学感知和条件扩散生成高质量的360度视频一阶混响,提升沉浸式音频体验。

Comments Revised version with updated content.This submission is the intended replacement of arXiv:2602.06846

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04019 2026-07-24 cs.LG cs.AI cs.CL 版本更新 78%

Simple Policy Gradients for Reasoning with Diffusion Language Models

为扩散语言模型进行推理的简单策略梯度

Anthony Zhan

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。

Comments 19 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21284 2026-07-24 cs.LG cs.AI cs.ET math.AP 版本更新 78%

PILD: Physics-Informed Learning via Diffusion

PILD:通过扩散进行物理引导学习

Tianyi Zeng, Tianyi Wang, Jiaru Zhang, Zimo Zeng, Feiyang Zhang, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Tongji University, Shanghai, China(同济大学) University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PILD通过引入虚拟残差观测和条件嵌入模块,结合物理约束与扩散模型,提升工程和科学任务中生成模型的准确性、稳定性和泛化能力。

Comments 34 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21057 2026-07-24 cs.HC 版本更新 78%

Privatization of Synthetic Gaze: Attenuating State Signatures in Diffusion-Generated Eye Movements

合成眼动的私有化:减弱扩散生成眼动中的状态特征

Kamrul Hasan, Oleg V. Komogortsev

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散模型的合成眼动方法,通过分析合成眼动特征与主观报告之间的相关性,证明生成方法能有效抑制与隐私相关的内部状态特征,同时保留真实数据的信号特征。

Comments Accepted at IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12086 2026-07-24 cs.LG cs.CR 版本更新 78%

CLOAK: Contrastive Guidance for Latent Diffusion-Based Data Obfuscation

CLOAK:基于潜在扩散的数据混淆的对比引导

Xin Yang, Omid Ardakanian

机构 * University of Alberta(阿尔伯塔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对数据混淆问题,提出基于潜在扩散模型的Cloak框架,用对比学习提取解纠缠表示,指导潜在扩散过程平衡隐私与效用。实验表明该框架优于现有技术,能降低效用和隐私损失,适合资源受限环境。

Journal ref Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, Volume 10, Issue 3, Article 184, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09867 2026-07-24 cs.HC 版本更新 78%

Quantitative and Qualitative Comparison of Generative Models for Subject-Specific Gaze Synthesis: Diffusion vs GANs

特定主体注视合成生成模型的定量与定性比较:扩散模型与生成对抗网络

Kamrul Hasan, Dmytro Katrychuk, Mehedi Hasan Raju, Oleg V. Komogortsev

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究特定主体注视合成,对扩散模型和GAN进行修改,前者纳入用户嵌入,后者引入特定主体条件模块,通过眼动信号质量指标评估,发现扩散模型生成的注视序列更优,推进了对合成注视相关特性的理解及生物识别应用发展。

Comments Accepted at IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06714 2026-07-24 math.ST stat.TH 版本更新 71%

Expectation-Maximization algorithm to estimate the forcing parameter of a nonlinear McKean-Vlasov diffusion

用于估计非线性McKean-Vlasov扩散强迫参数的期望最大化算法

Eduardo Gutierrez-Turner, Kerlyns Martinez, Hector Olivero

专题命中 扩散模型 :diffusion(title)

AI总结 研究受瞬时湍动能模型启发的随机微分方程中强迫参数估计问题,基于期望最大化框架提出估计算法,证明其一致性并通过数值实验说明发现。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21326 2026-07-24 cs.CV 新提交 70%

SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion

SlerpFlow:用于整流流反演的球形轨迹校正

Wenbin Duan, Yan Shu, Zhuoyuan Fu, Fangmin Zhao, Yan Li, Yaru Zhao, Binyang Li

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对基于整流流的图像生成中反演难题,提出SlerpFlow方法,基于流形假设,整合球形线性插值校正流速度方向,缓存校正速度,实现高精度反演,提升重建保真度与编辑语义对齐,无需额外训练。

Comments 16 pages. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21592 2026-07-24 cs.CV 新提交 57%

Unified Video Dense Prediction from Disjoint Data

从不相交数据进行统一视频密集预测

Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee

机构 * Adobe Research(Adobe 研究院) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现有任务特定注释分散问题,提出统一视频模型UniD,从不相交特定领域数据集联合预测八个密集场景属性。通过简单蒸馏步骤,利用预训练扩散模型视觉先验弥合领域差距,性能优于特定任务专家和多任务基线,泛化能力强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交 57%

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20692 2026-07-24 cs.CV cs.AI 新提交 57%

DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation

图像CLEFmed GANs 2026竞赛中的DS@GT ARC:用于隐私保护CT切片生成的几何滤波

Eric Regina, Richard Arnaud, Samir Hadi Cisneros

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 为Image-CLEFmed GANs 2026挑战赛开发隐私保护框架,结合最优传输条件流匹配等,在几何潜在空间过滤候选切片。官方结果显示有真实感与隐私权衡,虽减少泄漏,但防止直接图像复制仍不足以消除患者特定解剖特征,凸显未来隐私保护医学图像生成的重要前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20660 2026-07-24 cs.CV 新提交 57%

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Axolotl3D:用于精确3D形状完成的统一框架

Anita Hu, Maria Shugrina

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D生成模型在多场景适用性有限及缺乏统一框架的问题,提出Axolotl3D模型,它基于多种模态条件设定,利用点云和相机参数,通过统一训练策略实现精确3D形状完成,实验验证其在多方面性能出色。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11029 2026-07-24 cs.RO cs.CV 版本更新 57%

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

仅用58万个可训练参数学习高效导航

Edward Beng Wai Tan, Siew-Kei Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视觉导航中单个任务族所需规模及替代结构,提出分解式导航模型,仅用少量可训练参数,在导航任务中接近最先进模型性能,还能用于无目标探索,故障模式可解析纠正。

Comments 6 pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03819 2026-07-24 cs.GR cs.AI 版本更新 57%

CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation

CGGS:用于以自我为中心的3D场景生成的一致性增强几何高斯点云渲染

Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 针对以自我为中心的3D场景生成难题,提出CGGS框架。通过微调多视图潜在扩散模型生成2D内容,利用光流等估计深度产生点云,再经几何细化器优化3D高斯重建,提升视觉质量与几何结构。

Comments Update format

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 7670-7684, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20114 2026-07-24 cs.CV cs.AI 版本更新 57%

Benchmarking Unlearning for Vision Transformers

对视觉变换器的去学习进行基准测试

Kairan Zhao, Iurie Luca, Peter Triantafillou

机构 * University of Warwick, United Kingdom(沃里克大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究首次对视觉变换器的去学习算法进行基准测试,评估不同数据集、算法和协议的影响,揭示了VTs在记忆训练数据方面的特性及性能基线。

Comments Accepted at CoLLAs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21442 2026-07-24 q-bio.CB 新提交 50%

Local intercellular coupling is sufficient for long-range calcium signaling

局部细胞间耦合足以实现长距离钙信号传导

Benjamin M. Goykadosh, Vasuretha Chandar, Harikrishnan Parameswaran

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究长距离细胞间钙信号传导机制,提出计算模型,表明相邻细胞局部耦合可在无快速分子扩散时产生和传播Ca2+振荡,再现实验空间影响范围,为相关疾病中局部基质硬化产生全身效应提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21427 2026-07-24 cs.LG 新提交 50%

Context-weighted Discrete Flow Matching

上下文加权离散流匹配

Daniil Cherniavskii, Daniel Severo, Karen Ullrich

机构 * University of Amsterdam(阿姆斯特丹大学) Meta FAIR

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究离散生成建模,提出对连续时间马尔可夫链的简单修改,通过上下文加权采样器和缩放交叉熵损失函数,纳入局部上下文信息,提高生成质量与训练效率,在质量上与强基线匹配且能任意顺序生成。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21042 2026-07-24 cs.AI 新提交 50%

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

更快的IndexTTS-2:在GPU上加速和流式自回归零样本文本到语音合成

Muyang Du, Shuang Yu, Junjie Lai

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究旨在加速自回归文本到语音模型IndexTTS-2,利用NVIDIA TensorRT和TensorRT-LLM在GPU上实现生产部署,支持流式合成与批处理推理,实验表明在Seed-TTS基准测试中能显著加速且质量损失小,为加速类似模型提供参考。

Comments 4 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20923 2026-07-24 cs.DL cs.AI cs.CY 新提交 50%

Scientific exploration, collaboration and labor division in the large language model era

大语言模型时代的科学探索、合作与分工

Xiang Zheng, Xi Hong, Jialin Liu, Chaoqun Ni

机构 * Information School, University of Wisconsin–Madison(威斯康星大学麦迪逊分校信息学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究大语言模型时代科学家科研变化,通过关联数据和分析论文贡献声明发现,2022年后科学家跨学科探索增加,合作网络更具跨学科性,分工更分化,有强AI写作信号者变化更明显,表明此时代科学探索、合作与分工正广泛重组。

Comments Main text: 21 pages, 4 figures. Supplementary materials: 25 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20550 2026-07-24 cs.LG cs.AI 新提交 50%

Beyond SBDD: Geometric Deep Learning in Polypharmacology and Multi-target Drug Design

超越基于结构的药物设计:多药理学和多靶点药物设计中的几何深度学习

Tianming Han, Zhijie Pan, Wenchi Ge, Qi Zhao

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对多因素疾病治疗中传统药物设计的不足,将几何深度学习作为有力方法,综述其架构、应用于三个核心维度的情况,强调新兴算法,评估相关要素作用,阐明药物发现从偶然探索到理性、结构驱动的多药理学分子工程的范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21249 2026-07-24 q-bio.MN cs.IT math.IT stat.AP 新提交 50%

From Berg-Purcell precision bounds to clock-limited information capacity

从伯格 - 珀塞尔精度界限到时钟限制信息容量

Michał Komorowski

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究化学传感中伯格 - 珀塞尔精度界限与分子受体信息容量的关系,推导两者联系的表达式,表明理想模型下扩散限制采样不设限,考虑时间积分等因素后得出时钟限制的信息容量界限,建立了有限的受体级信息界限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21352 2026-07-24 math.AP 新提交 50%

Double screening in the training dynamics of variational physics-informed neural networks for heterogeneous coupled parabolic systems

用于非均匀耦合抛物系统的变分物理信息神经网络训练动力学中的双重筛选

Ali Ouattara Kouma, Gossrin Jean-Marc Bomisso

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究非均匀耦合抛物系统的变分物理信息神经网络训练动力学,通过双重筛选定理得出四个结果,包括耦合能量恒等式等,指出条件数增长影响共享步长梯度下降,Adam优化器可减轻困难,且预测经数值验证。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21108 2026-07-24 math.NA cs.NA 新提交 50%

A stability-preserving polytopal discontinuous Galerkin method for the Fisher-Kolmogorov model with applications to neurodegenerative diseases

一种用于Fisher-Kolmogorov模型的保持稳定性的多面体间断Galerkin方法及其在神经退行性疾病中的应用

Paola Francesca Antonietti, Francesca Bonizzoni, Mattia Corti, Nicola De March, Salvatore Di Noto, Francesco Regazzoni

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对神经退行性疾病中广泛使用的Fisher-Kolmogorov模型,在离散层面解非负性不保的问题,采用多边形和多面体网格上的间断Galerkin方法及Crank-Nicolson格式,推导稳定性和误差估计,经实验验证方法具高阶精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20755 2026-07-24 math.NA cs.NA 新提交 50%

A virtual element method for Darcy's problem coupled with a heat equation

一种用于达西问题与热方程耦合的虚拟单元法

Danilo Amigo, Felipe Lepe

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究二维空间中达西问题与非线性热方程耦合问题,采用虚拟单元法求解,证明了数值格式适定性,推导了最优误差估计,并通过数值测试补充理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21091 2026-07-24 physics.optics math-ph math.MP 新提交 50%

Design and Optimization of Metasurfaces for Silicon Photonics: PhD Thesis

用于硅光子学的超表面设计与优化:博士论文

Mathys Le Grand

专题命中 扩散模型 :diffusion(abstract)

AI总结 该博士论文针对超表面逆向设计面临的难题,分三阶段应对。先评估求解器可靠性,再用局部相位近似等消除计算瓶颈,最后在通用协议下测试三种策略,通过多种方法提升超表面设计的保真度,实现多样且抗制造误差的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21234 2026-07-24 cond-mat.mes-hall 新提交 50%

Direct Measurement of Exciton Dispersion in the Long-Wavelength Limit

长波长极限下激子色散的直接测量

Peiyi He, Jiade Li, Jiakai Wang, Jiangxu Li, Jiahao Wang, Weiyu Sun, Yiwen Song, Xiaoyue Gao, Quanlin Guo, Bo Han, Ruochen Shi, Niklas Dellby, Tracy Lovejoy, Xing-Qiu Chen, Kaihui Liu, Yu Ye, Hailin Peng, Peng Gao

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究长波长极限下激子色散,利用散焦工程动量分辨电子能量损失谱,以hBN为平台,解析层依赖激子色散,量化相关参数,研究其对环境响应,揭示低维激子物理,为调控激子特性提供指导并建立实验途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18601 2026-07-24 econ.EM 版本更新 50%

Robust Signal Maximization in Spillover Experiments

溢出实验中的稳健信号最大化

Kirill Borusyak, Peter Hull, Evan Munro

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究溢出效应实验的最优设计与分析,刻画使最坏情况渐近方差最小化的处理分配分布和估计量,给出设计与分析问题的解决方案,框架在基准情形下有自然解并为一般网络提近似,半合成实验中方法降低标准误差、增加有效样本量。

Comments 70 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16619 2026-07-24 cs.RO cs.MA 版本更新 50%

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

SAGE:用于异构多智能体导航的社会感知生成引擎

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

机构 * Guohao School, Tongji University(同济大学国豪书院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) Tongji University(同济大学) Western University(西安大略大学) Aeromind Technology Co., Ltd.(深圳智元科技有限公司) University at Buffalo-SUNY(纽约州立大学布法罗分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。

Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18103 2026-07-24 physics.plasm-ph math-ph math.MP physics.flu-dyn 版本更新 50%

An Implicit Time-Domain Harmonic Balance Method for Radio-Frequency Capacitively Coupled Plasma Simulations

一种用于射频电容耦合等离子体模拟的隐式时域谐波平衡方法

Yuze Zhu, Yufeng Wei, Yue Zhang, Kun Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究将时域谐波平衡方法扩展用于射频电容耦合等离子体模拟,采用时空算子分裂策略避免全局雅可比矩阵内存密集组装,经基准验证,其结果准确,能绕过物理瞬态,相比传统方法有显著加速,确立了高效模拟范例。

Comments 41 pages, 23 figures, research article

详情

展开后加载摘要…

URL PDF HTML 收藏