arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-18 至 2026-06-18 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 60 篇

2606.19070 2026-06-18 math.AP 新提交 71%

A Measure-Valued Obstacle Problem for an Obliquely Reflected Diffusion with a Max-Type Payoff

具有最大值型收益的斜反射扩散的测度值障碍问题

Louis Shuo Wang, Jiguang Yu, Ye Liang

专题命中 扩散模型 :diffusion(title)

AI总结 针对非负象限中具有非光滑最大值型收益的斜反射最优停止问题,提出测度值势论形式的障碍问题公式,推导反射Itô-Tanaka恒等式,并证明验证定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18765 2026-06-18 cs.CV 新提交 70%

SpectralDiT: Timestep-Conditioned Spectral Residual Correction for Flow-Matching DiTs

SpectralDiT:流匹配DiT的时间步条件谱残差校正

Jiayu Tian

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出SpectralDiT,通过时间步条件谱残差校正模块,在CIFAR-10和ImageNet-100上以极少额外计算和参数提升流匹配DiT的生成质量,FID分别降低5.1%和8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18869 2026-06-18 cs.CV 新提交 57%

Learning to Distort: Weakly-Supervised Image Quality Transfer for Prostate DWI Correction

学习扭曲:用于前列腺DWI校正的弱监督图像质量迁移

YuCheng Tang, Wen Yan, Alexander Ng, Natasha Thorley, Pawel Rajwa, Yipei Wang, Aqua Asif, Clare Allen, Louise Dickinson, Francesco Giganti, David Atkinson, Shonit Punwani, Daniel Alexander, Shaheer Ullah Saeed, Veeru Kasivisvanathan, Yipeng Hu

机构 * UCL Hawkes Institute(UCL哈维斯研究所) Department of Medical Physics and Biomedical Engineering(医学物理与生物医学工程系) University College London(伦敦大学学院) Division of Surgery and Interventional Science(外科与介入科学分会) Centre for Medical Imaging(医学成像中心) British Urology Researchers in Surgical Training (BURST)(英国泌尿外科手术培训研究人员(BURST)) Department of Radiology(放射科) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金) Centre for Medical Image Computing(医学图像计算中心) Department of Computer Science(计算机科学系) Department of Urology(泌尿科)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出弱监督图像质量迁移框架,利用图像质量评估信号从无失真图像学习生成真实失真,并训练校正模型,在PI-RADS和Gleason评分分类任务中优于现有无配对方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13768 2026-06-18 cs.CV cs.AI 新提交 57%

CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation

CineOrchestra:面向电影视频生成的统一实体中心条件控制

Sharath Girish, Tsai-Shien Chen, Zhikang Dong, Mukesh Singhal, Hao Chen, Sergey Tulyakov, Aliaksandr Siarohin

机构 * Snap Inc.(Snap公司) UC Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CineOrchestra,一种统一控制主体、事件、相机和镜头切换的视频扩散模型,通过实体中心条件原语和参数无关的旋转位置编码实现多轴联合控制,在密集描述跟随和镜头切换时序上超越六种专用方法。

Comments Project page: https://snap-research.github.io/CineOrchestra

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13376 2026-06-18 cs.CV 新提交 57%

MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold

MoVerse: 基于全景高斯支架的实时视频世界建模

Yang Zhou, Ziheng Wang, Yuqin Lu, Haofeng Liu, Jun Liang, Shengfeng He, Jing Li

机构 * South China University of Technology Columbia University Orange Team, Youku Moku-Lab, HUJING Digital Media \& Entertainment Group Singapore Management University

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MoVerse,从单张窄视场图像实时构建可交互漫游的360度全景世界,通过拓扑感知扩散补全视场、全景几何残差预测生成3D高斯支架,并结合双向扩散教师蒸馏为因果自回归学生实现低延迟视频渲染。

Comments Project Page: https://orange-3dv-team.github.io/MoVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06361 2026-06-18 cs.CV 版本更新 57%

Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases Them

两步物理:在视觉细化之前锁定运动先验会擦除它们

Woojung Han, Seil Kang, Youngjun Jun, Min-Hung Chen, Fu-En Yang, Seong Jae Hwang

机构 * National Institute of Standards and Technology(国家标准与技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文发现图像到视频扩散模型在两步生成中比多步生成具有更好的物理一致性,通过频谱分析将原因归结为去噪过程中的相位侵蚀,并提出无需训练的PhaseLock框架,通过从两步推理中提取运动先验并利用潜在增量引导强制到高保真生成中,有效缓解相位退化,提升物理一致性平均6.2点,同时保持视觉保真度且开销极小。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21605 2026-06-18 cs.CV 版本更新 57%

S3OD: Towards Generalizable Salient Object Detection with Synthetic Data

S3OD:基于合成数据的通用显著目标检测

Orest Kupyn, Hirokatsu Kataoka, Christian Rupprecht

机构 * University of Oxford, VGG(牛津大学,视觉信息集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出S3OD方法,通过大规模合成数据生成和歧义感知架构,显著提升显著目标检测的跨数据集泛化能力,仅用合成数据训练即可降低20-50%误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09185 2026-06-18 cs.CV cs.AI 版本更新 57%

Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation

学习患者特异性疾病动态:基于潜在流匹配的纵向影像生成

Hao Chen, Rui Yin, Yifan Chen, Qi Chen, Chao Li

机构 * University of Cambridge(剑桥大学) Nanjing First Hospital(南京第一医院) Nanjing Medical University(南京医科大学) Johns Hopkins University(约翰霍普金斯大学) University of Dundee(邓迪大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Δ-LFM框架,利用流匹配对齐患者潜在轨迹,通过患者特异性潜在对齐实现单调疾病进展建模,在三个纵向MRI基准上验证了可解释性和性能。

Comments ICLR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09439 2026-06-18 cs.CV 版本更新 57%

SuperCarver: Texture-Consistent 3D Geometry Super-Resolution for High-Fidelity Surface Detail Generation

SuperCarver: 纹理一致的3D几何超分辨率用于高保真表面细节生成

Qijian Zhang, Xiaozheng Jian, Xuan Zhang, Wenping Wang, Junhui Hou

机构 * Tencent Games, China(腾讯游戏,中国) Department of Computer Science & Engineering, Texas A & M University(电子与计算机工程系,德克萨斯A&M大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SuperCarver,一种3D几何超分辨率管线,通过先验引导的法线扩散模型和噪声鲁棒的逆渲染,为粗糙网格补充纹理一致的表面细节,实现高保真细节生成。

Comments Accepted in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09631 2026-06-18 cs.SD cs.CL cs.CV 版本更新 57%

DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching

DiFlow-TTS: 基于离散流匹配的紧凑低延迟零样本文本转语音

Ngoc-Son Nguyen, Thanh V. T. Tran, Hieu-Nghia Huynh-Nguyen, Truong-Son Hy, Van Nguyen

机构 * FPT Software AI Center(FPT软件AI中心) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出DiFlow-TTS框架,通过离散流匹配和分解离散流去噪器,在零样本TTS中实现高质量与低延迟的平衡。

Comments Accepted at Interspeech 2026 (Long Paper Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21615 2026-06-18 cs.CV 版本更新 57%

Epipolar Geometry Improves Video Generation Models

极线几何改进视频生成模型

Orest Kupyn, Théo Uscidda, Marta Tintore Gazulla, Fabian Manhardt, Federico Tombari, Christian Rupprecht

机构 * University of Oxford(牛津大学) Google Research(谷歌研究院) CREST-ENSAE, Institut Polytechnique de Paris(巴黎理工学院CREST-ENSAE研究中心) Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频生成模型几何不一致和运动伪影问题,提出基于极线几何约束的偏好优化方法,在保持视觉质量的同时将极线误差降低31%,人类评分一致性从54%提升至72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18245 2026-06-18 cs.CV cs.LG 版本更新 57%

VGGHeads: 3D Multi Head Alignment with a Large-Scale Synthetic Dataset

VGGHeads: 基于大规模合成数据集的3D多头部对齐

Orest Kupyn, Eugene Khvedchenia, Christian Rupprecht

机构 * University of Oxford(牛津大学) Piñata Farms Ukrainian Catholic University(乌克兰天主大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出VGGHeads,一个由扩散模型生成的大规模合成数据集,用于单步同时进行头部检测和3D网格重建,在真实图像上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19036 2026-06-18 cs.LG 新提交 50%

Geometric and Stochastic Analysis of Discontinuities in Sparse Mixture-of-Experts

稀疏混合专家模型中不连续性的几何与随机分析

Tho Tran Huu, Huu-Tuan Nguyen, Thien-Hai Nguyen, Nhat-Tri Ho, Viet-Hoang Tran, Tho Quan, Tan Minh Nguyen

机构 * Department of Mathematics, National University of Singapore, Singapore(新加坡国立大学数学系) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), VNU-HCM, Ho Chi Minh City, Vietnam(胡志明市技术大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文对稀疏混合专家模型中的不连续性进行几何与随机分析,分类不连续阶数,建立渐近体积估计,证明随机路径几乎必然击中一阶不连续,并提出低开销平滑机制以提升性能。

Comments ICML 2026 Spotlight. arXiv admin note: text overlap with arXiv:2510.17794 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19004 2026-06-18 cs.DC cs.AI cs.LG 新提交 50%

Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

Spotlight: 协同种子探索与抢占式GPU用于DiT强化学习后训练

Ruiqi Lai, Dakai An, Wei Gao, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Dmitrii Ustiugov, Wei Wang

机构 * NTU Singapore(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对DiT强化学习后训练成本高的问题,提出Spotlight系统,通过利用探索对旧权重的容忍性和SP组快速重配置,在抢占式GPU上实现高效训练,加速4倍并降低成本1.4-6.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18888 2026-06-18 cs.AI 新提交 50%

Generative-Model Predictive Planning for Navigation in Partially Observable Environments

部分可观测环境下导航的生成模型预测规划

Thomas Quilter, Yifan Zhu, Guorui Quan, Mingfei Sun, Samuel Kaski

机构 * University of Manchester(曼彻斯特大学) Aalto University(阿尔托大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出BeliefDiffusion框架,结合扩散模型和模型预测控制,显式建模多模态信念分布并进行前瞻规划,在合成地图环境中显著优于无模型强化学习和生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18710 2026-06-18 cs.CR 新提交 50%

Image Prompt Reconstruction Attacks on Distributed MLLM Inference Frameworks

分布式多模态大模型推理框架上的图像提示重建攻击

Xinjian Luo, Hongyan Chang, Jianxin Wei, Yuncheng Wu, Xiaofeng Gao, Meikang Qiu, Ting Yu, Xue Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18315 2026-06-18 cs.LG cs.AI 新提交 50%

Ghost Attractor Networks: Basin-Structured Dynamical Decoders for Closed-Loop Sequential Generation

鬼吸引子网络:用于闭环序列生成的盆地结构动力学解码器

Tianyu Wang, Ying Wang, Zhihao Liu, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Department of Production Engineering, KTH Royal Institute of Technology(瑞典皇家理工学院生产工程系) Department of Decision and Control Systems, KTH Royal Institute of Technology(瑞典皇家理工学院决策与控制系统系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出鬼吸引子网络,一种理论推导的动力学解码器,通过构建盆地-吸引子结构实现高效闭环序列生成,在机器人动作解码任务中以2.3M参数匹配1.07B参数扩散变压器的离线精度,延迟降低32倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18264 2026-06-18 cs.SI cs.AI cs.CL 新提交 50%

Simulating Hate Speech Cascades with Multi-LLM Agents: Empirical Grounding, Modeling Fidelity, and Intervention Strategies

使用多LLM智能体模拟仇恨言论级联:实证基础、建模保真度与干预策略

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过多LLM智能体系统模拟在线仇恨言论传播,发现其能再现实证数据中的立场单一性和毒性同质性,并通过消融实验识别出智能体异质性为关键保真因素,提出针对密集网络的放大器干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19273 2026-06-18 quant-ph 新提交 50%

Random-matrix reduction in projective quantum mechanics: Numerical simulations

投影量子力学中的随机矩阵约化:数值模拟

Alexey A. Kryukov

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过数值模拟验证随机矩阵态约化框架,展示各向同性扩散、Born规则频率和宏观牛顿运动等特征,并比较GUE与GOE哈密顿量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19272 2026-06-18 quant-ph 新提交 50%

Random-matrix reduction in projective quantum mechanics

投影量子力学中的随机矩阵约化

Alexey A. Kryukov

专题命中 扩散模型 :diffusion(abstract)

AI总结 基于一个动力学猜想,建立测量、经典性和量子悖论的状态空间几何框架,其中随机矩阵动力学产生玻恩规则和经典行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18973 2026-06-18 cond-mat.str-el cond-mat.mes-hall cond-mat.supr-con quant-ph 新提交 50%

Emergence of Resonating Valence-Bond Correlations in Stretched Graphene

拉伸石墨烯中共振价键关联的出现

Sam Azadi, A. Principi, T. D. Kühne, M. S. Bahramy

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过量子蒙特卡洛方法研究拉伸石墨烯,发现共振价键态能量优势随拉伸先增后减,揭示电子关联的非单调演化,表明晶格膨胀可驱动石墨烯进入强关联区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18848 2026-06-18 cond-mat.dis-nn 新提交 50%

Extracting effective scaling exponents in finite-size hyperuniform systems

提取有限尺寸超均匀系统中的有效标度指数

Yuan Liu, Xurui Li, Jianxiang Tian, Xunwang Yan, Ge Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对有限尺寸超均匀系统中标度指数估计不准的问题,提出结合结构因子、数方差和扩散可扩展性三种互补方法的实用协议,通过联合经验估计器稳健提取有效指数α。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18401 2026-06-18 cond-mat.mes-hall cond-mat.quant-gas 新提交 50%

Negative diffusivity of excitons in electron-hole plasmas

电子-空穴等离子体中激子的负扩散性

H. Terças, V. N. Mantsevich

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过流体动力学框架研究二维半导体中激子在电子-空穴等离子体中的输运,发现等离子体惯性导致激子扩散模式与声学等离子体模式耦合,产生动态不稳定性,表现为有效负扩散系数。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18290 2026-06-18 cond-mat.stat-mech cs.LG eess.SP 新提交 50%

Stochastic Thermodynamics and SDE-based Generative Models

随机热力学与基于SDE的生成模型

Yaowen Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文在随机热力学框架下,为基于SDE的生成模型(如扩散模型和薛定谔桥)定义了轨迹层面的功、热和熵产生,并推广了Jarzynski恒等式和类第二定律不等式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18842 2026-06-18 astro-ph.HE 新提交 50%

\texttt{TransFit-MAG}: Self-Consistent Modeling of Magnetar-Powered Transients from Shock Breakout to Spin-Down Heating

TransFit-MAG:从激波突破到自旋下降加热的磁星驱动暂现源的自洽建模

Jing-Yao Li, Liang-Duan Liu, Yun-Wei Yu, Guang-Lei Wu, Yu-Hao Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出TransFit-MAG框架,自洽耦合辐射扩散、磁星驱动的脉冲星风云动力学和激波传播,统一解释磁星驱动暂现源的双峰或单峰光变曲线,并拟合LSQ14bdq。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18077 2026-06-18 cond-mat.mes-hall cond-mat.mtrl-sci 新提交 50%

Highly nonlinear Moiré exciton and trion polaritons

高度非线性的莫尔激子和三子极化激元

Arnab Barman Ray, Trevor Ollis, Fei Cheng, Adam L. Freidman, Aubrey T. Hanbicki, Anthony Nickolas Vamivakas

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过将n掺杂MoSe2/WS2异质双层中的层杂化激子和三子强耦合到光学微腔中,发现掺杂电子引起的Lindhard屏蔽和三子形成导致显著的非单调非线性响应,并实现名义扩散长度接近100微米的高速度热极化激元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11840 2026-06-18 math.NA cs.NA 新提交 50%

Sparsity-Driven Source Localization in Tomographic Sensing Applications

断层扫描传感应用中基于稀疏性的源定位

Marco Mattuschka, Noah An der Lan, Stefanie Schröder, Arne Ficks, Max von Danwitz, Alexander Popp

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对双焦平面阵列傅里叶变换红外光谱仪系统,提出基于稀疏正则化的源识别算法,通过平流-扩散方程建模和水平集描述实现污染物释放位置重建与羽流演化预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10017 2026-06-18 astro-ph.HE astro-ph.CO astro-ph.GA hep-ph 新提交 50%

Refined anti-proton and anti-deuteron fluxes from weak-scale Dark Matter

来自弱尺度暗物质的精细反质子和反氘通量

Marco Cirelli, Mattia Di Mauro, Arpan Kar

专题命中 扩散模型 :diffusion(abstract)

AI总结 基于更新传播模型和CosmiXs谱,计算质量从几GeV到100 TeV的暗物质湮灭或衰变产生的反质子和反氘宇宙线通量,并与PPPC4DMID结果比较,发现新模型下通量更稳健。

Comments 26 pages, 14 figures, 1 table. v2: metadata corrected. The results are available at https://github.com/CosmiXsPPPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15658 2026-06-18 quant-ph 版本更新 50%

Wave packet landscape in open quantum systems

线性开放量子系统的波包景观

Kang Xu, Miao-Miao Yi, Zi-Hong Yan, C. P. Sun

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究线性开放量子系统中波包展开的长期行为,通过量子景观方法揭示扩散、局域化和坍缩的统一起源,基于协方差空间的对称结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27285 2026-06-18 cond-mat.soft physics.flu-dyn 版本更新 50%

Surfactant reorientation under shear: dynamic surface tension and droplet deformation

剪切作用下表面活性剂的重新取向:动态表面张力与液滴变形

Alexandra J. Hardy, Abdallah Daddi-Moussa-Ider, Elsen Tjhung

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究剪切流下表面活性剂各向异性取向与流动的耦合,发现其可导致剪切依赖的有效表面张力和非平凡液滴变形,并通过相场模型和微扰理论分析这一机制。

详情

展开后加载摘要…

URL PDF HTML 收藏