arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-16 至 2026-07-16 共收录 26 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1 篇

2606.26738 2026-07-16 cs.CV 版本更新 79%

Do Image Editing Models Understand Lighting?

图像编辑模型是否理解光照?

Tim Küchler, Johann-Friedrich Feiden, Matthias Nießner, Carsten Rother

机构 * Heidelberg University(海德堡大学) Technical University of Munich(慕尼黑工业大学) Zuse School ELIZA

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出3D锚定光探针基准(3DLP),通过真实世界HDR数据集评估图像编辑模型对光照变化的编辑准确性,发现模型在镜面高光区域表现较好,但整体仍有改进空间。

Comments Project page: https://tim-kuechler.github.io/3DLP/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 21 篇

2502.16167 2026-07-16 cs.CV cs.AI 版本更新 88%

PersGuard: Preventing Malicious Personalization in Text-to-Image Diffusion Models via Model Backdoors

PersGuard:通过模型后门防止文本到图像扩散模型中的恶意个性化

Xinwei Liu, Xiaojun Jia, Yuan Xun, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) BraneMatrix AI School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型个性化引发的隐私问题,提出PersGuard框架,通过在模型发布前嵌入保护后门,结合统一优化问题制定后门注入,经实验验证其在隐私保护方面优于现有基于扰动的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00927 2026-07-16 cs.CV cs.AI 版本更新 83%

Post-Training Pruning for Diffusion Transformers

扩散变换器的训练后剪枝

Chengzhi Hu, Xuewen Liu, Jing Zhang, Mengjuan Chen, Zhikai Li, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散变换器(DiTs)计算开销大的问题,提出DiT-Pruning方法,通过能量感知的显著性度量与聚类感知的剪枝粒度,在50%稀疏度下仅损失0.001 CLIP分数。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05981 2026-07-16 cs.CV cs.LG 版本更新 83%

Inverting the Streaming-Diffusion Bottleneck: Video-Rate MLLM-Conditioned Edit Diffusion on a Consumer GPU

基于视觉感知的多模态大语言模型条件编辑扩散的视频率流式风格化:蒸馏UNet + MLLM文本编码器上的非对称批处理推理

Yoshiyuki Ootani

机构 * Independent researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对蒸馏扩散模型中文本编码器成为瓶颈的问题,提出一种结合非对称CUDA流水线、编译友好的ControlNet-LLLite重构和周期性条件刷新调度的流式管线,在消费级GPU上实现视频率实时风格化编辑。

Comments 14 pages, 4 figures, 13 tables. Code, evaluation harness, and the released Temporal LLLite adapter weights are at https://github.com/otanl/dreamlite-stream (also mirrored to Hugging Face and Zenodo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08016 2026-07-16 cs.CV cs.GR 版本更新 81%

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting

LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化

Zixin Guo, Yehonathan Litman, Yifeng He, John Miller, Chuhan Chen, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Bosch Research(博世研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。

Comments Project page: https://www.zixinguo.me/lightcrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12785 2026-07-16 cs.CV 版本更新 79%

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

ExtraGS:通过扩散引导的3D高斯点渲染增强内窥镜视图外推

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

机构 * The School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, and the Shanghai Key Laboratory of Navigation and Location-Based Services(上海交通大学自动化与智能感知学院以及上海市导航与位置服务重点实验室) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对传统内窥镜视野局限及神经渲染外推有伪影问题,提出ExtraGS框架,通过不确定性引导虚拟相机采样、扩散模型细化视图及置信加权微调策略,增强内窥镜视图外推,在新视图合成中达先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28419 2026-07-16 cs.CV cs.AI 版本更新 79%

MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentation

MedDiffuseMix: 通过显著性感知的扩散医学图像数据增强保留诊断证据

Teerath Kumar, Raja Vavekanand, Muhammad Turab

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MedDiffuseMix框架,利用分类器显著性图引导扩散混合,主要增强低显著性背景区域,保留诊断关键区域,在四个医学图像数据集上提升分类性能。

Comments Under review Signal Image and Video Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04253 2026-07-16 q-bio.PE math.PR 版本更新 78%

Diffusion bridge with randomized initial and terminal times and its application to fish migration

具有随机初始和终止时间的扩散桥及其在鱼类洄游中的应用

Hidekazu Yoshioka, Mohammed Louriki

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 构建含环境因素影响的随机微分方程模型(非利普希茨扩散系数的扩散桥),通过时变产生随机初末时间,建立模型适定性,依水温影响鱼洄游假设估算参数并探索环境DNA数据分析应用。

Comments Updated on July 15, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04113 2026-07-16 cs.LG cs.NA math.NA 版本更新 78%

Asymptotic Preservation and Uniform Accuracy of Diffusion and Flow-Matching Samplers

扩散与流匹配采样器的渐近保持后验分析

Shiheng Zhang

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究将最小标准差视为奇异摄动参数,通过后验审计确定固定步长采样器的渐近保持性,分析不同时钟在终端层的稳定性及准确性,在特定模型上验证确定性和随机采样器特性,并用于EDM CIFAR-10检查点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20763 2026-07-16 eess.IV 版本更新 78%

From Sparse X-rays to 3D CT: Training-Free Reconstruction with Diffusion Priors

从稀疏X射线到三维CT:基于扩散先验的无训练重建

Zhenkai Zhang, Markus Hiller, Krista A. Ehinger, Tom Drummond

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TF-PRDiT,一种无需训练的条件采样框架,利用冻结的3D扩散Transformer先验解决多种医学逆问题,通过可微DRR投影器实现从稀疏X射线到高质量CT重建,支持任意数量输入X射线。

Comments Accepted at DGM4MICCAI 2026. Code available at https://github.com/Fredy-Zhang/TF-PRDiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10330 2026-07-16 cs.RO cs.AI 版本更新 78%

PC-Diffuser: Path-Consistent Capsule CBF Safety Filtering for Diffusion-Based Trajectory Planner

PC-Diffuser: 基于路径一致的胶囊CBF安全过滤器用于基于扩散的轨迹规划器

Eugene Ku, Yiwei Lyu

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PC-Diffuser通过在扩散规划中嵌入可认证的路径一致屏障函数,实现轨迹生成中的安全性和路径一致性,提升复杂交通环境下的自动驾驶安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25753 2026-07-16 math.NA cs.CE cs.NA stat.CO 版本更新 78%

Quasi-Monte Carlo methods for uncertainty quantification of tumor growth modeled by a parametric semi-linear parabolic reaction-diffusion equation

用于参数半线性抛物型反应扩散方程肿瘤生长不确定性量化的小麦-蒙特卡洛方法

Alexander D. Gilbert, Frances Y. Kuo, Dirk Nuyens, Graham Pash, Ian H. Sloan, Karen E. Willcox

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用准蒙特卡洛方法对参数半线性抛物型反应扩散方程建模的肿瘤生长进行不确定性量化,通过理论分析和数值实验验证了其在计算感兴趣量方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30248 2026-07-16 cs.CV cs.LG 版本更新 57%

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06027 2026-07-16 cs.SD 版本更新 50%

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

文本到语音合成中语音表示的弗雷歇距离损失

Ho-Lam Chung, Kuan-Po Huang, Bo-Ru Lu, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对少步TTS模型训练问题,提出语音表示弗雷歇距离损失(SR-FD),在微调时让模型用相同采样器合成语音,将其特征与参考统计量匹配,无需判别器和推理计算,显著降低Seed-TTS英语的字错误率,是提高可懂度的分布正则化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10011 2026-07-16 astro-ph.HE 版本更新 50%

A Multi-Wavelength View of the First Type Ic-BL Supernova with an Einstein Probe X-ray Shock Breakout

首次具有爱因斯坦探针X射线激波暴发的Ic-BL型超新星的多波段视角

Jillian C. Rastinejad, Gokul Srinivasaragavan, Nikhil Sarin, Tanner O'Dwyer, S. Bradley Cenko, James K. Leung, Anya E. Nugent, Daniel A. Perley, Genevieve Schroeder, Shreya Anand, Tomas Ahumada, Igor Andreoni, Aleksandra Bochenek, Alessandra Corsi, Christoffer Fremling, Anna Y. Q. Ho, Mansi M. Kasliwal, Geoffrey Mo, Anirudh Salgundi, Kendall I. Sippy, J. Sollerman, Eric C. Bellm, Tracy X. Chen, Michael W. Coughlin, Michael C. Davis, Fabio De Colle, Danielle Frostig, Christopher L. Fryer, Michael J. Graham, Xander J. Hall, K. -R. Hinds, Luca Izzo, Wynn Jacobson-Galan, Nathan P. Lourie, Keiichi Maeda, Josiah Purdum, Ben Rusholme, Avinash Singh, Robert Stein

专题命中 扩散模型 :diffusion(abstract)

AI总结 基于爱因斯坦探针发现的近邻快速X射线暂现源EP260321a,通过多波段观测确认其与Ic-BL型超新星SN 2026gzf成协,首次为这类超新星提供确凿的X射线激波暴发证据,并约束了喷流能量和射电辐射。

Comments Version accepted to ApJL with minor changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24143 2026-07-16 astro-ph.HE astro-ph.SR 版本更新 50%

Pitch-Angle Scattering of Cosmic Rays: Confronting Theory with Observations

宇宙线的投掷角散射:理论与观测的对决

Huirong Yan, Siqi Zhao, Ming Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过比较西藏ASγ实验的宇宙线小尺度各向异性数据推导的局域星际介质投掷角扩散系数与理论预测,发现与阻尼在暖电离介质中的准板状快模散射预测高度一致,表明宇宙线散射主要由快模湍流主导。

Comments 9 pages, 4 figures, accepted in The Astrophysical Journal Letters (ApJL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19867 2026-07-16 math.NA cs.NA 版本更新 50%

When can a neural operator replace a coarse solve? Architectural principles for two-level preconditioning

当神经算子可以取代粗解时?用于两级预处理的架构原理

Hugo Melchers, Victorita Dolean, Michael Abdelmalik

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了神经算子在两级预处理中的应用,通过系统变化四种DeepONet-like架构,发现Neural Green's Operator(NGO)在特定设计下表现最佳,能够有效替代粗解,同时揭示了固定大小学习粗空间在高Helmholtz波数下的失效原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11096 2026-07-16 hep-th astro-ph.CO gr-qc 版本更新 50%

Stochastic inflation from a non-equilibrium renormalization group

非平衡重整化群中的随机膨胀

Sebastián Céspedes, Thomas Colas

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文从两个视角探讨随机膨胀,通过有效场论和重整化群方程分析,推导了包含耗散和扩散算符的理论,并计算了修正项。

Comments 48 pages without appendices (76 pages total), one figure; expanded discussion of the local limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21448 2026-07-16 cond-mat.soft cs.NA math.NA physics.flu-dyn 版本更新 50%

Continuum granular flow model with restitution-derived viscoelastic damping

具有恢复系数导出粘弹性阻尼的连续体颗粒流模型

Bodhinanda Chandra, Sachith Dunatunga, Ken Kamrin

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种统一的粘弹性-粘塑性连续框架,用于建模速率依赖的颗粒流。通过将微惯性和粘弹性耗散纳入单一连续描述,建立了恢复系数与连续粘度的直接联系,展示了粘性耗散对波传播和碰撞过程的影响。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16158 2026-07-16 cond-mat.mtrl-sci 版本更新 50%

Dislocation-ledge coupling governs semicoherent precipitate growth

位错- ledge耦合调控半相干析出相生长

Jin-Yu Zhang, Juan Du, Lin Yang, Frédéric Mompiou, Shigenobu Ogata, Wen-Zheng Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示半相干析出相生长的动能缺陷过程,通过位错-ledge耦合机制解释其各向异性动力学及形态选择。

Comments Revised abstract and manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17466 2026-07-16 math.DS cs.NA math.NA stat.CO 版本更新 50%

A Full-Density Approach to Simulating Random Iteration Equations with Applications

全密度方法用于随机迭代方程的模拟及其应用

Wolfgang Hoegele

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种统一框架用于模拟随机迭代方程,通过逐步传播状态向量的全概率密度避免重复路径蒙特卡洛模拟,展示非线性随机微分方程、全密度梯度下降法及混沌映射等应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10515 2026-07-16 math.PR 版本更新 50%

A shape theorem for BBM in a periodic environment

周期环境中二元分支布朗运动的形状定理

Louigi Addario-Berry, Arturo Arellano Arias, Jessica Lin

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究分支率依赖周期性空间异质性的二元分支布朗运动长期行为,通过建立粒子位于半空间概率的尾部界限等概率性方法,证明其经\(t\)归一化后趋近确定性凸形状,得出各方向投影渐近传播速度并利用相关方程前沿速度。

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2607.10293 2026-07-16 math.NA cs.NA 版本更新 71%

An improved estimate of the intermediate internal energy in the energy-consistent HLLD scheme

关于《HLL型MHD黎曼求解器中间状态的能量一致性》中HLLD型格式的数值扩散问题

Fan Zhang

专题命中 个性化与一致性 :diffusion(title)

AI总结 研究针对戴 - 伍德沃德激波管问题中HLLD-ec格式出现的密度振荡,提出对该格式的简单修改,核心方法是修改格式,主要贡献是消除了密度振荡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26580 2026-07-16 math.NA cs.NA eess.SP 版本更新 50%

Graph-Based ECG Synthesis with Activation-Consistency Certification and Diagnostics-Aware Morphology Curation

基于图的ECG合成:激活一致性认证与诊断感知形态策展

Yongjun Yoo

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 提出一种基于图的ECG合成框架,通过激活一致性认证和诊断感知形态策展,生成可控且可解释的心电图信号,在激活时间一致性、T波形态和导联覆盖率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 1 篇

2606.14999 2026-07-16 cs.LG 版本更新 50%

Unlocking Latent Dimensions: Exploring Representations of Large-Scale X-ray Scattering Data using Variational Autoencoders

解锁潜在维度:使用变分自编码器探索大规模X射线散射数据的表示

Monika Choudhary, Xiaoya Chong, Runbo Jiang, Wiebke Koepp, Petrus H. Zwart, Damon English, Gregory M. Su, Eric Schaible, Chenhui Zhu, Mostafa Nassr, Noah P. Wamble, Kelvin Kam-Yun Li, Jonathan M. Chan, Jose Carlos Diaz, Cameron McKay, Lynn Katz, Benny Freeman, Guillaume Freychet, Yevgen Matviychuk, Eliot Gann, Daniel B. Allan, Benedikt Sochor, Frank Schluenzen, Stephan V. Roth, Ethan J. Crumlin, Dylan McReynolds, Tanny Chavez, Alexander Hexemer

机构 * Advanced Light Source, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室先进光源) Center for Advanced Mathematics for Energy Research Applications, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室能源研究应用高级数学中心) Molecular Biophysics & Integrated Bioimaging Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室分子生物物理学与综合生物成像部) Berkeley Synchrotron Infrared Structural Biology program, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室伯克利同步辐射红外结构生物学项目) Materials Sciences Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室材料科学部) McKetta Department of Chemical Engineering, University of Texas(德克萨斯大学麦凯塔化学工程系)

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对X射线散射数据离线探索和实时分析两大挑战,训练领域特定注意力卷积变分自编码器(C-VAE),学习低维表示以捕捉结构变化,并集成到MLExchange平台的Latent Space Explorer中,支持交互式结构探索。

详情

展开后加载摘要…

URL PDF HTML 收藏