arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-05 至 2026-08-05 共收录 96 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 76 篇

2608.03721 2026-08-05 cs.SD 新提交 50%

On the Geometry of Music Bandwidth Extension in Latent Spaces of Audio Codecs

音频编解码器潜在空间中音乐带宽扩展的几何特性研究

Hendrik Vincent Koops, Hao Hao Tan, Elio Quinton

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文分析了多种先进方法与简单算术变换在神经编解码器潜在空间中用于音乐带宽扩展的性能,发现简单向量加法可媲美大型扩散模型,建议将其设为研究基准。

Comments 8 pages, 4 figures, 4 tables. Accepted at the 27th International Society for Music Information Retrieval Conference (ISMIR 2026). Companion website: https://ismir26latentgeo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03103 2026-08-05 cs.RO cs.AI 新提交 50%

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

针对需要时变力的操作任务的模仿学习的分层方法

Rishabh Shukla, Adithya Santhosh, Shaili Gandhi, Samrudh Moode, Satyandra K. Gupta

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对接触密集拆卸任务中扩散策略的延迟问题,提出DPA-FTG分层方法,解耦高低频控制,在双手电池拆卸任务上性能优于RDP等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02990 2026-08-05 cs.RO 新提交 50%

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02799 2026-08-05 stat.ML cs.AI cs.LG math.PR 新提交 50%

A Hyperfinite Framework for Score-Based Generative Modeling

基于得分的生成建模的超有限框架

Sunder Ram Krishnan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文在非标准分析框架下构建了基于得分的生成建模的超有限框架,推导了相关恒等式、公式并分析了二阶一致性,建立了离散网格动力学与生成建模核心环节的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03256 2026-08-05 math.NA cs.NA 新提交 50%

An L-Stable Sequential Two-Stage Fourth-Order Method with ADER Trajectory Derivatives for Stiff Transport--Relaxation Systems

Zhixin Huo, Yangnan Su

专题命中 扩散模型 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03126 2026-08-05 math.AP 新提交 50%

A note on relativistic kinetic Schauder estimates

关于相对论动理学Schauder估计的一个注记

Weinan Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 该文针对带相对论输运的线性动理学方程,构造仅基于动量的Schauder估计的反例,证明完整Lorentzian Hölder控制无法被仅基于动量的Hölder控制替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02823 2026-08-05 math.NA cs.NA 新提交 50%

Implicit-explicit and split-explicit super-time-stepping methods

隐式-显式与分裂显式超时间步方法

Daniel R. Reynolds, Sylvia Amihere, Mustafa Aggul

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出结合超时间步与龙格-库塔技术的ExtSTS方法,解决多物理场初值问题的时间积分效率问题,其性能优于ARK、Strang分裂等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03962 2026-08-05 quant-ph cs.AI cs.CC 新提交 50%

Separating quantum circuits from classical LLMs

将量子电路与经典大语言模型分离

Srinivasan Arunachalam, Arkopal Dutt, Hari Krovi, Rik Sengupta

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究证明了低深度量子计算与经典大语言模型架构在分布和功能上的无条件分离,为大语言模型时代量子优势的研究奠定了基础。

Comments 60 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03438 2026-08-05 physics.flu-dyn 新提交 50%

Modelisation of chaotic systems with a latent Stochastic Differential Equation

基于隐式随机微分方程的混沌系统建模

Ismaël Zighed, Nicolas Thome, Patrick Gallinari, Taraneh Sayadi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究针对混沌系统提出概率非侵入式降阶模型,用非线性自编码器结合隐空间SDE建模,生成的轨迹保留统计特性,为混沌研究提供可靠替代方案

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03685 2026-08-05 math.DS cs.NA math-ph math.MP math.NA 新提交 50%

Pattern formation: reactivity is not necessary for chemotaxis--driven instabilities

模式形成:反应性并非趋化性驱动的失稳的必要条件

Angela Monti

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究证明趋化性驱动的失稳无需反应性,扩展了反应-扩散系统的面向矩阵数值框架,通过示例验证了趋化性可单独诱导模式形成,揭示了两类空间自组织机制的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02862 2026-08-05 math-ph cs.NA math.MP math.NA 新提交 50%

Selection criteria for the compressible Euler equations: numerical study

可压缩欧拉方程的选择准则:数值研究

Megala Anandan, Bahulayan Chalil Aravind, Mária Lukáčová-Medvid'ová, S. V. Raghurama Rao, Kedar Shridhar Wagh, Changsheng Yu, Jiahui Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究以开尔文-亥姆霍兹问题为基准,对比四种数值格式,探究可压缩欧拉方程耗散弱解的选择准则及选择泛函对数值扩散的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03906 2026-08-05 cond-mat.soft physics.bio-ph 新提交 50%

Reaction Delays Boost, Rectify, and Reverse Motility in Activity Landscapes

反应延迟在活性景观中促进、校正并逆转运动性

Constantin Rein, Klaus Kroy, Viktor Holubec

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究发现延迟速度适应(延迟运动性)可打破活性景观的细致平衡,通过延迟时间调控实现定向输运、扩散增强甚至电流逆转,为活性物质自主控制提供了通用实验机制。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03718 2026-08-05 cond-mat.soft 新提交 50%

Synthetic paracrine signaling of colloids drives self-assembly limit cycles

胶体的合成分泌信号驱动自组装极限环

Tim E. Veenstra, René van Roij, Pepijn G. Moerman, Marjolein Dijkstra

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出一种旁分泌信号胶体模型,通过粒子产生的信号分子调控相互作用,模拟实现了自组装极限环,为构建类生命非平衡活性物质提供了平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02748 2026-08-05 astro-ph.IM 新提交 50%

Enhancing the sensitivity of next-generation X-ray imaging detectors with artificial intelligence and advanced event reconstruction algorithms

利用人工智能与高级事例重建算法提升下一代X射线成像探测器的灵敏度

D. R. Wilkins, A. Poliszczuk, A. Y. Pan, L. Sajkov, S. W. Allen, M. Heine, C. E. Grant, M. W. Bautz, T. Chattopadhyay, K. Donlon, S. Herrmann, B. LaMarr, E. D. Miller, P. Orel

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究研发了基于物理模型的AI/ML原型算法,可减少X射线探测器的粒子背景,提升低能段灵敏度与能量分辨率,其在MIT-LL CCID-93 CCD探测器上的性能已通过实验室数据验证,可满足未来X射线旗舰任务需求。

Comments Proceedings of the SPIE, Astronomical Telescopes and Instrumentation, Space Telescopes and Instrumentation 2026: Ultraviolet to Gamma Ray

Journal ref Proc. SPIE, 2026, 14146-248

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07754 2026-08-05 cs.LG quant-ph 版本更新 50%

Image classification via a quantum-inspired strategy involving a mixture of experts

通过包含专家混合的量子启发策略进行图像分类

Kumari Jyoti, Rohith Babu, Apoorva D. Patel

机构 * Centre for High Energy Physics, Indian Institute of Science(印度科学研究所高能物理中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究提出一种经典 - 量子混合的图像分类策略,量子部分含图像幅度编码等操作,多个专家用不同参数处理图像并提取特征,经典部分联合处理特征进行预测。实验表明该策略优于单个专家分析,降低预测失败率,在GPU上开销适中,还可在量子处理器执行。

Comments 14 pages, 18 figures, comments welcome (v2) The number of features extracted from the images is considerably reduced, which simplifies the subsequent classification. The results are essentially the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08149 2026-08-05 physics.chem-ph 版本更新 50%

Generation and Characterization of Surface-Attached Ultrathin Liquid Sheets for Grazing-Incidence X-ray Scattering

用于掠入射X射线散射的表面附着超薄液膜的产生与表征

Yibo Wang, Daniel P. DePonte, Adi Natan

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对固液界面超快结构动力学研究中面临的挑战,提出创建和表征超薄表面附着自由流动液膜的方法,利用撞击射流和气体辅助成型,实现超快时间分辨率,为掠入射散射实验提供稳定平台。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18928 2026-08-05 cs.LG 版本更新 50%

The Ensemble Schr{ö}dinger Bridge filter for Nonlinear Data Assimilation

集合施罗德桥滤波器用于非线性数据同化

Hui Sun

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种新的非线性最优滤波方法,结合预测步骤与扩散生成模型分析步骤,有效处理高非线性动态和观测过程,优于传统滤波方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01807 2026-08-05 math.AP 版本更新 50%

Logarithmically Coupled p-Laplacian Systems: A Complete Variational Theory from Compactness to Rigidity

p-拉普拉斯系统在局部有限图上的地面态解

Wenzheng Hu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了局部有限图上带有对数耦合项的p-拉普拉斯系统,通过Nehari流形和山峰定理证明了地面态的存在,并提出了一种新的指数校准技术以解决非分离的对数奇异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18933 2026-08-05 cs.RO cs.AI 版本更新 50%

Gated Memory Policy: In-Context Memorization and Adaptation

门控记忆策略

Yihuai Gao, Jeff Jinyun Liu, Shuang Li, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出门控记忆策略,通过学习记忆回溯时机与内容,提升机器人操作任务中对历史信息的利用效率,实现在非马尔可夫任务中性能提升30.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25330 2026-08-05 cond-mat.mtrl-sci 50%

Machine-Learned Interatomic Potentials for Predicting Physicochemical Properties of Molten Metal-Salt Systems for Calcium Electrolysis

基于机器学习的原子间势能用于预测钙电解熔融金属盐系统的物理化学性质

M. Polovinkin, N. Rybin, D. Maksimov, F. Valiev, A. Khudorozhkova, M. Laptev, A. Rudenko, A. Shapeev

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文利用机器学习的MTP势能进行分子动力学模拟,准确预测熔融Ca-Cu合金和CaCl2-KCl电解质的物理化学性质,验证了该方法在冶金应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15736 2026-08-05 math.PR 版本更新 50%

Convergence Rate of the Join-the-Shortest-Queue System

最短队列系统收敛速率

Yuanzhe Ma, Siva Theja Maguluri

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了最短队列系统在有限时间内的收敛速率,揭示了其在总变差距离下的收敛特性,为实际应用提供了更精确的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2602.16611 2026-08-05 cs.GR cs.CV 版本更新 62%

Style-Aware Gloss Control for Generative Non-Photorealistic Rendering

风格感知的光泽控制用于生成非照片实感渲染

Santiago Jimenez-Navarro, Belen Masia, Ana Serrano

机构 * University of Zaragoza -- I3A(萨拉戈萨大学--I3A)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种风格感知的光泽控制方法,通过训练生成模型来解耦光泽与艺术风格,实现对非照片实感图像的精细控制。

Comments Published in Computers & Graphics journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03971 2026-08-05 cs.CV 新提交 57%

UniWorld-Design: From Pixel Generation to Layer-Native Design

UniWorld-Design:从像素生成到层原生设计

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniWorld-Design是一种以语义RGBA层为原子单元的图像生成框架,含T2RGBA和I2L两个模型,在Crello基准测试中I2L和T2RGBA均优于现有相关模型。

Comments Project page: https://rabbitvis.rabbitpre.com/blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00094 2026-08-05 cs.CV 版本更新 57%

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01634 2026-08-05 cs.LG cs.AI 版本更新 50%

E4GEN: Event-level Explainable Extreme-Enhanced Time-series Generation

E4GEN:事件级可解释的极端增强时间序列生成

Lin Jiang, Dahai Yu, Ximiao Li, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出E4GEN可解释扩散框架,通过E-Activator、E-Predictor和E-Control三个组件实现事件级极端事件可控生成,在整体保真度、极端事件保真度和下游效用上优于现有方法。

Comments 48 pages,26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14315 2026-08-05 physics.med-ph cs.NA math.NA 版本更新 50%

Complex Wavelet-Based Sinogram Segmentation for Metal Artifact Reduction in Cone-Beam CT

基于复波let的sinogram分割用于锥束CT中金属伪影的减少

Siiri Rautio, Alexander Meaney, Salla-Maaria Latva-Äijö, Harshit Agrawal, Mikael Brix, Dinidu Jayakody, Samuli Siltanen

专题命中 可控生成 :inpainting(abstract)

AI总结 本文提出基于复波let的投影域金属伪影减少方法,通过分析性金属分割提升锥束CT图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18792 2026-08-05 q-bio.PE 50%

Multistage spatial model for informing release of Wolbachia-infected mosquitoes as disease control

Zhuolin Qu, Tong Wu

专题命中 可控生成 :diffusion(abstract)

Journal ref Royal Society Open Science (2026) 13 (6): 251724

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 4 篇

2608.03822 2026-08-05 cs.CV cs.AI 新提交 70%

FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synthesis

FlowForm:融合流体物理与拓扑一致性的卫星洪水合成方法

Zhang Weihui, Wang Ruizhi, Xu Hongye, Wang Huiqiong, Sun Li, Song Mingli

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 FlowForm是融合流体物理与拓扑一致性的卫星洪水合成框架,通过FDM、TAA及FloodScape数据集,在洪水图像生成的视觉保真度、配对图像相似性等指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03708 2026-08-05 cs.CV 新提交 70%

MultiCompose: Multi-Concept Personalized Composition with Per-Subject Attribute Binding

MultiCompose:基于每个主体属性绑定的多概念个性化生成

Ruirui Zhang, Zhengkai Zhao, Pan Gao

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 MultiCompose是解耦多概念个性化与多主体推理的图像生成框架,通过语义保留正则化和两阶段推理解决主体身份退化与属性错位问题,引入的MSP-Bench可联合评估相关指标,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01973 2026-08-05 cs.CV 版本更新 70%

NearID: Identity Representation Learning via Near-identity Distractors

NearID: 通过近身份干扰实现身份表示学习

Aleksandar Cvejic, Rameen Abdal, Abdelrahman Eldesokey, Bernard Ghanem, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Snap Research(Snap研究院)

专题命中 个性化与一致性 :image editing(abstract);personalized generation(abstract);分类 cs.CV

AI总结 本文提出NearID框架,通过近身份干扰消除背景影响,提升身份识别精度,改进模型在个性化生成和图像编辑任务中的表现。

Comments Accepted to ECCV 2026, Code, model, and dataset are released, visit https://github.com/Gorluxor/NearID

详情

展开后加载摘要…

URL PDF HTML 收藏