arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-20 至 2026-07-20 共收录 25 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2606.20155 2026-07-20 cs.CV cs.CL 版本更新 79%

NAMESAKES: Probing Identity Memorization in Text-to-Image Models

NAMESAKES: 探究文本到图像模型中的身份记忆

Morris Alper, Vasudha Varadarajan, Moran Yanuka, Angelina Wang, Hadar Averbuch-Elor

机构 * Carnegie Mellon University(卡内基梅隆大学) Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出一种黑盒行为探针,无需参考照片或训练数据,即可区分文本到图像模型生成的图像是记忆还是虚构,并在NAMESAKES数据集上验证其有效性。

Comments Project page: https://namesakes-web.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2603.11593 2026-07-20 cs.CV 版本更新 79%

WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing

WeEdit:一个数据集、基准和基于字形引导的文本中心图像编辑框架

Hui Zhang, Juntao Liu, Zongkai Liu, Liqiang Niu, Fandong Meng, Zuxuan Wu, Yu-Gang Jiang

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 WeEdit通过构建大规模数据集和定制训练策略,提升文本中心图像编辑的精度与多样性,优于现有开源模型。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 20 篇

2603.16551 2026-07-20 cs.CV cs.AI 版本更新 88%

CompDiff: Hierarchical Compositional Diffusion for Fair and Zero-Shot Intersectional Medical Image Generation

CompDiff:分层组合扩散用于公平和零样本交叉性医学图像生成

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gokhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(数据科学研究所,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(先进计算科学系,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) VITO, Belgium(比利时VITO研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 CompDiff通过分层组合扩散框架解决生成模型中因数据不平衡导致的公平性和零样本交叉性生成问题,在图像质量、子组公平性和零样本交叉性生成方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05509 2026-07-20 cs.CV 版本更新 79%

Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models

与流形相切:为扩散模型发现黎曼度量

Shinnosuke Saito, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的黎曼度量,通过分数函数雅可比的谱结构区分流形切线与法线方向,从而在噪声空间中促进路径保持流形切线性,提升扩散模型的生成质量与文本-图像对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08247 2026-07-20 math.NA cs.NA 版本更新 78%

A Convergent Geometry-Aware Reduction for Diffusion in Branched Tubular Networks

一种收敛的几何感知降维方法用于分支管状网络中的扩散

Zachary M. Miksis, Gillian Queisser

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种新的几何感知降维方法,解决了Fick-Jacobs方程在大径向梯度下的不稳定性问题,通过局部泰勒展开获得具有几何无关误差的模型,并在分支网络中实现了高效数值方案。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15927 2026-07-20 cs.LG cs.AI 版本更新 78%

DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone

DiffuMamba:基于Mamba架构的高吞吐量扩散语言模型

Vaibhav Singh, Oleksiy Ostapenko, Pierre-André Noël, Eugene Belilovsky, Torsten Scholak

机构 * ServiceNow Research, Montreal, Canada(ServiceNow研究机构,加拿大蒙特利尔) Concordia University(Concordia大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiffuMamba基于Mamba架构,通过结合扩散目标与线性序列建模,实现了高吞吐量的扩散语言模型,在长序列任务中表现出色。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00898 2026-07-20 cs.LG cs.RO 版本更新 78%

Dichotomous Diffusion Policy Optimization

二元扩散策略优化

Ruiming Liang, Yinan Zheng, Kexin Zheng, Tianyi Tan, Jianxiong Li, Liyuan Mao, Zhihao Wang, Guang Chen, Hangjun Ye, Jingjing Liu, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DIPOLE是一种新的RL算法,通过二元策略分解实现稳定可控的扩散策略优化,适用于复杂现实应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02851 2026-07-20 cs.RO 版本更新 78%

EmbodiedDiffusion: End-to-End Traversability-Guided Visual Diffusion for Heterogeneous Robot Navigation

EmbodiedDiffusion:用于异构机器人导航的端到端可通行性引导视觉扩散

Iana Zhura, Sausar Karaf, Faryal Batool, Nipun Dhananjaya Weerakkodi Mudalige, Valerii Serpiva, Ali Alridha Abdulkarim, Aleksey Fedoseev, Didar Seyidov, Hajira Amjad, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对自主导航中视觉可通行性估计问题,EmbodiedDiffusion框架利用无规划器合成监督等,同时预测可通行性地图与生成可行轨迹,经训练提炼语义到轻量级模型,能快速适应新平台,在多机器人室内环境中实现高效导航与轨迹生成。

Comments This work has been submitted for publication and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09581 2026-07-20 cs.CV cs.SD 版本更新 57%

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

万舞者:一种用于分钟级连贯音乐到舞蹈生成的分层框架

Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Ruoshi Zhang, Yi Lu, Gang Cheng, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对从音乐生成舞蹈视频的挑战,提出万舞者分层框架,解耦过程为全局关键帧规划和局部时间细化,利用音乐上下文确保连贯,通过动态帧率自适应等创新,突破时长限制,在多舞蹈类型上表现出色,达新的技术水平。

Comments project: https://humanaigc.github.io/wan-dancer-project/, code: https://github.com/Wan-Video/Wan-Dancer, modelscope: https://www.modelscope.cn/models/Wan-AI/Wan-Dancer-14B, huggingface: https://huggingface.co/Wan-AI/Wan2.2-Animate-14B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03641 2026-07-20 stat.ML cs.LG 版本更新 50%

Missing Data Imputation under Manifold Hypothesis

流形假设下的缺失数据补全

Zelong Bi, Amuchechukwu Ibenegbu

机构 * School of Mathematics & Statistics(数学与统计学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对高维缺失数据补全问题,基于流形假设与混合变分自编码器,采用SIR采样结合潜空间扩散模型实现符合底层几何结构的缺失值补全,性能优异且可量化不确定性、支持动态补全。

Comments correct errors in Appendix A and in Appendix D, update the author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11392 2026-07-20 cond-mat.stat-mech quant-ph 版本更新 50%

Compressed minimum-purity time evolution for late-time quantum dynamics

用于晚期量子动力学的压缩最小纯度时间演化

Moksh Bhateja, Jonas B. Rigo, Markus Schmitt

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出压缩最小纯度时间演化方法,通过最小纯度原则闭合局域密度矩阵运动方程,在保持精度的同时实现长时模拟,应用于自旋链和Floquet系统。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10545 2026-07-20 math.PR 版本更新 50%

Linear independence properties of the signature components of time-augmented stochastic processes

时间增强随机过程的签名分量的线性独立性质

Arthur Bourdon, Benjamin Jourdain, Hervé Andrès

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了时间增强随机过程签名分量间的线性依赖关系,证明了特定子族分量在几乎必然意义下线性独立,并给出了计算代价最小的基。

Comments 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16243 2026-07-20 physics.plasm-ph astro-ph.HE 版本更新 50%

Stern--Gerlach Spin Sorting and Dynamical Feedback in Relativistic Pair-Plasma Reconnection

斯图尔德-格尔克Spin排序在相对论性磁重联中

K. Nykyri

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个斯图尔德-格尔克spin-kinetic控制参数用于磁重联,通过分析不同环境中的参数,揭示了在磁力尾、日冕等环境中SG传输可忽略,而在磁星电流片中则显著,为强场spin-kinetic重联提供了研究框架。

Comments 8 pages including six figures, supplementary material with 7 pages and 1 figure. This is a re-submission to PRL and companion paper, performing a relativistic sweep-study, SpinPIC2D code description, testing and validation has been submitted as companion paper to Physical Review E

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11466 2026-07-20 math.AP math.PR 版本更新 50%

Regularity thresholds for anomalous dissipation and related phenomena in passive scalars

被动标量中异常耗散及相关现象的正则性阈值

Marco Bagnara, Daniel W. Boutros, Camillo De Lellis, Svitlana Mayboroda

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究在二维和三维空间中被动标量的正则性条件,证明在特定随机场下无异常耗散,并探讨其对湍流特性的影响。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14194 2026-07-20 eess.SP cs.LG cs.SY eess.SY 版本更新 50%

Boosted Enhanced Quantile Regression Neural Networks with Spatiotemporal Permutation Entropy for Complex System Prognostics

增强型分位数回归神经网络与时空排列熵用于复杂系统预测

David J Poland

机构 * University of Hertfordshire(赫特福德大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于时空排列熵分析与增强型分位数回归神经网络的新型框架,用于模式预测和系统预测。通过结合基于熵的复杂性度量与先进神经架构,实现多维系统复杂动态模式的理解,提升预测精度和不确定性量化能力。

Comments Preliminary version of a predictive maintenance framework using spiking neural networks and entropy-based analysis. To be expanded in future publications with hardware implementations and real-time drift detection modules. arXiv admin note: substantial text overlap with arXiv:2501.05087

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11538 2026-07-20 econ.TH 版本更新 50%

Fixed Capital, the Cost Criterion, and the Falling Rate of Profit

固定资本下的利润下降率

Jiyuan Lyu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过多部门投入产出模型引入固定资本,重新评估奥基希奥定理,发现存在临界工资弹性,技术进步导致利润率下降,扩展了定理的适用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24049 2026-07-20 physics.plasm-ph 版本更新 50%

Stellarator island divertor shape optimization for reduced peak heat fluxes

等离子体体星形装置岛回流器形状优化以降低峰值热通量

Avigdor Veksler, Aaron Bader, Heinke Frerichs, Elizabeth Paul

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种自动化算法,用于优化等离子体体星形装置的岛回流器形状,以降低峰值热通量,通过参数扫描和贝叶斯优化实现95%的计算成本减少。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12348 2026-07-20 astro-ph.EP astro-ph.SR 版本更新 50%

Excitation and Damping of Oscillation Modes in Gaseous Planets

气态行星中振荡模的激发与阻尼

Jim Fuller, Marzia Parisi, Steve Markham, A. James Friedson, J. R. Fuentes

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究气态行星振荡模的激发与阻尼机制,指出差分旋转和风暴活动对f模和p模的影响,以及不同行星的振荡特征和探测方法。

Comments Published in Planetary Science Journal

Journal ref The Planetary Science Journal, 2026, Volume 7, Issue 7, id.162, 23 pp

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15847 2026-07-20 astro-ph.HE physics.plasm-ph 版本更新 50%

Self-confinement of relativistic pair beams in magnetized interstellar plasmas: the case of pulsar X-ray filaments

磁化星际等离子体中相对论性对束的自约束:脉冲星X射线细丝的情况

Luca Orusa, Lorenzo Sironi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究脉冲星X射线细丝等现象挑战宇宙射线传输标准图景的问题,通过全动力学二维粒子模拟,发现电荷中性对束能自发产生净电流,驱动非共振流不稳定放大磁场,为电荷不对称和粒子自约束提供途径。

Comments 8 pages, 7 figures. Added a few comments, clarifications, and numerical tests, results unchanged. Matches version published by PRL

Journal ref Phys. Rev. Lett. 137, 025201 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01894 2026-07-20 cs.LG 版本更新 50%

Multi-marginal temporal Schrödinger Bridge Matching from unpaired data

基于未配对数据的多边际时间薛定谔桥匹配

Thomas Gravier, Thomas Boyer, Auguste Genovesio

机构 * IBENS, ENS Ulm, PSL(IBENS、ENS乌姆、PSL)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对从静态样本快照观察自然动态过程的问题,提出多边际时间薛定谔桥匹配(MMtSBM),通过推导迭代马尔可夫拟合算法扩展相关理论与效率,在多类实验中表现出色,确立其为恢复隐藏动态的实用方法。

Comments ICML 2026. Code available at https://github.com/tgravier/MMDSBM-pytorch . Additional experimental materials available at https://mmdsbm.notion.site

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15356 2026-07-20 cs.AI 版本更新 50%

RAD: Retrieval High-quality Demonstrations to Enhance Decision-making

RAD:检索高质量示范以增强决策

Lu Guo, Yixiang Shan, Zhengbang Zhu, Qifan Liang, Lichang Song, Ting Long, Weinan Zhang, Yi Chang

机构 * School of Artificial Intelligence, Jilin University, Changchun, China(吉林大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对离线强化学习泛化能力受限问题,提出RAD方法,通过引入检索机制,从离线数据集检索高回报可达状态作目标,利用生成模型生成子轨迹规划,经实验验证该方法在多基准测试中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16288 2026-07-20 cs.RO 版本更新 50%

On the Use of AI-Driven Immersive Digital Technologies for Designing and Operating UAVs

关于使用AI驱动的沉浸式数字技术设计和操作无人机

Yousef Emami, Mohammadhossein Homaei, Miguel Gutierrez Gaitan, Mohammad Shojafar

机构 * IEEE

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述了数字孪生和扩展现实等沉浸式数字技术在无人机中的应用,重点探讨了利用深度强化学习和生成式AI提升无人机系统性能的方法,并提出了未来研究方向。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 可控生成 1 篇

2505.17678 2026-07-20 math.OC 版本更新 50%

Optimal control of variable-exponent subdiffusion

变指数次扩散的最优控制

Yiqun Li, Mengmeng Liu, Wenlin Qiu

专题命中 可控生成 :diffusion(abstract)

AI总结 研究变指数次扩散的最优控制问题,采用卷积方法将模型转化为更易处理的形式,证明最优控制相关性质,通过离散卷积核方法得到状态方程和伴随方程格式的精度,经数值实验证实理论发现。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像修复 1 篇

2604.03984 2026-07-20 cs.CV 版本更新 57%

High-Fidelity Mural Restoration via a Unified Hybrid Mask-Aware Transformer

高保真壁画修复的统一混合掩码感知变换器

Jincheng Jiang, Qianhao Han, Chi Zhang, Zheng Zheng

机构 * Northeastern University (Toronto Campus)(东北大学(多伦多校区)) The Bishop Strachan School(主教斯特拉坎学校)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出混合掩码感知变换器HMAT,通过结合掩码感知动态过滤与Transformer瓶颈,实现壁画的高保真修复,同时通过掩码条件风格融合模块和教师强迫解码器提升修复效果。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 个性化与一致性 1 篇

2605.20807 2026-07-20 cs.CV 版本更新 83%

Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction

通过中间结构预测分解主体驱动的图像生成

Hanzhong Guo, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出了一种两阶段框架,通过先预测Canny图再基于源外观和预测结构生成最终图像,以解决主体驱动文本到图像生成中高频率身份细节如logo、图案和文本的保留问题,并通过自动管道构建了10万对文本感知数据集,实验结果表明中间结构预测能有效提升高保真主体驱动生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏