arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-06 至 2026-08-06 共收录 44 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交 89%

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

专题命中 文生图 :diffusion(summary_cn,abstract);text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 83%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.04840 2026-08-06 cs.CV cs.AI 新提交 70%

Towards a satellite image manipulation and deepfake localization benchmark dataset

面向卫星图像篡改与深度伪造定位的基准数据集

Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 图像编辑 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对遥感领域缺乏合适卫星图像篡改定位基准数据集的问题,构建含60张图像的原型数据集,支持像素级定位等分析,以推动相关研究。

Comments Accepted at IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 29 篇

2608.04030 2026-08-06 cs.GR cs.AI cs.CV cs.CY cs.LG 新提交 89%

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

NuclearDiffusion:用于学习核能概念的文生成像基础模型

Mohammed I. Radaideh, Jeremy Moon, Andre Gala-Garza, Emma Son, Yug Shah, Majdi I. Radaideh

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);image synthesis(abstract)

AI总结 本研究通过微调开源扩散模型构建核能文生成像模型,发现微调效果依赖生成架构,且微调后开源模型在专业核能图像生成上优于主流商业系统,证实领域特定微调是开发可信领域生成式AI的可行路径。

Comments 29 pages, 10 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04820 2026-08-06 cs.CV 新提交 88%

When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions

当扩散模型忘记你是谁:大遮挡下人脸修复中的身份保留

Feng Ding, Shuhuai Xie, Yue Zhou, Yulan Zhang, Guopu Zhu, Mengyao Xiao

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 针对大遮挡和冲突文本引导下人脸修复的身份保留难题,提出级联扩散框架ReSem-Face,在CelebAHQ-IDI-5等数据集上验证其身份保留修复及文本编辑质量优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04394 2026-08-06 cs.CV 新提交 83%

Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection

通过重新审视基于扩散模型的跨域小样本目标检测数据生成实现无额外开销的数据增强

Zijian Zhuang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 针对跨域小样本目标检测的域差距与数据稀缺挑战,提出带定制噪声的选择性修复(SITN)方法,结合定制噪声生成与选择性修复模块合成有效数据,在6个CDFSOD和4个CDFSS数据集上达到新的最先进性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04827 2026-08-06 stat.ML cs.LG 新提交 82%

Intrinsic-Hybrid Latent Diffusion Models for Generative Modeling on Unknown Manifolds

用于未知流形生成建模的内在混合隐式扩散模型

Yizhu Wang, Mu Niu, Xiaochen Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出ILDM框架,将概率降维与未知流形几何感知扩散结合,通过混合扩散与近似去噪得分匹配方法,在三类数据集上实现生成质量提升,降低了FID和LPIPS分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04624 2026-08-06 cs.SD cs.AI 新提交 82%

Masked diffusion enables coherent beat tracking

掩码扩散实现连贯节拍跟踪

Francesco Foscarin, Filip Korzeniowski, Richard Vogl

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对节拍跟踪神经网络的无效输出问题,提出经三项改进的掩码扩散方法,减少不稳定行为并提升了节拍跟踪性能。

Comments Accepted at the 27th International Society for Music Information Retrieval Conference (ISMIR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04906 2026-08-06 cs.CV 新提交 79%

Enhancing Low Back Pain Assessment with Diffusion Models for Lumbar Spine MRI Segmentation

利用扩散模型增强下腰痛评估的腰椎MRI分割

Maria Monzon, Thomas Iff, Ender Konukoglu, Catherine R. Jutzeler

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出SpineSegDiff扩散框架,基于SPIDER数据集实现腰椎MRI的语义分割,性能接近nnUnet,可提升退化椎间盘识别,不确定性图助力临床审查,有望增强下腰痛的诊断与管理。

Comments Maria Monzon and Thomas Iff contributed equally to this work. Published in Proceedings of The 8th International Conference on Medical Imaging with Deep Learning (MIDL 2025), PMLR volume 301, pages 1145-1163, 2026

Journal ref Proceedings of Machine Learning Research 301:1145-1163, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04887 2026-08-06 cs.CV 新提交 79%

STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models

STEP-OPD:重新思考扩散模型在线策略蒸馏中的输出目标与内部动态

Qingyan Wei, Guangzhao Li, Xiaobing Tu, Yinggui Wang, Xiantao Zhang, Jinkui Ren, Xiaohong Liu, Linfeng Zhang

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 该研究针对扩散模型在线策略蒸馏提出STEP-OPD框架,通过扩展学习目标、对齐表示变化,提升了生成模型性能,在多项任务中优于标准OPD方法及对应单任务教师模型。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04701 2026-08-06 cs.CV 新提交 79%

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View:基于视频扩散模型的大基线视图合成

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

机构 * Peking University(北京大学) Rabbitpre AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。

Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04655 2026-08-06 cs.CV cs.AI 新提交 79%

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04623 2026-08-06 cs.CV 新提交 79%

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

扩散模型中的视觉锚定:多模态零样本骨骼动作识别

Zehao Bao, Shujun Guo, Bruce X. B. Yu

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05084 2026-08-06 cs.LG cs.RO 新提交 78%

Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

学习何时停止:用于连续控制的前缀最优动态扩散策略

Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散策略连续控制的计算瓶颈,提出POGP框架,通过学习前缀值函数实现自适应去噪停止,减少约2.7倍迭代次数,同时提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04510 2026-08-06 cs.RO cs.AI 新提交 78%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04970 2026-08-06 math.AP 新提交 78%

Recovery of time-dependent coefficients for the convection-diffusion equation on conformally transversally anisotropic manifolds from partial data

从共形横截各向异性流形上的部分数据恢复对流扩散方程的时变系数

Boya Liu, Anamika Purohit

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对共形横截各向异性流形上的对流扩散方程反问题,利用部分输入-输出算子,在1-形式与函数的衰减测地射线变换单射的条件下,唯一确定时变对流项和密度系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04644 2026-08-06 math.PR 新提交 78%

Khinchin's and Chung's Laws of the Iterated Logarithm at Time Zero for the Linear Stochastic Fractional Diffusion Equation

线性随机分数阶扩散方程在时间零点的辛钦与钟氏重对数律

Chang Liu, Ran Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对带零初值的线性随机分数阶扩散方程,建立了时间零点的辛钦型重对数律,在特定附加条件下证明了钟氏型重对数律,将随机热方程的初始时间重对数律推广至一类时间分数阶随机扩散方程。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04614 2026-08-06 math.AP 新提交 78%

Stochastic Keller Segel System with Porous Medium Diffusion and Nonlinear Chemotactic Sensitivity

带有多孔介质扩散和非线性趋化敏感性的随机Keller-Segel系统

Yiming Jiang, Haohang Li, Yawei Wei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究带多孔介质扩散和非线性趋化敏感性的随机Keller-Segel系统,对a≥1且m≥2a+1的情况建立鞅解全局存在性等,揭示非线性趋化聚集与扩散的平衡,用多种方法克服相关困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04728 2026-08-06 physics.flu-dyn 新提交 78%

A hybrid proper orthogonal decomposition and diffusion framework for reduced-order forecasting of turbulent flow dynamics

一种用于湍流动力学降阶预测的本征正交分解与扩散混合框架

Rodrigo Abadia-Heredia, Xiangrui Zou, Manuel Lopez-Martin, Petros Koumoutsakos, Soledad Le Clainche

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出结合本征正交分解(POD)与有效动力学生成学习(G-LED)的混合框架,实现高效湍流预测,对比三种配置验证其降阶后大幅降低计算成本且保留关键流动结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04902 2026-08-06 cs.CV cs.LG cs.SD 新提交 57%

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

视觉表示很重要:利用视频到音频生成中的时间差异

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04818 2026-08-06 cs.CV 新提交 57%

Rethinking Pixel Mean Flows via Interval Denoiser

通过区间去噪器重新思考像素均值流

Alexander Zaytsev, Dmitry Baranchuk, Alexander Korotin, Aibek Alanov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散与流模型的计算及重建瓶颈,提出Interval Denoiser框架,经训练在ImageNet 256x256上实现少步生成的低FID值,提升了少步生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04557 2026-08-06 cs.CV 新提交 57%

VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis

VoxStruct3D:用于体素空间3D MRI合成的结构引导流匹配方法

Fang Li, Yang Gao, Shihao Zou, Weixin Si, Hongyu Wu, Qing Xia, Shuai Li, Aimin Hao

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VoxStruct3D,一种体素空间流匹配框架,通过结构优先策略引导,在T1加权脑MRI合成任务上实现了特征分布对齐、样本多样性等指标的最优性能,生成的体积解剖连贯且视觉真实。

Comments Project page: https://neesky.github.io/VoxStruct3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04864 2026-08-06 eess.SP cs.LG 新提交 50%

The Neural Echo: A Signal Processing Perspective for Understanding Neural Networks

神经回声:理解神经网络的信号处理视角

Chongbiao Wang, Daniel Gaa, Joachim Weickert, Karl Schrader

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出神经回声工具,将经典信号处理的脉冲响应等概念推广到神经网络,可解释各类网络行为,以DnCNN为例验证其能复现经典去噪器关键概念,搭建信号处理与可解释AI的桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04847 2026-08-06 cs.CL 新提交 50%

Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content

语言模型了解其俚语吗?用户生成内容中的酷儿俚语理解

Arianna Denitto, Beatrice Savoldi

机构 * University of Torino(都灵大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对酷儿俚语在自然语言处理研究中未受充分关注的问题,构建含118个酷儿术语的Slang-Q数据集,对语言模型理解酷儿俚语的能力开展首次探索性评估,为研究模型处理敏感社区语言的能力提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04428 2026-08-06 cs.AR cs.LG 新提交 50%

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Deltoris:通过比特级稀疏性和推测性推理实现具身AI中的实时VLA推理

Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

专题命中 扩散模型 :diffusion(abstract)

AI总结 Deltoris作为算法-硬件协同设计框架,通过时间感知比特级稀疏性、推测性推理及定制加速器,实现具身AI中实时VLA推理,加速比显著且精度相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04327 2026-08-06 cs.LG 新提交 50%

Real-time probabilistic tsunami forecasting via generative AI

基于生成式AI的实时概率海啸预报

Yusuke Oishi, Takashi Furumura, Fumihiko Imamura

机构 * Fujitsu Research, Fujitsu Limited(富士通研究所,富士通株式会社) Earthquake Research Institute, The University of Tokyo(东京大学地震研究所) International Research Institute of Disaster Science, Tohoku University(东北大学国际灾害科学研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究开发基于条件扩散模型的概率集成模型,利用2011年东北地方太平洋近海地震数据验证,实现实时概率海啸预报,将海啸预报从确定性转向概率性,为下一代预警奠定基础。

Comments 24 pages, 14 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04594 2026-08-06 math.DS math.AP q-bio.PE 新提交 50%

Traveling fronts in a spatial epidemic model with slow loss of immunity

具有缓慢免疫丧失的空间流行病模型中的行波前

Rossella Della Marca, Gabriele Grifò, Annalisa Iuorio, Mattia Sensi

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究分析具有缓慢免疫丧失的空间SIRS流行病模型,利用几何奇异摄动理论揭示其行波前的快慢结构,经数值模拟验证理论,明确行波前由多段连接构成。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04386 2026-08-06 math.OC 新提交 50%

An $α$-Potential Game Approach to $N$-Player Stochastic Linear-Quadratic Differential Games

基于α-势博弈的N人随机线性二次微分博弈方法

Chenhui Hao, Jingtao Shi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于α-势博弈的N人随机LQ微分博弈框架,推导了成本函数导数的等价表示,得到α-Nash均衡,并验证其与现有网络LQ博弈方法的一致性。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04177 2026-08-06 math.AP 新提交 50%

Traveling-Wave Solutions for an Einstein-Type Material-Balance Model of the Chemotactic Transport

趋化性输运的爱因斯坦型物质平衡模型的行波解

Isanka Garli Hevage, Akif Ibragimov

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对趋化性输运的爱因斯坦型物质平衡模型,分析行波解,证明输运主导区相干行波带的存在性,推导扰动界并将系统约化为三阶常微分方程,适用于油气藏形成等问题。

Comments 29 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04953 2026-08-06 quant-ph math-ph math.MP 新提交 50%

Diffusive Speed Limits for U(1)-Covariant Quantum Error Correction

U(1)协变量子纠错的扩散速度极限

Jianqi Sheng

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对带标记擦除的一维协变编码器,结合互补信道几何等方法,得出Charge-Haar码的擦除律与相变结论,证明局域保数砖电路的编码时间下界,确定扩散是对称约束量子编码的操作极限。

详情

展开后加载摘要…

URL PDF HTML 收藏