arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-04 至 2026-08-04 共收录 190 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 142 篇

2601.05713 2026-08-04 cs.CL cs.AI cs.LG 版本更新 78%

Visualising Information Flow in Word Embeddings with Diffusion Tensor Imaging

用扩散张量成像可视化词嵌入中的信息流

Thomas Fabian

机构 * Technical University Darmstadt(达姆斯塔特技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用扩散张量成像技术可视化词嵌入中的信息流,揭示LLM中自然语言表达的信息流动机制,提升NLP模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21759 2026-08-04 cs.CL cs.LG 版本更新 78%

Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models

协调双边界:一种受算术强度启发的加速框架用于扩散语言模型

Linye Wei, Wenjue Chen, Pingzhi Tang, Xiaotian Guo, Le Ye, Runsheng Wang, Meng Li

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ODB-dLLM通过协调双边界,利用算术强度差异优化扩散语言模型的推理速度,显著提升效率并减少准确性损失。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10628 2026-08-04 cs.SE 版本更新 78%

On the Diffusion of Test Smells in LLM-Generated Unit Tests

论LLM生成的单元测试中测试异味的扩散

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Xunzhu Tang, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过多基准大规模分析,对比LLM生成、人类编写及EvoSuite生成的单元测试,发现LLM生成测试存在特定测试异味,受提示策略等影响,凸显基于LLM的测试生成的潜力与风险,呼吁开发相关优化方案。

Comments Accepted at Transactions on Software Engineering and Methodology (TOSEM) journal on 31 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03011 2026-08-04 cs.RO 版本更新 78%

3D-CovDiffusion: 3D-Aware Diffusion Policy for Coverage Path Planning

3D-CovDiffusion:面向覆盖路径规划的三维感知扩散策略

Chenyuan Chen, Haoran Ding, Ran Ding, Tianyu Liu, Zewen He, Anqing Duan, Yoshihiko Nakamura

机构 * IEEE

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出 3D-CovDiffusion,将覆盖路径规划转化为条件序列生成问题,采用几何条件扩散框架从三维点云合成轨迹,相比基线方法在轨迹平滑度、覆盖率等指标上实现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08065 2026-08-04 cs.AI 78%

STGDPM:Vessel Trajectory Prediction with Spatio-Temporal Graph Diffusion Probabilistic Model

Jin Wenzhe, Tang Haina, Zhang Xudong

专题命中 扩散模型 :diffusion(title,abstract)

Comments This paper has been ACCEPTED as a FULL PAPER at DASFAA 2025

Journal ref Database Systems for Advanced Applications (DASFAA 2025), Lecture Notes in Computer Science, vol. 15987, pp. 571-586, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14554 2026-08-04 math.PR 78%

Large deviation principle for stochastic reaction-diffusion equations with super-linear drift on $\mathbb{R}$ driven by space-time white noise

Yue Li, Shijie Shang, Jianliang Zhai

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19739 2026-08-04 math.PR 78%

Transportation cost inequalities for stochastic reaction diffusion equations on the whole line $\mathbb{R}$

Yue Li, Shijie Shang, Tusheng Zhang

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08238 2026-08-04 cs.SI cs.LG cs.NI 版本更新 78%

NetDiff: Graph Diffusion with Improved Global Capabilities to Generate and Update Mobile Network Topologies

NetDiff:具备增强全局能力的图扩散模型,用于生成和更新移动网络拓扑

Félix Marcoccia, Victor Fagoo, Gilles Monzat, Cédric Adjih, Thomas Watteyne, Paul Mühlethaler

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出NetDiff模型,结合ACAM令牌与部分扩散方法,生成更新移动网络拓扑,性能超基线,实现高效全局链路决策与快速重配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10694 2026-08-04 math.PR math.AP 78%

Well-posedness and large deviations of fractional McKean-Vlasov stochastic reaction-diffusion equations on unbounded domains

Zhang Chen, Bixiang Wang

专题命中 扩散模型 :diffusion(title,abstract)

Journal ref Appl. Math. Optim. 94 (2026) 40

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02905 2026-08-04 cond-mat.mes-hall cond-mat.dis-nn 78%

Exciton Diffusion in a Quantum Dot Ensemble

Karol Kawa, Paweł Machnikowski

专题命中 扩散模型 :diffusion(title,abstract)

Journal ref Phys. Rev. B 109, 224205 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08241 2026-08-04 math.NA cs.NA math.PR 版本更新 78%

Polynomial weak approximation for stochastic reaction-diffusion equations near the sharp interface limit

Jianbo Cui, Liying Sun

专题命中 扩散模型 :diffusion(title,abstract)

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01686 2026-08-04 cs.CV 新提交 77%

Generative AI and Foundation Models in Medical Image

医学影像中的生成式AI与基础模型

Masahiro Oda

机构 * Nagoya University(名古屋大学) Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);分类 cs.CV

AI总结 本文概述生成式AI相关的扩散模型、LLMs及基础模型,介绍其在医疗辅助中的应用,探讨基础模型的构建方法与医疗应用,并研究利用国家资源开发医疗辅助AI的路径。

Comments Review Article

Journal ref Radiological Physics and Technology, vol.18, pp.937-948, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02487 2026-08-04 stat.ML cs.LG math.OC math.PR math.ST stat.TH 新提交 75%

Computational and Statistical Guarantees of the \textit{c}-Rectified flow

c-整流流的计算与统计保证

Leda Wang, Zhehao Xu, Qiang Liu, Harrison H. Zhou

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 该研究针对迭代整流流的计算与统计保证问题,提出c-整流流方法,证明其在合适假设下可收敛到最优传输耦合,并建立相关收敛保证与最优估计速率,为整流流提供理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04789 2026-08-04 cs.CV 版本更新 74%

Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention

轻量强制:通过稀疏注意力加速自回归视频扩散

Chengtao Lv, Yumeng Shi, Yushi Huang, Ruihao Gong, Shen Ren, Wenya Wang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 针对自回归视频生成模型中注意力二次复杂度问题,提出首个稀疏注意力方案Light Forcing,通过块感知增长机制和分层稀疏注意力实现质量和效率提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00050 2026-08-04 eess.SP cs.CE cs.LG 新提交 71%

Identifiability-Aware Source Apportionment in City-Scale Advection-Diffusion Systems

城市尺度平流扩散系统中考虑可识别性的源解析

Ankit Bhardwaj, Lakshminarayanan Subramanian

专题命中 扩散模型 :diffusion(title)

AI总结 该研究针对城市空气质量源解析的逆问题,提出IASA框架,结合可识别性分析,实现源活动系数估计、轨迹重建与不确定性评估,在新德里PM2.5数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02093 2026-08-04 cs.RO 新提交 71%

Dynamic UAV-based search operations using probabilistic diffusion modeling of Man Overboard incident victims

基于概率扩散模型的动态无人机落水人员搜索作业

Dimosthenis Angelis, Evangelos Boukas

专题命中 扩散模型 :diffusion(title)

AI总结 该研究针对游轮落水人员搜救难题,提出结合扩展卡尔曼滤波与漂移模型的区域预测方法,评估五种无人机搜索策略,其中改进概率引导搜索法在延迟20分钟、检测成功率30%时平均搜救成功率超80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 67%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01825 2026-08-04 cs.CV cs.AI cs.GR 新提交 62%

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

PartMat:基于单个全局隐变量的材质感知三维部件分解

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 该研究提出PartMat,一种用单个全局隐变量的材质感知三维部件分解流水线,可按材质边界分解物体,推理高效且分解准确率优于基线,几何质量相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02053 2026-08-04 eess.IV cs.CV 新提交 57%

Protocol generalisation for brain tissue microstructure estimation via hypernetwork-controlled geometric deep learning

基于超网络控制的几何深度学习的脑组织微结构估计的协议泛化

Andrea Brigliadori, Leevi Kerkela, Hui Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种融入b-值依赖的超网络控制SCNN架构,实现b-值与b-向量泛化及旋转等变性,提升了脑组织微结构估计的鲁棒性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00137 2026-08-04 eess.IV cs.CV 新提交 57%

RPL-UIE: Reliable Prior Learning for Underwater Image Enhancement

RPL-UIE:面向水下图像增强的可靠先验学习

Yifan Chen, Jiaming Liu, Ye Zheng, Zhe Sun, Tao Chen

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对水下图像增强的语义漂移问题,提出RPL-UIE两阶段教师-学生框架,结合RPRD与FPRD缩小师生模型先验学习差异,在基准测试、下游视觉任务及真实ROV数据上表现良好。

Comments 14 pages, 10 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02177 2026-08-04 cs.CV 新提交 57%

GSRAIN: Physically Calibrated High-/Low-Frequency Rainfall Synthesis for 3D Gaussian Driving Scenes

GSRAIN:面向3D高斯溅射(3DGS)驾驶场景的物理校准高低频降雨合成方法

Fanyu Wang, Longgao Zhang, Junyi Chen

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GSRAIN针对自动驾驶降雨模拟的物理可控性与多视图一致性局限,结合实测数据与几何感知扩散模型生成可控降雨场景,在FID指标上优于现有方法,可用于自动驾驶算法的雨天测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01990 2026-08-04 cs.CV cs.AI 新提交 57%

SPARE: Structural Parameter-Free Affinity Regularization for Flow Matching

SPARE:用于流匹配的无结构参数亲和力正则化

Zong-Wei Hong, Jinglun Li, Shen Zhang, Yuhan Liu, Linze Li, Yao Tang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对去噪扩散Transformer训练收敛慢的问题,提出无结构参数亲和力正则化SPARE,利用跨图像标记对的结构实现正则化,在ImageNet数据集上取得优异生成性能,内存开销极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01896 2026-08-04 cs.CV 新提交 57%

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

GeoCore-9B:面向地球观测的地理感知生成基础模型

Jeonghyeok Do, Munchurl Kim

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对现有EO生成模型的地理空间约束冲突问题,推出90亿参数的GeoCore-9B,采用Flow Matching的DiT与地理空间元数据条件生成,结合地理空间语义对齐损失,在多项EO任务上实现最优性能。

Comments Please visit our project page at https://kaist-viclab.github.io/GeoCore-9B_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01771 2026-08-04 cs.CV 新提交 57%

LiveLight: Real-time Streaming Video Relighting with Interactive Control

LiveLight:具备交互式控制的实时流视频重光照

Yue Ma, Jiangming Wang, Yucheng Wang, Xilai Wang, Zhiyuan Li, Xinyu Wang, Hongyu Liu, Ruofan Liang, Songchun Zhang, Yuxuan Xue, Qifeng Chen

机构 * HKUST(香港科技大学) University of Macau(澳门大学) THU(清华大学) UoT(多伦多大学) University of Tuebingen(蒂宾根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出首个基于扩散模型的实时流视频重光照框架LiveLight,通过三项关键设计解决三大挑战,在实时速度下达到最优重光照质量,将公开发布相关资源以推动该领域研究。

Comments Accepted by TOG 2026. Project page: https://living-lighting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01306 2026-08-04 cs.CV 新提交 57%

SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents

SPAE:用于预训练视觉隐层的频谱引导自编码器

Yibin Huang, Jixiang Hong, Zongzhao Li, Yuhan Dai, Zhibin Wang, Chunwei Wang, Jun Song, Chen Wang, Xiaofei Sun, Xiaoxiao Xu, Conghui Zhu

机构 * Alibaba Group(阿里巴巴集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 针对DiT生成隐层与编码器隐层的频谱不匹配问题,提出SPAE框架,通过紧凑瓶颈结构与通道级掩码策略实现隐层适配,在视觉理解、生成质量与重建保真度间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00079 2026-08-04 cs.CV cs.SD 新提交 57%

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

LeapTalk:打破说话头生成中的延迟-质量权衡

Rongxiang Zhang, Songhua Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27110 2026-08-04 cs.CV 版本更新 57%

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

FreqForcing:基于频谱自锚定的自回归长视频生成方法

Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对自回归长视频生成中的误差累积问题,提出无需训练的FreqForcing框架,通过频谱自锚定技术实现24倍外推,性能优于现有无训练方法且与有训练方法有竞争力。

Comments Code is available at: https://github.com/jiatongli2024/FreqForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26817 2026-08-04 cs.RO cs.CV 版本更新 57%

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching

从不确定性到确定性:无射线匹配的由粗到细视觉楼层平面图定位

Shiyong Meng, Bolei Chen, Ping Zhong, Yang Wan, Rongzhi Wang, Jiazhi Xia, Jianxin Wang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对视觉楼层平面图定位的多模态姿态分布问题,提出无射线匹配的由粗到细框架,通过图像条件姿态扩散模型与局部细化器实现定位,在S3D和ZInD基准上达到最优精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24024 2026-08-04 cs.CV 版本更新 57%

GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal

用于视差和表面法线的统一立体几何估计框架

Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

机构 * Beijing Institute of Technology(北京理工大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Beihang University(北京航空航天大学) INSAIT, Sofia University(索非亚大学INSAIT) BAAI AIR, Tsinghua University(清华大学BAAI AIR)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对立体匹配和表面法线估计问题,提出统一框架GeoStereo,结合前馈立体匹配与基于扩散的法线估计分支,引入初始化策略与扭曲条件,实现有效交互,在多场景表现可靠,零样本设置下视差和法线估计精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06216 2026-08-04 cs.CV 版本更新 57%

MoWorld: A Flash World Model

MoWorld:一种快速世界模型

Team Moxin, Deyi Ji, Tianrun Chen, Xin Zhang, Jiale Yang, Qi Zhu, An Zhao, Zihao Xie, Han Wang, Xuanyi Liu, Yixiang Zhou, Pei Liu, Yi Tan, Cheng Chen, Dayi Zhu, Mingyu Wei, Hanjie Xu, Jun Liao, Siqi Li, Lingyu Lu, Hongye Fang, Hongming Tan, Youjiang Zhu, Taiyu Zhang, Zejian Li, Chaotao Ding, Zhipeng Liang, Wenxuan Song, Yi Li, Baochuan Yang, Xin Jiang, Ben Feng, Jingyuan Zou, Yanlin Liu, Rong Shi, Lingfeng Li, Liyi Yao, Lanyun Zhu, Yunhe Pan, Lingyun Sun

机构 * Moxin Technology(魔心科技)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。

Comments Project Page: https://moxin-tech.github.io/moworld/

详情

展开后加载摘要…

URL PDF HTML 收藏