arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 109 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2608.16721 2026-08-18 cs.CV 新提交 83%

GenRouter: Unified Workflow Routing for Agentic Image Generation

GenRouter:面向智能体图像生成的统一工作流路由

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SUSTech(南方科技大学) ZODA CUHK(香港中文大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GenRouter是首个智能体图像生成的统一工作流路由框架,通过需求分析、经验匹配、帕累托过滤实现自适应路由,可大幅降低计算开销与延迟并提升视觉对齐效果。

Comments Code: this https URL (https://github.com/EnVision-Research/GenRouter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14976 2026-08-18 cs.CV 新提交 79%

Benchmarking Frontier Text-to-Image Models on Image-Description Prompts

基于图像-描述提示的前沿文本到图像模型基准测试

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmed Rashad

机构 * Perle(珀尔)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 该研究针对组合要求高的图像-描述提示,评估了四个前沿文本到图像模型的性能,发现 Gemini 3 Pro Image 表现最优,领先系统的主要问题是对象计数错误和几何伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15395 2026-08-18 cs.CV 新提交 57%

JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation

JoLT:用于上下文引导的高分辨率分块生成的联合潜在轨迹

Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

机构 * Obvious Research(奥布弗西斯研究公司) Sorbonne Université(索邦大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出JoLT方法,通过联合去噪LR与HR潜在图像生成高分辨率图像,其生成的图像细节丰富、视觉效果佳,优于竞争基线,为艺术创作提供新方向。

Comments 25 pages, 10 figures, 7 tables. Accepted at the AI4VA Workshop at ECCV 2026. Project page: this https URL (https://obvious-research.github.io/jolt/)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2608.16812 2026-08-18 cs.CV 新提交 85%

Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

通过概念缩放与密集监督释放图像编辑的潜力

Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对图像编辑框架存在的概念粒度关注不足与训练效率低的问题,构建了含1200万编辑对的ConceptEdit-12M数据集,提出密集监督训练策略,推出细粒度评估套件ConceptEdit-Bench,性能优于现有工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-18 cs.CV 新提交 83%

Qwen-Video-Edit: Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: this https URL (https://yunpeng1998.github.io/Qwen-Video-Edit-Page;) Code: this https URL (https://github.com/yunpeng1998/Qwen-Video-Edit;) Model: this https URL (https://huggingface.co/yunpeng1998/Qwen-Video-Edit)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16284 2026-08-18 cs.CV 新提交 77%

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Hao Yang, Jingling Fu, Xiaolong Fu, Zhen Chen, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Ke Zhang, Junshi Huang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 83 篇

2608.16104 2026-08-18 cs.CV 新提交 89%

Nexus: Structured Synergy for Efficient Text-to-Image Generation using Rectified Flow Model

Nexus:使用整流流模型实现高效文本到图像生成的结构化协同框架

Yizhao Wang

机构 * School of Computer Science, Henan Institute of Science and Technology(河南科技学院计算机学院)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到图像生成模型计算量大、复杂度高的问题,提出集成稀疏架构、线性复杂度与低比特量化的Nexus模型,结合MoE前馈层等技术,在保持与SDXL、SD3相当生成质量的同时提升推理效率,经COCO、LAION验证有效。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15341 2026-08-18 cs.CV 新提交 89%

TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models

TEA:用于文本到图像模型中稳健概念擦除的文本编码器对齐

Alireza Dehghanpour Farashah, Zhuan Shi, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 该研究提出轻量级文本编码器对齐框架 TEA,将概念擦除建模为文本表示空间的域对齐问题,仅微调文本编码器,在零推理开销下提升了文本到图像模型对对抗攻击的概念擦除稳健性,且模型无关,在 Stable Diffusion 系列模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16167 2026-08-18 eess.SP cs.LG 新提交 88%

RadioVIL: Anomaly-Aware Diffusion Models for Radio Map Inpainting and Zero-Shot Vehicle Localization

RadioVIL:用于无线电地图补全和零样本车辆定位的异常感知扩散模型

Ruixin Zhao, Xiucheng Wang, Qiming Zhang, Nan Cheng, Ruijin Sun, Conghao Zhou

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 针对现有方法无法保留动态实体散射特征的问题,提出RadioVIL框架,通过DDPM与DMILO算法实现无线电地图补全,在零样本车辆定位任务中获75.20%召回率及3.31米平均误差,为6G边缘ISAC提供支撑。

Comments 6 pages, 4 figures, 2 tables. Accepted to IEEE GLOBECOM 2026, Wireless Communications Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14801 2026-08-18 physics.data-an hep-ex nucl-ex 新提交 88%

Statistical validation of calorimeter inpainting with generative diffusion priors

基于生成式扩散先验的量能器修复的统计验证

Himanshu Raj, Roli Esha

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 本研究针对相对论重离子碰撞中量能器数据缺失问题,以预训练量能器扩散模型为先验,系统比较多种扩散修复算法并建立通用验证策略,实现缺失探测器信息的概率重建。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交 87%

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15727 2026-08-18 cs.LG cs.AI stat.ML 新提交 87%

FirstDiff: One-Step Diffusion-Based Anomaly Detection for Multivariate Time Series via Initial Noise Prediction

FirstDiff:基于初始噪声预测的单步扩散模型多变量时间序列异常检测

Ali Boudaghi, Alireza Nemati, Hadi Zare

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 FirstDiff是一种基于初始噪声预测的单步扩散异常检测框架,采用Diffusion Transformer作为骨干,仅需一次去噪网络评估即可在五个基准数据集上实现最优多变量时间序列异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16793 2026-08-18 cs.CV 新提交 83%

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

PixRestore:基于像素扩散Transformer的统一图像修复模型

Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun, Shuaizheng Liu, Zhengqiang Zhang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出无VAE的像素空间DiT模型PixRestore,通过流匹配与DINO特征可靠性预测实现UIR,仅50M参数且单步推理,在效率与修复性能上优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15452 2026-08-18 cs.CV 新提交 83%

Spatially-Grounded Flow Matching: Structured Source Distributions for Image Generation

空间接地流匹配:用于图像生成的结构化源分布

Arman Zarei, Mahdi M. Kalayeh

机构 * University of Maryland(马里兰大学) Netflix(网飞公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对流匹配模型源分布缺乏空间结构的问题,提出StructFlow将空间局部性编码到源分布,可提升图像生成质量与局部可控重合成性能,且能集成到大型预训练模型中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15144 2026-08-18 stat.ML cs.AI cs.LG 新提交 82%

Scale-Consistent Posterior Dynamics for Diffusion Inverse Problems

扩散逆问题的尺度一致后验动力学

Zhaoqiang Liu, Tongyao Pang, Ruibing Wang, Yang Zheng

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 该研究针对扩散逆问题,提出尺度一致后验动力学方法,通过设计SDE模型、离散化算法并完成理论证明,在FFHQ和ImageNet的超分辨率等任务中取得竞争力结果。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15288 2026-08-18 cs.AI 新提交 82%

$D^{2}R^{2}$: Discrete Diffusion with Regulation Reinforcement for Single-Cell Perturbation Prediction

$D^{2}R^{2}$:带调控强化的离散扩散模型用于单细胞扰动预测

Ninghan Fan, Qi Liu, Xunuo Zhu, Yukai Sun, Luyuan Chen, Xuheng Zhou, Yuetian Du, Ming Kong, Xiaojun Zhu, Jie Liu, Zhan Zhou, Qiang Zhu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出$D^{2}R^{2}$模型,将单细胞扰动预测转化为调控引导的基因渐进式生成,在Norman19数据集上实现5项指标最优,验证了基因生成顺序的有效性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14729 2026-08-18 cs.CV 新提交 81%

Do CNNs Internally Represent Real and Fake Images Differently? A Hidden-Layer Analysis

卷积神经网络(CNNs)是否在内部对真实图像与虚假图像的表示存在差异?隐藏层分析

Moumita Sen Sarma, Pascal Hitzler, Eugene Y. Vasserman

机构 * Kansas State University(堪萨斯州立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究通过场景识别实验证实,CNNs对真实与虚假图像的隐藏层激活存在可统计的差异,该差异无法仅用图像退化解释,为改进虚假图像检测提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16786 2026-08-18 cs.CV 新提交 79%

Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models

重新审视潜在扩散模型中无分类器引导方法

Artem Sergievskii, Artyom Turevich, Sergey Kastryulin

机构 * HSE University(高等经济大学) Yandex(Yandex公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文重新评估了八种源于无分类器引导(CFG)的无训练技术,发现无一种方法始终优于CFG,APG仅获名义最佳分数,注意力扰动方法在不同模型上表现有差异,CFG仍是低成本竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15343 2026-08-18 cs.CV 新提交 79%

Feed-Forward Hierarchical Gaussian Diffusion for Extreme CT Reconstruction

用于极端CT重建的前馈分层高斯扩散

Yuezhe Yang, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) University of Sydney(悉尼大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对极端CT重建的不适定问题,提出HiGDiff前馈分层高斯扩散框架,通过结构与细节两阶段扩散实现最先进性能,在LDCT-PD数据集上PSNR提升5.81dB、SSIM提升0.113。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16240 2026-08-18 eess.AS cs.SD 新提交 78%

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

采用物理启发式扩散模型的可变拓扑稀疏麦克风阵列的几何自适应Ambisonic编码

Xiang Zhou, Zhengqiao Zhao, Zhengding Luo, Wen Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DiffM2A几何自适应条件扩散框架,结合GASHP前端与双分支阐释扩散模型,在稀疏可变拓扑麦克风阵列的Ambisonic编码任务中,优于基线方法且在未知布局与边界模型下增益稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14677 2026-08-18 eess.SP cs.AI cs.LG 新提交 78%

Offline Ambient-Controlled Latent Diffusion: Architecture, Telemetry, and On-Device Evaluation

离线环境光控制潜在扩散:架构、遥测与设备端评估

Lech Kalinowski, Artur Morys-Magiera, Piotr Miłkowski

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究开发了一款设备端Android潜在扩散图像生成应用,以环境光传感器驱动而非文本提示,通过绑定传感器读数等实现离线审计,验证了环境光依赖的保留及设备端运行的延迟表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16229 2026-08-18 cs.RO 新提交 78%

Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration

用于协调多智能体探索的规划器条件扩散模型

Marcus Yu Siong Teo, Jeric Lew, Tanishq Duhan, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出规划器条件扩散策略PCDP,通过规划器身份作为条件输入训练多模态单智能体策略,结合局部重排序实现协调,在多智能体探索中提升性能并验证了方法有效性。

Comments Code and models are available at this https URL (https://github.com/marmotlab/PCDP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15958 2026-08-18 cs.AI cs.GT cs.LG 新提交 78%

Solvable Sokoban Without a Solver via Diffusion

无需求解器的可推箱子问题:基于扩散模型的方法

Sina Baghal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出一种仅基于瓷砖补全训练的Transformer离散扩散模型,无需求解器即可实现77.4%的推箱子谜题可解率,剩余失败案例中94.5%可通过移除单个墙壁变得可解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15924 2026-08-18 cs.RO 新提交 78%

RAPAC-DP: Response-Aligned Pending-Action Compensation for Diffusion Policies under Delayed Execution

RAPAC-DP:延迟执行场景下扩散策略的响应对齐待执行动作补偿

Tao Wang, Wei Wang, Jianhui Wang, Qi Wang, Weidi Huang, Bing Xu

机构 * Zhejiang University(浙江大学) Midea Group(美的集团)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对云端部署模仿学习策略的延迟问题,提出RAPAC-DP框架,通过编码待执行动作补偿延迟,在Kinetix和RoboMimic任务中取得良好性能,验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14649 2026-08-18 cs.LG 新提交 78%

Discrete Diffusion Language Models Are Training-Free Multi-Label Classifiers

离散扩散语言模型是无需训练的多标签分类器

Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad(印度海得拉巴国际信息技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出无需训练的多标签分类方法dLLM-SetScore,基于离散掩码扩散语言模型,在多个数据集上对比基准模型,验证了其性能优势并完成了相关理论分析。

Comments Accepted to SIAM SDM 2026, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14632 2026-08-18 cs.CL cs.AI 新提交 78%

DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models

DeMTS:将去噪轨迹作为多元时间序列用于扩散语言模型的幻觉检测

Xin Zhang, Yili Wang, Yue Tan, Xin He, Yanyu Qian, Yixin Liu, Yi Chang, Shirui Pan, Xin Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有D-LLMs幻觉检测方法压缩轨迹丢失关键信息的问题,提出DeMTS框架,将去噪轨迹作为多元时间序列,实验显示其性能优于现有方法且兼具鲁棒性、效率与迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14570 2026-08-18 cs.LG 新提交 78%

Coarse-to-Fine Multi-Resolution Diffusion Models for Trajectory Generation in Urban Systems

面向城市系统轨迹生成的粗到细多分辨率扩散模型

Wen Ye, Muyan Weng, Chuizheng Meng, Hao Niu, Yizhou Zhang, Yan Liu

机构 * University of Southern California(南加州大学) KDDI Research, Inc.(KDDI研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对城市轨迹生成的隐私与多分辨率模式问题,提出MR-Traj多分辨率扩散框架,建模粗粒度里程碑与细粒度片段,在全局分布相当的同时提升细粒度性能并降低轨迹链接风险。

Comments 12 pages, 4 figures. Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16792 2026-08-18 math.AP math.FA 新提交 78%

Maximal monotonicity and contraction semigroup for the quantum drift-diffusion (Derrida-Lebowitz-Speer-Spohn) equation

Daniel Matthes, Giuseppe Savaré, André Schlichting

专题命中 扩散模型 :diffusion(title,abstract)

Comments 64 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16703 2026-08-18 math.AP 新提交 78%

Avoidance of caldera-type dead cores in a chemotaxis system with degenerate diffusion and compactly supported initial population density

在具有退化扩散和紧支撑初始种群密度的趋化系统中避免破火山口型死核

Tobias Black

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对具有退化扩散和紧支撑初始种群密度的趋化系统,证明了演化中出现的死核必源自初始零集,给出了死核形成的关键条件。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16119 2026-08-18 math.PR math.AP 新提交 78%

Fully nonlinear parabolic equations under a fixed reference diffusion:weighted $L^2$ Hessian estimates and well-posedness

Jihao Long, Zhenhua Zhao

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏