arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 182 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2603.27959 2026-08-18 cs.CV 版本更新 86%

MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation

MathGen:通过文本到图像生成揭示数学能力的幻觉

Ruiyao Liu, Hui Shen, Ping Zhang, Yunta Hsieh, Yifan Zhang, Jing Xu, Qi Han, Junchen Li, Jiawei Lu, Jianing Ma, Jiaqi Mo, Sicheng Chen, Zhen Zhang, Zhongwei Wan, Jing Xiong, Xin Wang, Ziyuan Liu, Hangrui Cao, Ngai Wong

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) USTC(中国科学技术大学) City University of Hong Kong(香港城市大学) University of Wisconsin(威斯康星大学) UCSB(加州大学圣塔芭芭拉分校) University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 MathGen通过900道跨七个核心领域的数学问题,评估生成模型在视觉化数学解答中的准确性,发现现有模型在数学 fidelity 上存在显著瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16721 2026-08-18 cs.CV 新提交 83%

GenRouter: Unified Workflow Routing for Agentic Image Generation

GenRouter:面向智能体图像生成的统一工作流路由

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SUSTech(南方科技大学) ZODA CUHK(香港中文大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GenRouter是首个智能体图像生成的统一工作流路由框架,通过需求分析、经验匹配、帕累托过滤实现自适应路由,可大幅降低计算开销与延迟并提升视觉对齐效果。

Comments Code: https://github.com/EnVision-Research/GenRouter

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14976 2026-08-18 cs.CV 新提交 79%

Benchmarking Frontier Text-to-Image Models on Image-Description Prompts

基于图像-描述提示的前沿文本到图像模型基准测试

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmed Rashad

机构 * Perle(珀尔)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 该研究针对组合要求高的图像-描述提示,评估了四个前沿文本到图像模型的性能,发现 Gemini 3 Pro Image 表现最优,领先系统的主要问题是对象计数错误和几何伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15395 2026-08-18 cs.CV 新提交 57%

JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation

JoLT:用于上下文引导的高分辨率分块生成的联合潜在轨迹

Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

机构 * Obvious Research(奥布弗西斯研究公司) Sorbonne Université(索邦大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出JoLT方法,通过联合去噪LR与HR潜在图像生成高分辨率图像,其生成的图像细节丰富、视觉效果佳,优于竞争基线,为艺术创作提供新方向。

Comments 25 pages, 10 figures, 7 tables. Accepted at the AI4VA Workshop at ECCV 2026. Project page: https://obvious-research.github.io/jolt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00410 2026-08-18 cs.AI cs.CL cs.CV 版本更新 57%

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

歧义去了哪里?探究多模态模型如何解释多义词

Jasin Cekinmez, Addison J. Wu, Raja Marjieh, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究对比17个文本到图像模型和15个文本生成模型,发现多模态模型生成图像的词义多样性低于文本,揭示了基础模型在不同模态间意义表达的迁移 gap。

Comments Oral Presentation, Sci-FM Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 6 篇

2608.16812 2026-08-18 cs.CV 新提交 85%

Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

通过概念缩放与密集监督释放图像编辑的潜力

Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对图像编辑框架存在的概念粒度关注不足与训练效率低的问题,构建了含1200万编辑对的ConceptEdit-12M数据集,提出密集监督训练策略,推出细粒度评估套件ConceptEdit-Bench,性能优于现有工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-18 cs.CV 新提交 83%

Qwen-Video-Edit: Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: https://yunpeng1998.github.io/Qwen-Video-Edit-Page; Code: https://github.com/yunpeng1998/Qwen-Video-Edit; Model: https://huggingface.co/yunpeng1998/Qwen-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20839 2026-08-18 cs.CV 版本更新 83%

Training-Free Multi-Concept Image Editing

无需训练的多概念图像编辑

Niki Foteinopoulou, Ignas Budvytis, Stephan Liwicki

机构 * Cambridge Research Laboratory, Toshiba Europe(东芝欧洲剑桥研究实验室)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的多概念图像编辑方法,通过概念蒸馏采样实现多视觉概念的无缝组合与控制,提升图像编辑的精度与细节表现。

Comments Accepted in ECCV'26 (17 pages, 13 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 79%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16284 2026-08-18 cs.CV 新提交 77%

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Hao Yang, Jingling Fu, Xiaolong Fu, Zhen Chen, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Ke Zhang, Junshi Huang

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01334 2026-08-18 cs.CV 57%

Zero-shot Segmentation of Skin Conditions: Erythema with Edit-Friendly Inversion

Konstantinos Moutselos, Ilias Maglogiannis

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

Journal ref Proc. International Conference on Medical Imaging and Computer-Aided Diagnosis (MICAD), 2025, pp. 115_125

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 133 篇

2608.16104 2026-08-18 cs.CV 新提交 89%

Nexus: Structured Synergy for Efficient Text-to-Image Generation using Rectified Flow Model

Nexus:使用整流流模型实现高效文本到图像生成的结构化协同框架

Yizhao Wang

机构 * School of Computer Science, Henan Institute of Science and Technology(河南科技学院计算机学院)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到图像生成模型计算量大、复杂度高的问题,提出集成稀疏架构、线性复杂度与低比特量化的Nexus模型,结合MoE前馈层等技术,在保持与SDXL、SD3相当生成质量的同时提升推理效率,经COCO、LAION验证有效。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15341 2026-08-18 cs.CV 新提交 89%

TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models

TEA:用于文本到图像模型中稳健概念擦除的文本编码器对齐

Alireza Dehghanpour Farashah, Zhuan Shi, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 该研究提出轻量级文本编码器对齐框架 TEA,将概念擦除建模为文本表示空间的域对齐问题,仅微调文本编码器,在零推理开销下提升了文本到图像模型对对抗攻击的概念擦除稳健性,且模型无关,在 Stable Diffusion 系列模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16167 2026-08-18 eess.SP cs.LG 新提交 88%

RadioVIL: Anomaly-Aware Diffusion Models for Radio Map Inpainting and Zero-Shot Vehicle Localization

RadioVIL:用于无线电地图补全和零样本车辆定位的异常感知扩散模型

Ruixin Zhao, Xiucheng Wang, Qiming Zhang, Nan Cheng, Ruijin Sun, Conghao Zhou

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 针对现有方法无法保留动态实体散射特征的问题,提出RadioVIL框架,通过DDPM与DMILO算法实现无线电地图补全,在零样本车辆定位任务中获75.20%召回率及3.31米平均误差,为6G边缘ISAC提供支撑。

Comments 6 pages, 4 figures, 2 tables. Accepted to IEEE GLOBECOM 2026, Wireless Communications Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14801 2026-08-18 physics.data-an hep-ex nucl-ex 新提交 88%

Statistical validation of calorimeter inpainting with generative diffusion priors

基于生成式扩散先验的量能器修复的统计验证

Himanshu Raj, Roli Esha

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 本研究针对相对论重离子碰撞中量能器数据缺失问题,以预训练量能器扩散模型为先验,系统比较多种扩散修复算法并建立通用验证策略,实现缺失探测器信息的概率重建。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交 87%

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15727 2026-08-18 cs.LG cs.AI stat.ML 新提交 87%

FirstDiff: One-Step Diffusion-Based Anomaly Detection for Multivariate Time Series via Initial Noise Prediction

FirstDiff:基于初始噪声预测的单步扩散模型多变量时间序列异常检测

Ali Boudaghi, Alireza Nemati, Hadi Zare

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 FirstDiff是一种基于初始噪声预测的单步扩散异常检测框架,采用Diffusion Transformer作为骨干,仅需一次去噪网络评估即可在五个基准数据集上实现最优多变量时间序列异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16491 2026-08-18 physics.med-ph 版本更新 86%

Continuous 3-D Latent Diffusion for Medical Image Generation and Reconstruction

用于医学生成与重建的连续3D潜扩散

Youness Mellak, Antoine De Paepe, Dimitris Visvikis, Alexandre Bousse

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 研究针对高分辨率三维医学扩散模型成本问题,提出连续3D潜扩散模型框架,核心是含特定解码器的紧凑自动编码器,经实验评估,该框架在计算效率、内存使用和重建效果间达平衡,能支持多种医学影像任务。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16793 2026-08-18 cs.CV 新提交 83%

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

PixRestore:基于像素扩散Transformer的统一图像修复模型

Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun, Shuaizheng Liu, Zhengqiang Zhang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出无VAE的像素空间DiT模型PixRestore,通过流匹配与DINO特征可靠性预测实现UIR,仅50M参数且单步推理,在效率与修复性能上优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15452 2026-08-18 cs.CV 新提交 83%

Spatially-Grounded Flow Matching: Structured Source Distributions for Image Generation

空间接地流匹配:用于图像生成的结构化源分布

Arman Zarei, Mahdi M. Kalayeh

机构 * University of Maryland(马里兰大学) Netflix(网飞公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对流匹配模型源分布缺乏空间结构的问题,提出StructFlow将空间局部性编码到源分布,可提升图像生成质量与局部可控重合成性能,且能集成到大型预训练模型中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15144 2026-08-18 stat.ML cs.AI cs.LG 新提交 82%

Scale-Consistent Posterior Dynamics for Diffusion Inverse Problems

扩散逆问题的尺度一致后验动力学

Zhaoqiang Liu, Tongyao Pang, Ruibing Wang, Yang Zheng

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 该研究针对扩散逆问题,提出尺度一致后验动力学方法,通过设计SDE模型、离散化算法并完成理论证明,在FFHQ和ImageNet的超分辨率等任务中取得竞争力结果。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15288 2026-08-18 cs.AI 新提交 82%

$D^{2}R^{2}$: Discrete Diffusion with Regulation Reinforcement for Single-Cell Perturbation Prediction

$D^{2}R^{2}$:带调控强化的离散扩散模型用于单细胞扰动预测

Ninghan Fan, Qi Liu, Xunuo Zhu, Yukai Sun, Luyuan Chen, Xuheng Zhou, Yuetian Du, Ming Kong, Xiaojun Zhu, Jie Liu, Zhan Zhou, Qiang Zhu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出$D^{2}R^{2}$模型,将单细胞扰动预测转化为调控引导的基因渐进式生成,在Norman19数据集上实现5项指标最优,验证了基因生成顺序的有效性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23811 2026-08-18 cs.SD cs.CL 版本更新 82%

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

基于解耦时间深度扩散变换器的内存高效音频合成

Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。

Comments 11 pages, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26632 2026-08-18 cs.LG 版本更新 82%

RT-Lynx: Putting GEMM Sparsity in the Right Place for Diffusion Models

RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

Xing Cong, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chenhao Xie

机构 * Alibaba Group(阿里巴巴集团) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对扩散模型推理成本高的问题,提出将N:M半结构化稀疏性从权重转移到激活,结合误差补偿技术,实现线性层平均1.55倍加速且保持生成质量。

Comments 33 pages, 18 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16871 2026-08-18 cs.RO 版本更新 82%

SADP: Subgoal-Aware Diffusion Policy for Long-Horizon Manipulation Learned from Foundation Model Generated Demonstrations

SADP:基于基础模型生成示范的子目标感知扩散策略用于可解释机器人

Site Hu, Takato Horii

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(系统创新系,工学研究科,大阪大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SADP,一种基于基础模型生成示范的子目标感知扩散策略,用于可解释机器人,通过自主生成子目标标注的示范数据,训练扩散策略,使机器人能够通过子目标结构和执行进度向用户解释决策过程,从而在长周期操作中实现更高的任务成功率和故障诊断能力。

Comments Revised manuscript with an updated title, evaluation protocol, and simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14729 2026-08-18 cs.CV 新提交 81%

Do CNNs Internally Represent Real and Fake Images Differently? A Hidden-Layer Analysis

卷积神经网络(CNNs)是否在内部对真实图像与虚假图像的表示存在差异?隐藏层分析

Moumita Sen Sarma, Pascal Hitzler, Eugene Y. Vasserman

机构 * Kansas State University(堪萨斯州立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究通过场景识别实验证实,CNNs对真实与虚假图像的隐藏层激活存在可统计的差异,该差异无法仅用图像退化解释,为改进虚假图像检测提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16786 2026-08-18 cs.CV 新提交 79%

Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models

重新审视潜在扩散模型中无分类器引导方法

Artem Sergievskii, Artyom Turevich, Sergey Kastryulin

机构 * HSE University(高等经济大学) Yandex(Yandex公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文重新评估了八种源于无分类器引导(CFG)的无训练技术,发现无一种方法始终优于CFG,APG仅获名义最佳分数,注意力扰动方法在不同模型上表现有差异,CFG仍是低成本竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15343 2026-08-18 cs.CV 新提交 79%

Feed-Forward Hierarchical Gaussian Diffusion for Extreme CT Reconstruction

用于极端CT重建的前馈分层高斯扩散

Yuezhe Yang, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) University of Sydney(悉尼大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对极端CT重建的不适定问题,提出HiGDiff前馈分层高斯扩散框架,通过结构与细节两阶段扩散实现最先进性能,在LDCT-PD数据集上PSNR提升5.81dB、SSIM提升0.113。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10162 2026-08-18 cs.CV 版本更新 79%

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

MAD-HOI:用于从文本生成关节手-物体交互的掩码自回归扩散模型

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAD-HOI是一种结合掩码自回归与扩散的HOI生成模型,可生成多样且符合物理规律的手-物体交互序列,支持可变长度生成、运动补全填充等功能,在ARCTIC和GRAB数据集上优于开源基线。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18736 2026-08-18 cs.CV 版本更新 79%

Spectral Progressive Diffusion for Efficient Image and Video Generation

频域渐进扩散用于高效图像和视频生成

Howard Xiao, Brian Chao, Lior Yariv, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种频域渐进扩散框架,通过在预训练扩散模型的去噪轨迹中逐步提高分辨率,实现高效的图像和视频生成,同时改进了效率和质量。

Comments Project website at https://howardxiao.ca/speed

详情

展开后加载摘要…

URL PDF HTML 收藏