arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70051 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2606.14732 2026-06-16 cs.CV cs.AI cs.LG cs.MM 新提交 81%

Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion

Steady-Forcing: 长时程自然视频扩散中空间持久性与运动连续性的平衡

Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong, Unsang Park

机构 * Department of Computer Science and Engineering, Sogang University(西江大学计算机科学与工程系) Department of Artificial Intelligence, Sogang University(西江大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Steady-Forcing框架,通过视觉锚点、运动记忆和蒸馏等技术,在长时程固定相机自然视频生成中平衡背景稳定与运动连续性,优于现有方法。

Comments Project page: https://minar09.github.io/steadyforcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13655 2026-06-16 cs.CV cs.GR 新提交 81%

Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction

Flex4DHuman:面向4D人体重建的灵活多视角视频扩散模型

Jen-Hao Cheng, Yipeng Wang, Hao Zhang, Gengshan Yang, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学) World Labs

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出Flex4DHuman,一种基于相对相机位姿条件化的多视角视频扩散模型,无需显式几何先验即可将单目或稀疏多视角视频转换为密集多视角视频,并用于4D高斯溅射重建。

Comments Project Page: https://andy-cheng.github.io/Flex4DHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13366 2026-06-12 cs.CV cs.MM 新提交 81%

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization

双约束扩散图像压缩用于操作率失真感知优化

Sanxin Jiang, Jiro Katto, Heming Sun

机构 * Shanghai University of Electric Power(上海电力大学) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出DCIC框架,结合学习编解码器和基于扩散的解码器,通过联合失真和等幂约束实现率失真感知帕累托前沿的连续导航,无需额外码率开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10183 2026-06-10 cs.CV cs.AI cs.MM 新提交 81%

Making Time Editable in Video Diffusion Transformers

在视频扩散Transformer中实现时间可编辑性

Konstantin Kuklev, Viacheslav Vasilev, Alexander Kunitsyn, Andrei Ivaniuta, Denis Dimitrov

机构 * Kandinsky Lab(坎迪斯基实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06497 2026-06-09 cs.GR cs.CV cs.HC 版本更新 81%

Real-Time AttentionBender: Granular Interactive Network Bending of Video Diffusion Transformers

实时注意力弯曲:视频扩散变换器的粒度交互式网络弯曲

Adam Cole, Rebecca Fiebrink, Mick Grierson

机构 * Creative Computing Institute(创意计算研究所) University of the Arts London(伦敦艺术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出实时注意力弯曲工具,通过操纵视频扩散变换器的自注意力、交叉注意力及前馈网络,实现逐层、逐步、逐令牌的交互式生成控制,增强艺术家的创作代理与模型材料亲密性。

Comments 5 pages, 4 figures. Accepted to ACM Creativity & Cognition XAIxArts Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06066 2026-06-05 cs.CV cs.GR 81%

FontFusion: Enhancing Generative Text in Diffusion Models with Typographic Conditioning

FontFusion: 通过排版条件增强扩散模型中的生成文本

Marian Lupascu, Nipun Jindal, Ionut Mironica, Zhaowen Wang

机构 * Adobe Research(Adobe研究院) Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出FontFusion框架,通过层次化token表示、位置感知嵌入和多级token丢弃策略,在扩散Transformer中实现精确字体控制与文本可读性的平衡,显著提升排版保真度。

Comments 12 pages, 8 figures, accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05328 2026-06-05 cs.GR cs.AI cs.CV cs.LG 81%

The Invisible Hand of Physics: When Video Diffusion Models Know More Than They Show

物理的隐形之手:当视频扩散模型知道的比它们展示的更多

Parsa Esmati, Somjit Nath, Katja Hofmann, Derek Nowrouzezahrai, Samira Ebrahimi Kahou, Majid Mirmehdi

机构 * University of Bristol(布里斯托大学) McGill University(麦吉尔大学) Mila–Quebec AI Institute(魁北克AI研究院) Microsoft Research(微软研究院) University of Calgary(卡尔加里大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 通过逆向扩散过程探测视频扩散模型的潜在轨迹,发现物理合理性可以从扩散变换器状态中线性解码,准确率达81.27%,表明物理有意义的表示是生成式去噪的副产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01615 2026-06-02 cs.CV cs.MM 81%

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。

Comments Published in ACM MM 2025. Address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28394 2026-05-28 cs.CV cs.GR 81%

Sketch2Motion: Text-driven 2D Sketch to 3D Animation via Diffusion-guided Skeleton Optimization

Sketch2Motion: 文本驱动的二维草图到三维动画的扩散引导骨架优化

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, IIIT Delhi(IIIT德里图形研究组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出Sketch2Motion框架,结合扩散模型和骨架优化,将二维草图转化为三维动画,无需配对运动数据,支持多种角色类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04144 2026-05-28 cs.CV cs.GR 81%

Chirpy3D: Part-Aware Multi-View Diffusion for Creative Fine-Grained Object Generation

Chirpy3D: 面向创意细粒度物体生成的部件感知多视角扩散

Kam Woh Ng, Jing Yang, Jia Wei Sii, Chee Seng Chan, Jiankang Deng, Yi-Zhe Song, Tao Xiang, Xiatian Zhu

机构 * University of Surrey(萨里大学) University of Cambridge(剑桥大学) Universiti Malaya(马来亚大学) Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出Chirpy3D,一种部件感知多视角扩散框架,从无姿态2D图像中学习层次化部件潜在空间,实现部件级交换、插值和零样本组合,无需3D数据或手动标注。

Comments 20 pages. Code at https://github.com/kamwoh/chirpy3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26266 2026-05-27 cs.LG cs.AI cs.CV cs.GR eess.IV 81%

Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion

量化键窃取注意力:视频扩散中KV缓存压缩的偏差校正

Tuna Tuncer, Felix Becker, Thomas Pfeil

机构 * Technical University of Munich(慕尼黑技术大学) Tensordyne

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 针对视频扩散模型中KV缓存量化导致注意力权重系统性偏差的问题,提出基于Jensen偏差的在线逐注意力分数校正方法,在INT2量化下恢复接近BF16的视频质量,且内存减半。

Comments Variants of this manuscript were accepted to the ICML 2026 workshops SCALE and F2S

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24566 2026-05-26 cs.CV cs.GR cs.LG 81%

EMA: Effort Metric Attention for Anatomical Effort-Guided Human Motion Diffusion

EMA: 面向解剖学努力引导的人体运动扩散的努力度量注意力

Joshua Siy, Huakun Liu, Yutaro Hirao, Monica Perusquia-Hernandez, Hideaki Uchiyama, Kiyoshi Kiyokawa

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出基于努力度量注意力(EMA)的强度控制框架,通过数值努力信号调节运动扩散模型,实现细粒度、区域化的运动强度控制,并验证了与LMA描述符的单调对齐。

Comments Accepted at IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22344 2026-05-22 cs.CV cs.AI cs.MM 81%

Bernini: Latent Semantic Planning for Video Diffusion

Bernini: 视频扩散中的潜在语义规划

Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

机构 * Bernini Team(伯尼尼团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。

Comments Project Page: https://bernini-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20308 2026-05-20 cs.CV cs.GR 81%

Taming Real-World Space-Time Video Super-Resolution with One-Step Diffusion

通过一步扩散模型平滑现实世界的时空视频超分辨率

Shuoyan Wei, Feng Li, Chen Zhou, Runmin Cong, Yao Zhao, Huihui Bai

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Cooperation Joint Laboratory of MOE, Beijing(教育部视觉智能+X国际合作联合实验室) Innovation School of Artificial Intelligence, Hefei University of Technology(合肥工业大学人工智能创新学院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出OSDEnhancer框架,通过一步扩散模型实现鲁棒的时空视频超分辨率,解决了现实世界中复杂未知退化的问题,通过线性初始化和分治策略提升时空动态和纹理恢复性能。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17102 2026-05-19 cs.GR cs.CV 81%

VoxScene: Anchor-Conditioned Voxel Diffusion for Indoor Scene Arrangement

VoxScene: 基于锚点的体素扩散用于室内场景布置

Haotian Mao, Yuhan Huang, Jiatao Lin, Yang Zhao, Hui Wang, Yiheng Zhang, Yuwang Wang, Chenliang Zhou, Yan Zhang, Fangcheng Zhong, Xubo Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Cambridge(剑桥大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出VoxScene,一种基于锚点的体素扩散框架,用于3D场景合成。通过引入显式的、以物体为中心的体素表示,解决了现有方法在处理密集环境时的物理碰撞和结构纠缠问题,实现了高保真体素网格的生成,提升了场景布置的物理合理性和形状多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15816 2026-05-18 cs.GR cs.CV cs.LG 81%

StippleDiffusion: Capacity-Constrained Stippling using Controlled Diffusion

StippleDiffusion:基于受控扩散的容量受限点绘制

Ofir Gilad, Aleksander Plocharski, Przemyslaw Musialski, Andrei Sharf

机构 * Ben Gurion University of the Negev(贝勒贡大学内盖夫分校) Warsaw University of Technology(华沙技术大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种基于扩散模型的点绘制方法,通过学习局部点分布先验和连续容量约束,实现高效且可微的点集生成,适用于任意目标密度。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15681 2026-05-18 cs.GR cs.CV 81%

DealMaTe: Multi-Dimensional Material Transfer via Diffusion Transformer

DealMaTe: 通过扩散变换器实现多维材料传输

Nisha Huang, Yizhou Lin, Jie Guo, Xiu Li, Tong-Yee Lee, Zitong Yu

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) National Cheng-Kung University(国立成功大学) Great Bay University(大湾大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 DealMaTe通过深度、规范和光照图像实现材料传输,采用简化扩散框架,消除文本引导和参考网络,设计轻量3D信息注入方法,优化注意力机制,实现高效高质量的材料传输。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13857 2026-05-15 cs.GR cs.CV cs.LG 81%

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo:释放视频扩散在动物毛发和肌肉模拟中的潜力

Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

机构 * tabular c 1 Tsinghua University 2 University of Glasgow 3 The Chinese University of Hong Kong 4 HUIJING Digital Media \& Entertainment Group 2mm Project Page: tabular

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 MoZoo通过引入Role-Aware RoPE和Asymmetric Decoupled Attention,实现高保真动物视频生成,同时构建了MoZoo-Data和MoZooBench进行评估,提升了毛发和肌肉动态模拟的效率与质量。

Comments Github Page:https://dongxialiu15.github.io/MoZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12778 2026-05-14 cs.GR cs.CV 81%

Generative Motion In-betweening by Diffusion over Continuous Implicit Representations

通过扩散在连续隐式表示上生成运动中间帧

Shiyu Fan, Paul Henderson, Edmond S. L. Ho

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出基于运动隐式神经表示的扩散模型新管道和采样优化策略,通过映射隐式神经表示与稀疏时空信息,实现从稀疏模糊关键帧数据中采样并生成流畅运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11115 2026-05-13 cs.CV cs.GR cs.LG 81%

LatentHDR: Decoupling Exposure from Diffusion via Conditional Latent-to-Latent Mapping for Text/Image-to-Panoramic HDR

LatentHDR: 通过条件潜变量到潜变量映射解耦曝光以生成文本/图像到全景HDR

Pedram Fekri, WenChen Li, William Chen, Peter Altamirano

机构 * Monks AI Research Lab(Monks AI研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出LatentHDR框架,通过在潜在空间中解耦场景生成与曝光建模,实现高效且结构一致的HDR生成,实验表明其在动态范围和感知质量上优于现有方法,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22143 2026-05-12 cs.GR cs.CV 81%

JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion

JUST-DUB-IT: 通过联合音频-视觉扩散进行视频配音

Anthony Chen, Naomi Ken Korem, Gal Zeevi, Tavi Halperin, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出JUST-DUB-IT方法,利用轻量LoRA调整基础音频-视频扩散模型,实现视频到视频的高质量配音,提升视觉保真度和唇同步性能。

Comments Project webpage available at https://justdubit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27361 2026-05-01 cs.CV cs.GR 81%

CasLayout: Cascaded 3D Layout Diffusion for Indoor Scene Synthesis with Implicit Relation Modeling

CasLayout:基于级联3D布局扩散的室内场景合成与隐式关系建模

Yingrui Wu, Youkang Kong, Mingyang Zhao, Weize Quan, Dong-Ming Yan, Yang Liu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院,人工智能学院,中国科学院大学) Tsinghua University(清华大学) SKLMS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(系统科学研究所,中国科学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 CasLayout通过级联扩散框架将场景生成分解为四个阶段,结合物理与语义约束,提升生成效率与可控性,实现高质量室内场景合成。

Comments SIGGARPH 2026 (Journal Track), Code: https://github.com/YingruiWoo/CasLayout

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13729 2026-04-30 cs.LG cs.AI cs.CV cs.GR 81%

ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models

ComboStoc: 差分生成模型中的组合随机性

Rui Xu, Jiepeng Wang, Hao Pan, Yang Liu, Xin Tong, Shiqing Xin, Changhe Tu, Taku Komura, Wenping Wang

机构 * The University of Hong Kong Work partially done at MSRA. † Corresponding authors. China The University of Hong Kong China Tsinghua University China Microsoft Research Asia China Shandong University China Texas A\&M University USA The University of Hong Kong Tsinghua University Microsoft Research Asia Shandong University Texas A\&M University

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文研究了差分生成模型中未被充分探索但重要的组合复杂性问题,提出 ComboStoc 方法通过构建随机过程充分利用组合结构,提升训练效率并实现测试时生成的灵活控制。

Comments ACM Transactions on Graphics, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20936 2026-04-24 cs.MM cs.CV cs.HC 81%

AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe

AttentionBender: 在视频扩散变换器中操纵交叉注意力作为创造性探测工具

Adam Cole, Mick Grierson

机构 * University of the Arts London(伦敦艺术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 AttentionBender通过操纵视频扩散变换器中的交叉注意力,帮助艺术家探索黑箱视频生成的内部机制,揭示交叉注意力的高度交织特性,并产生新的美学效果。

Comments To appear in the Proceedings of the 2026 ACM Creativity and Cognition (C&C '26). 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04395 2026-04-24 cs.CV cs.MM 81%

BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion

BiTDiff:通过BiMamba-Transformer扩散实现细粒度3D导体运动生成

Tianzhi Jia, Kaixing Yang, Xiaole Yang, Xulong Tang, Ke Qiu, Shikui Wei, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Renmin University of China(中国人民大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出BiTDiff框架,结合BiMamba-Transformer模型和扩散策略,解决3D导体运动生成中的数据和方法限制,构建了首个大规模CM-Data数据集,并实现高质量运动合成与训练自由的联合级运动编辑。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12292 2026-04-15 cs.SD cs.CV cs.MM 81%

CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing

CoSyncDiT:认知同步扩散变换器用于电影配音

Gaoxiang Cong, Liang Li, Jiaxin Ye, Zhedong Zhang, Hongming Shan, Yuankai Qi, Qingming Huang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Fudan University, Shanghai, China(复旦大学) Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学) Macquarie University, Sydney, Australia(麦考瑞大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于认知同步扩散变换器的电影配音框架,通过声学风格适应、细粒度视觉校准和时间感知上下文对齐,解决传统方法在唇同步和自然度上的不足,实验表明其在多个指标上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10437 2026-04-10 cs.CV cs.GR cs.LG 81%

SVGFusion: A VAE-Diffusion Transformer for Vector Graphic Generation

SVGFusion:一种用于矢量图形生成的VAE-扩散变换器

Ximing Xing, Juncheng Hu, Ziteng Xue, Jing Zhang, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) Bambu AI The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出SVGFusion框架,结合VAE-扩散架构生成高质量可编辑SVG,通过融合矢量与像素信息提升结构理解与生成质量。

Comments project page: https://ximinng.github.io/SVGFusionProject/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02721 2026-04-09 cs.CV cs.MM 81%

Robust Mesh Saliency Ground Truth Acquisition in VR via View Cone Sampling and Manifold Diffusion

通过视锥采样和流形扩散在VR中实现鲁棒的网格显著性真实值获取

Guoquan Zheng, Jie Hao, Huiyu Duan, Long Tang, Shuo Yang, Yucheng Zhu, Yongming Han, Liang Yuan, Patrick Le Callet, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Chemical Technology(北京化工大学) Nantes University(南特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种鲁棒框架,通过视锥采样和混合流形-欧几里得约束扩散算法,解决VR中3D网格显著性真实值获取的鲁棒性问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03323 2026-04-08 cs.GR cs.CV cs.HC cs.LG cs.SD 81%

Listen to Rhythm, Choose Movements: Autoregressive Multimodal Dance Generation via Diffusion and Mamba with Decoupled Dance Dataset

聆听节奏,选择动作:通过扩散与Mamba实现多模态舞蹈生成的自回归方法

Oran Duan, Yinghua Shen, Yingzhu Lv, Luyang Jie, Yaxin Liu, Qiong Wu

机构 * Communication University of China(中国传媒大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出LRCM框架,通过解耦舞蹈数据集实现多模态指导的扩散模型,结合Mamba模块实现流畅的长序列自回归生成,展示了在多模态输入和长序列生成中的潜力。

Comments 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03653 2026-04-07 cs.CV cs.IR cs.MM 81%

Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

想象之前聚焦:扩散引导的寄存器增强部分相关视频检索

Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出DreamPRVR,通过粗到细的表示学习范式,利用扩散模型生成全局语义寄存器,提升部分相关视频检索的准确性与鲁棒性。

Comments Accepted to CVPR 2026. 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏