arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70051 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2511.18900 2025-11-25 cs.GR cs.CV 81%

MatMart: Material Reconstruction of 3D Objects via Diffusion

通过扩散模型进行3D物体的材质重建

Xiuchao Wu, Pengfei Zhu, Jiangjing Lyu, Xinguo Liu, Jie Guo, Yanwen Guo, Weiwei Xu, Chengfei Lyu

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于扩散模型的3D物体材质重建框架,通过两阶段重建和视图-材质交叉注意力机制,实现高保真材质预测与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07160 2025-11-24 cs.CV cs.MM 81%

HDCompression: Hybrid-Diffusion Image Compression for Ultra-Low Bitrates

HDCompression: 混合扩散图像压缩用于超低比特率

Lei Lu, Yize Li, Yanzhi Wang, Wei Wang, Wei Jiang

机构 * Northeastern University(东北大学) Futurewei Technologies Inc.(未来科技公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 HDCompression通过结合生成性VQ建模和扩散模型,提升超低比特率下的图像压缩保真度和感知质量。

Comments Accepted by PRICAI 2025 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17957 2025-11-21 cs.CV cs.AI cs.GR cs.LG 81%

ArchComplete: Autoregressive 3D Architectural Design Generation with Hierarchical Diffusion-Based Upsampling

ArchComplete: 基于分层扩散上采样的自回归3D建筑生成

S. Rasoulzadeh, M. Bank, I. Kovacic, K. Schinegger, S. Rutzinger, M. Wimmer

机构 * TU Wien, Center for Geometry and Computational Design(维也纳技术大学,几何与计算设计中心) University of Innsbruck, Department of Design, i.sd | Structure and Design(因斯布鲁克大学,设计系,i.sd | 结构与设计)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 ArchComplete通过自回归和分层扩散上采样生成高精度3D建筑模型,实现高质量、多样性和高效性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23752 2025-11-19 cs.GR cs.CV 81%

StrokeFusion: Vector Sketch Generation via Joint Stroke-UDF Encoding and Latent Sequence Diffusion

Jin Zhou, Yi Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03457 2025-11-18 cs.GR cs.CV cs.SD eess.AS 81%

READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation

Haotian Wang, Yuzhe Weng, Jun Du, Haoran Xu, Xiaoyan Wu, Shan He, Bing Yin, Cong Liu, Jianqing Gao, Qingfeng Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project page: https://readportrait.github.io/READ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16602 2025-11-13 cs.CV cs.GR 81%

Chat2SVG: Vector Graphics Generation with Large Language Models and Image Diffusion Models

Ronghuan Wu, Wanchao Su, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Monash University(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project Page: https://chat2svg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10637 2025-11-11 cs.GR cs.CV 81%

Distilling Diversity and Control in Diffusion Models

Rohit Gandikota, David Bau

机构 * Northeastern University(东北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project Page: https://distillation.baulab.info/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04825 2025-11-06 cs.GR cs.AI cs.CV cs.LG 81%

Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off

Seungyong Lee, Jeong-gi Kwak

机构 * NXN Labs(NXN实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to SIGGRAPH Asia 2025, project page: https://nxnai.github.io/Voost/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25765 2025-11-05 cs.CV cs.GR 81%

FreeArt3D: Training-Free Articulated Object Generation using 3D Diffusion

Chuhao Chen, Isabella Liu, Xinyue Wei, Hao Su, Minghua Liu

机构 * University of California San Diego(加州大学圣地亚哥分校) Hillbot Inc.(Hillbot公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project Page: https://czzzzh.github.io/FreeArt3D Code: https://github.com/CzzzzH/FreeArt3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08271 2025-11-04 cs.GR cs.CV cs.LG 81%

SViM3D: Stable Video Material Diffusion for Single Image 3D Generation

Andreas Engelhardt, Mark Boss, Vikram Voleti, Chun-Han Yao, Hendrik P. A. Lensch, Varun Jampani

机构 * Stability AI University of Tübingen(图宾根大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted by International Conference on Computer Vision (ICCV 2025). Project page: http://svim3d.aengelhardt.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14427 2025-10-17 cs.MM cs.CV 81%

Deep Compositional Phase Diffusion for Long Motion Sequence Generation

Ho Yin Au, Jie Chen, Junkun Jiang, Jingyu Xiang

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by NeurIPS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12785 2025-10-15 cs.CV cs.AI cs.GR 81%

MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars

Felix Taubner, Ruihang Zhang, Mathieu Tuli, Sherwin Bahmani, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Vector Institute Canada(加拿大向量研究所) University of Toronto Canada(多伦多大学加拿大)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02851 2025-10-13 cs.CV cs.GR 81%

Human-VDM: Learning Single-Image 3D Human Gaussian Splatting from Video Diffusion Models

Zhibin Liu, Haoye Dong, Aviral Chharia, Hefeng Wu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 14 Pages, 8 figures, Project page: https://human-vdm.github.io/Human-VDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04712 2025-10-07 cs.CV cs.HC cs.MM 81%

ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model

Luo Cheng, Song Siyang, Yan Siyuan, Yu Zhen, Ge Zongyuan

机构 * Monash University(墨尔本大学) University of Exeter(埃克塞特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18671 2025-10-07 cs.SD cs.CV cs.GR eess.AS 81%

TCDiff++: An End-to-end Trajectory-Controllable Diffusion Model for Harmonious Music-Driven Group Choreography

Yuqin Dai, Wanlu Zhu, Ronghui Li, Xiu Li, Zhenyu Zhang, Jun Li, Jian Yang

机构 * PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China(教育部高维信息智能感知与系统重点实验室,南京理工大学计算机科学与工程学院) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Nanjing University, Suzhou, China(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09650 2025-10-06 cs.CV cs.LG cs.MM cs.RO eess.IV 81%

HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios

Kunyu Peng, Junchao Huang, Xiangsheng Huang, Di Wen, Junwei Zheng, Yufan Chen, Kailun Yang, Jiamin Wu, Chongqing Hao, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hunan University(湖南大学) Shanghai AI Lab(上海人工智能实验室) HEBUST

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to NeurIPS 2025. The dataset and code are available at https://github.com/KPeng9510/HopaDIFF

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20629 2025-10-06 cs.CV cs.AI cs.MM 81%

AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation

Jeongsoo Choi, Ji-Hoon Kim, Kim Sung-Bin, Tae-Hyun Oh, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Pohang University of Science and Technology(釜山科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23769 2025-10-02 cs.GR cs.AI cs.CV 81%

ReLumix: Extending Image Relighting to Video via Video Diffusion Models

Lezhong Wang, Shutong Jin, Ruiqi Cui, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Bigdeli

机构 * Technical University of Denmark(丹麦技术大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project page: https://lez-s.github.io/Relumix_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23718 2025-09-30 cs.GR cs.CV cs.LG 81%

Diff-3DCap: Shape Captioning with Diffusion Models

Zhenyu Shu, Jiawei Wen, Shiyang Li, Shiqing Xin, Ligang Liu

机构 * School of Computer and Data Engineering, NingboTech University(宁波科技学院计算机与数据工程学院) Ningbo Institute, Zhejiang University(浙江大学宁波院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, ShanDong University(山东大学计算机科学与技术学院) Graphics & Geometric Computing Laboratory, School of Mathematical Sciences, University of Science and Technology of China(中国科学技术大学数学科学学院图形与几何计算实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Journal ref IEEE Transactions on Visualization and Computer Graphics. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23709 2025-09-30 cs.GR cs.CV cs.LG 81%

StrucADT: Generating Structure-controlled 3D Point Clouds with Adjacency Diffusion Transformer

Zhenyu Shu, Jiajun Shen, Zhongui Chen, Xiaoguang Han, Shiqing Xin

机构 * School of Computer and Data Engineering, NingboTech University(计算机与数据工程学院,宁波科技学院) Ningbo Institute, Zhejiang University(浙江大学宁波院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) School of Informatics, Xiamen University(厦门大学信息学院) Shenzhen Research Institute of Big Data, Chinese University of Hong Kong(香港中文大学深圳大数据研究院) School of Computer Science and Technology, ShanDong University(山东大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Journal ref IEEE Transactions on Visualization and Computer Graphics. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19296 2025-09-24 cs.CV cs.GR 81%

Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation

Sherwin Bahmani, Tianchang Shen, Jiawei Ren, Jiahui Huang, Yifeng Jiang, Haithem Turki, Andrea Tagliasacchi, David B. Lindell, Zan Gojcic, Sanja Fidler, Huan Ling, Jun Gao, Xuanchi Ren

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所) Simon Fraser University(西蒙弗雷泽大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project Page: https://research.nvidia.com/labs/toronto-ai/lyra/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08272 2025-09-17 cs.CV cs.MM 81%

Palmprint De-Identification Using Diffusion Model for High-Quality and Diverse Synthesis

Licheng Yan, Bob Zhang, Andrew Beng Jin Teoh, Lu Leng, Shuyi Li, Yuqi Wang, Ziyuan Yang

机构 * PAMI Research Group, Department of Computer and Information Science, University of Macau(PAMI研究组,计算机与信息科学系,澳门大学) School of Electrical and Electronic Engineering, College of Engineering, Yonsei University(电气电子工程学院,延世大学) School of Software, Nanchang Hangkong University(软件学院,南昌航空大学) College of Computer Science, Sichuan University(计算机科学学院,四川大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04145 2025-09-09 cs.GR cs.CV 81%

Hyper Diffusion Avatars: Dynamic Human Avatar Generation using Network Weight Space Diffusion

Dongliang Cao, Guoxing Sun, Marc Habermann, Florian Bernard

机构 * University of Bonn(波恩大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project webpage: https://vcai.mpi-inf.mpg.de/projects/HDA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00177 2025-09-04 cs.CV cs.GR cs.LG 81%

LumiNet: Latent Intrinsics Meets Diffusion Models for Indoor Scene Relighting

Xiaoyan Xing, Konrad Groh, Sezer Karaoglu, Theo Gevers, Anand Bhattad

机构 * University of Amsterdam(阿姆斯特丹大学) BCAI-Bosch(BCAI-博世) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Corrects an evaluation bug in Table 1 due to a data normalization error. Thanks to the Sony PlayStation team for discovering and reporting the issue. The paper's core contributions, qualitative results, and user study are unaffected. We also include a minor update to the method to further improve result quality. Project page: https://luminet-relight.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13397 2025-08-20 cs.CV cs.AI cs.HC cs.MM 81%

DiffMesh: A Motion-aware Diffusion Framework for Human Mesh Recovery from Videos

Ce Zheng, Xianpeng Liu, Qucheng Peng, Tianfu Wu, Pu Wang, Chen Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) North Carolina State University(北卡罗来纳州立大学) Center for Research in Computer Vision, University of Central Florida(中央佛罗里达大学计算机视觉研究中心) University of North Carolina at Charlotte(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15290 2025-08-14 cs.GR cs.AI cs.CV cs.HC 81%

Human Motion Capture from Loose and Sparse Inertial Sensors with Garment-aware Diffusion Models

Andela Ilic, Jiaxi Jiang, Paul Streli, Xintong Liu, Christian Holz

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12899 2025-08-13 cs.CV cs.AI cs.MM 81%

DreamStory: Open-Domain Story Visualization by LLM-Guided Multi-Subject Consistent Diffusion

Huiguo He, Huan Yang, Zixi Tuo, Yuan Zhou, Qiuyue Wang, Yuhang Zhang, Zeyu Liu, Wenhao Huang, Hongyang Chao, Jian Yin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03256 2025-08-11 cs.GR cs.CV 81%

MoDA: Multi-modal Diffusion Architecture for Talking Head Generation

Xinyang Li, Gen Li, Zhihui Lin, Yichen Qian, GongXin Yao, Weinan Jia, Aowen Wang, Weihua Chen, Fan Wang

机构 * Xunguang Team, DAMO Academy, Alibaba Group(达摩院、阿里集团) Zhejiang University(浙江大学) Hupan Lab(虎盘实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00733 2025-08-08 cs.SD cs.CV cs.MM eess.AS 81%

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

Le Wang, Jun Wang, Chunyu Qiang, Feng Deng, Chen Zhang, Di Zhang, Kun Gai

机构 * China University of Mining and Technology(中国矿业大学) Kuaishou Technology(快手科技)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05695 2025-08-04 cs.MM cs.AI cs.CV cs.LG eess.IV 81%

Semantic-Aware Adaptive Video Streaming Using Latent Diffusion Models for Wireless Networks

Zijiang Yan, Jianhua Pei, Hongda Wu, Hina Tabassum, Ping Wang

机构 * Department of Electrical Engineering and Computer Science, York University(电气工程与计算机科学系,约克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted in IEEE Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏