arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2502.06860 2025-08-25 cs.CV cs.GR 62%

AutoSketch: VLM-assisted Style-Aware Vector Sketch Completion

Hsiao-Yuan Chin, I-Chao Shen, Yi-Ting Chiu, Ariel Shamir, Bing-Yu Chen

机构 * National Taiwan University(国立台湾大学) The University of Tokyo(东京大学) Reichman University(里奇曼大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments 11 pages, Hsiao-Yuan Chin and I-Chao Shen contributed equally to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00360 2025-08-19 cs.CV cs.GR 62%

Shape from Semantics: 3D Shape Generation from Multi-View Semantics

Liangchen Li, Caoliwen Wang, Yuqi Zhou, Bailin Deng, Juyong Zhang

机构 * University of Science and Technology of China(科学技术大学) Cardiff University(卡地夫大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: https://shapefromsemantics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10848 2025-08-13 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 62%

3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control

Xuanmeng Sha, Liyun Zhang, Tomohiro Mashita, Naoya Chiba, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Osaka Electro-Communication University(大阪电通信大学) Osaka University(大阪大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08086 2025-08-12 cs.CV cs.GR 62%

Matrix-3D: Omnidirectional Explorable 3D World Generation

Zhongqi Yang, Wenhang Ge, Yuqi Li, Jiaqi Chen, Haoyuan Li, Mengyin An, Fei Kang, Hua Xue, Baixin Xu, Yuyang Yin, Eric Li, Yang Liu, Yikai Wang, Hao-Xiang Guo, Yahui Zhou

机构 * Skywork AI Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15557 2025-07-28 cs.GR cs.CV cs.RO 62%

Motion Synthesis with Sparse and Flexible Keyjoint Control

Inwoo Hwang, Jinseok Bae, Donggeun Lim, Young Min Kim

机构 * ECE, Seoul National University(电子工程系,首尔国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted to ICCV 2025. Project Page: http://inwoohwang.me/SFControl

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15028 2025-07-18 cs.GR cs.CV 62%

A Controllable Appearance Representation for Flexible Transfer and Editing

Santiago Jimenez-Navarro, Julia Guerrero-Viu, Belen Masia

机构 * Universidad de Zaragoza, I3A(萨拉戈萨大学,I3A)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments EGSR 2025 - Symposium Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08906 2025-07-01 cs.CV cs.AI cs.GR 62%

AirSketch: Generative Motion to Sketch

Hui Xian Grace Lim, Xuanming Cui, Yogesh S Rawat, Ser-Nam Lim

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19680 2025-06-30 cs.CV cs.AI cs.MM 62%

MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance

Yuang Zhang, Jiaxi Gu, Li-Wen Wang, Han Wang, Junqi Cheng, Yuefeng Zhu, Fangyuan Zou

机构 * Tencent(腾讯) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21552 2025-06-27 cs.CV cs.AI cs.LG cs.MM cs.RO 62%

Whole-Body Conditioned Egocentric Video Prediction

Yutong Bai, Danny Tran, Amir Bar, Yann LeCun, Trevor Darrell, Jitendra Malik

机构 * UC Berkeley (BAIR)(伯克利大学(BAIR)) FAIR, Meta(Meta 公司 FAIR 实验室) New York University(纽约大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments Project Page: https://dannytran123.github.io/PEVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01591 2025-06-03 cs.GR cs.CR cs.CV cs.SD eess.AS 62%

Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation

Yuan Gan, Jiaxu Miao, Yunze Wang, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER,中国人工智能学会,浙江大学) School of Cyber Science and Technology, Sun Yat-sen University(信息科学与技术学院,孙中山大学) Department of Statistics, University of Wisconsin–Madison(统计学系,威斯康星大学麦迪逊分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16980 2025-05-23 cs.CV cs.MM 62%

Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction

Dong Li, Wenqi Zhong, Wei Yu, Yingwei Pan, Dingwen Zhang, Ting Yao, Junwei Han, Tao Mei

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04052 2025-05-08 cs.GR cs.CV 62%

Person-In-Situ: Scene-Consistent Human Image Insertion with Occlusion-Aware Pose Control

Shun Masuda, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15023 2025-05-06 cs.SD cs.CV cs.LG cs.MM eess.AS 62%

FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment

Riccardo Fosco Gramaccioni, Christian Marinoni, Emilian Postolache, Marco Comunità, Luca Cosmo, Joshua D. Reiss, Danilo Comminiello

机构 * Sapienza University of Rome, Italy(罗马萨皮恩扎大学) Ca’ Foscari University of Venice, Italy(威尼斯卡弗斯卡里大学) Queen Mary University of London, UK(伦敦女王玛丽大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19189 2025-04-29 cs.GR cs.CV 62%

Sketch2Anim: Towards Transferring Sketch Storyboards into 3D Animation

Lei Zhong, Chuan Guo, Yiming Xie, Jiawei Wang, Changjian Li

机构 * University of Edinburgh(爱丁堡大学) Snap Inc.(Snap公司) Northeastern University(东北大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: https://zhongleilz.github.io/Sketch2Anim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10377 2025-04-29 cs.CV cs.GR 62%

ReStyle3D: Scene-Level Appearance Transfer with Semantic Correspondences

Liyuan Zhu, Shengqu Cai, Shengyu Huang, Gordon Wetzstein, Naji Khosravan, Iro Armeni

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究) Zillow Group(Zillow集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH 2025. Project page: https://restyle3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16550 2025-03-27 cs.GR cs.CV 62%

PhysAnimator: Physics-Guided Generative Cartoon Animation

Tianyi Xie, Yiwei Zhao, Ying Jiang, Chenfanfu Jiang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17945 2025-03-27 cs.CV cs.AI cs.GR cs.LG 62%

MARVEL-40M+: Multi-Level Visual Elaboration for High-Fidelity Text-to-3D Content Creation

Sankalp Sinha, Mohammad Sadil Khan, Muhammad Usama, Shino Sam, Didier Stricker, Sk Aziz Ali, Muhammad Zeshan Afzal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09394 2025-03-26 cs.CV cs.GR 62%

WonderWorld: Interactive 3D Scene Generation from a Single Image

Hong-Xing Yu, Haoyi Duan, Charles Herrmann, William T. Freeman, Jiajun Wu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2025. Project website: https://kovenyu.com/WonderWorld/. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10700 2025-03-17 cs.CV cs.MM 62%

TA-V2A: Textually Assisted Video-to-Audio Generation

Yuhuan You, Xihong Wu, Tianshu Qu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00928 2025-03-04 cs.GR cs.CV cs.LG 62%

Revisiting CAD Model Generation by Learning Raster Sketch

Pu Li, Wenhao Zhang, Jianwei Guo, Jinglu Chen, Dong-Ming Yan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19937 2025-02-28 cs.CV cs.MM 62%

Image Referenced Sketch Colorization Based on Animation Creation Workflow

Dingkun Yan, Xinrui Wang, Zhuoru Li, Suguru Saito, Yusuke Iwasawa, Yutaka Matsuo, Jiaxian Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11718 2025-02-19 cs.CV cs.MM 62%

TIPS: Text-Induced Pose Synthesis

Prasun Roy, Subhankar Ghosh, Saumik Bhattacharya, Umapada Pal, Michael Blumenstein

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments Accepted in The European Conference on Computer Vision (ECCV) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06777 2025-02-19 cs.CV cs.MM 62%

Multi-scale Attention Guided Pose Transfer

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments Accepted in Pattern Recognition (PR) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02063 2025-02-05 cs.CV cs.AI cs.GR 62%

CASIM: Composite Aware Semantic Injection for Text to Motion Generation

Che-Jui Chang, Qingze Tony Liu, Honglu Zhou, Vladimir Pavlovic, Mubbasir Kapadia

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16778 2025-01-29 cs.CV cs.AI cs.GR cs.LG 62%

FlexMotion: Lightweight, Physics-Aware, and Controllable Human Motion Generation

Arvin Tashakori, Arash Tashakori, Gongbo Yang, Z. Jane Wang, Peyman Servati

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16177 2025-01-28 cs.CV cs.AI cs.GR 62%

BAG: Body-Aligned 3D Wearable Asset Generation

Zhongjin Luo, Yang Li, Mingrui Zhang, Senbo Wang, Han Yan, Xibin Song, Taizhang Shang, Wei Mao, Hongdong Li, Xiaoguang Han, Pan Ji

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments video: https://youtu.be/XJtG82LjQKc

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01407 2025-01-03 cs.CV cs.GR cs.LG 62%

Nested Attention: Semantic-aware Attention Values for Concept Personalization

Or Patashnik, Rinon Gal, Daniil Ostashev, Sergey Tulyakov, Kfir Aberman, Daniel Cohen-Or

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

Comments Project page at https://snap-research.github.io/NestedAttention/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14158 2024-12-31 cs.CV cs.AI cs.MM 62%

AKiRa: Augmentation Kit on Rays for optical video generation

Xi Wang, Robin Courant, Marc Christie, Vicky Kalogeiton

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20378 2024-12-31 cs.CV cs.MM cs.SD eess.AS 62%

Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control

Bingliang Li, Fengyu Yang, Yuxin Mao, Qingwen Ye, Hongkai Chen, Yiran Zhong

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments AAAI 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05551 2024-12-30 cs.CV cs.MM cs.SD eess.AS 62%

Read, Watch and Scream! Sound Generation from Text and Video

Yujin Jeong, Yunji Kim, Sanghyuk Chun, Jiyoung Lee

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments AAAI2025, Project page: https://naver-ai.github.io/rewas

详情

展开后加载摘要…

URL PDF HTML 收藏