arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2504.08641 2025-04-14 cs.CV cs.AI cs.CL 57%

Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization

Jialu Li, Shoubin Yu, Han Lin, Jaemin Cho, Jaehong Yoon, Mohit Bansal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Website: https://video-msg.github.io; The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08473 2025-04-14 cs.CV 57%

Cut-and-Splat: Leveraging Gaussian Splatting for Synthetic Data Generation

Bram Vanherle, Brent Zoomers, Jeroen Put, Frank Van Reeth, Nick Michiels

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at the International Conference on Robotics, Computer Vision and Intelligent Systems 2025 (ROBOVIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08181 2025-04-14 cs.CV cs.AI 57%

TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation

Ruineng Li, Daitao Xing, Huiming Sun, Yuanzhou Ha, Jinglin Shen, Chiuman Ho

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14367 2025-04-14 cs.CV 57%

Thinking Racial Bias in Fair Forgery Detection: Models, Datasets and Evaluations

Decheng Liu, Zongqi Wang, Chunlei Peng, Nannan Wang, Ruimin Hu, Xinbo Gao

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments The paper is accepted in AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07382 2025-04-11 cs.CV 57%

Model Discrepancy Learning: Synthetic Faces Detection Based on Multi-Reconstruction

Qingchao Jiang, Zhishuo Xu, Zhiying Zhu, Ning Chen, Haoyue Wang, Zhongjie Ba

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06895 2025-04-10 cs.CV 57%

ColorizeDiffusion v2: Enhancing Reference-based Sketch Colorization Through Separating Utilities

Dingkun Yan, Xinrui Wang, Yusuke Iwasawa, Yutaka Matsuo, Suguru Saito, Jiaxian Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04170 2025-04-10 cs.AI cs.CV cs.RO 57%

Digital Gene: Learning about the Physical World through Analytic Concepts

Jianhua Sun, Cewu Lu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16199 2025-04-09 cs.CV 57%

VIRES: Video Instance Repainting via Sketch and Text Guided Generation

Shuchen Weng, Haojie Zheng, Peixuan Zhang, Yuchen Hong, Han Jiang, Si Li, Boxin Shi

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04423 2025-04-08 cs.CV cs.AI 57%

UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding

Yang Jiao, Haibo Qiu, Zequn Jie, Shaoxiang Chen, Jingjing Chen, Lin Ma, Yu-Gang Jiang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accpeted to CVPR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06786 2025-04-07 cs.CV 57%

Retrieving Semantics from the Deep: an RAG Solution for Gesture Synthesis

M. Hamza Mughal, Rishabh Dabral, Merel C. J. Scholman, Vera Demberg, Christian Theobalt

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://vcai.mpi-inf.mpg.de/projects/RAG-Gesture/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02312 2025-04-04 cs.CV cs.AI 57%

OmniCam: Unified Multimodal Video Generation via Camera Control

Xiaoda Yang, Jiayang Xu, Kaixuan Luan, Xinyu Zhan, Hongshun Qiu, Shijun Shi, Hao Li, Shuai Yang, Li Zhang, Checheng Yu, Cewu Lu, Lixin Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03017 2025-04-04 cs.CV 57%

Pixel-level and Semantic-level Adjustable Super-resolution: A Dual-LoRA Approach

Lingchen Sun, Rongyuan Wu, Zhiyuan Ma, Shuaizheng Liu, Qiaosi Yi, Lei Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06682 2025-04-03 cs.CV 57%

Transfer Your Perspective: Controllable 3D Generation from Any Viewpoint in a Driving Scene

Tai-Yu Pan, Sooyoung Jeon, Mengdi Fan, Jinsu Yoo, Zhenyang Feng, Mark Campbell, Kilian Q. Weinberger, Bharath Hariharan, Wei-Lun Chao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23684 2025-04-01 cs.CV 57%

Detail-aware multi-view stereo network for depth estimation

Haitao Tian, Junyang Li, Chenxing Wang, Helong Jiang

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23355 2025-04-01 cs.CV 57%

DSPFusion: Image Fusion via Degradation and Semantic Dual-Prior Guidance

Linfeng Tang, Chunyu Li, Guoqing Wang, Yixuan Yuan, Jiayi Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23022 2025-04-01 cs.CV 57%

MeshCraft: Exploring Efficient and Controllable Mesh Generation with Flow-based DiTs

Xianglong He, Junyi Chen, Di Huang, Zexiang Liu, Xiaoshui Huang, Wanli Ouyang, Chun Yuan, Yangguang Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22941 2025-04-01 cs.AI cs.LG cs.MM 57%

Identifying Multi-modal Knowledge Neurons in Pretrained Transformers via Two-stage Filtering

Yugen Sato, Tomohiro Takagi

专题命中 可控生成 :inpainting(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15214 2025-03-31 cs.CV 57%

LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Qifeng Chen, Yujun Shen, Limin Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page available at https://github.com/ant-research/LeviTor

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20523 2025-03-27 cs.CV cs.AI cs.RO 57%

GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving

Lloyd Russell, Anthony Hu, Lorenzo Bertoni, George Fedoseev, Jamie Shotton, Elahe Arani, Gianluca Corrado

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05874 2025-03-27 cs.CV cs.AI cs.LG 57%

MMGDreamer: Mixed-Modality Graph for Geometry-Controllable 3D Indoor Scene Generation

Zhifei Yang, Keyang Lu, Chao Zhang, Jiaxing Qi, Hanqi Jiang, Ruifei Ma, Shenglin Yin, Yifan Xu, Mingzhe Xing, Zhen Xiao, Jieyi Long, Guangyao Zhai

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00777 2025-03-27 cs.CV eess.SP q-bio.NC 57%

CATD: Unified Representation Learning for EEG-to-fMRI Cross-Modal Generation

Weiheng Yao, Zhihan Lyu, Mufti Mahmud, Ning Zhong, Baiying Lei, Shuqiang Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 9 figures, Accepted by IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19383 2025-03-26 cs.CV 57%

MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation

Yukang Lin, Hokit Fung, Jianjin Xu, Zeping Ren, Adela S. M. Lau, Guosheng Yin, Xiu Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18860 2025-03-26 cs.CV 57%

HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation

Zunnan Xu, Zhentao Yu, Zixiang Zhou, Jun Zhou, Xiaoyu Jin, Fa-Ting Hong, Xiaozhong Ji, Junwei Zhu, Chengfei Cai, Shiyu Tang, Qin Lin, Xiu Li, Qinglin Lu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09826 2025-03-26 cs.CV 57%

Boosting Few-Shot Semantic Segmentation Via Segment Anything Model

Chen-Bin Feng, Qi Lai, Kangdao Liu, Houcheng Su, Chi-Man Vong

专题命中 可控生成 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18874 2025-03-25 cs.LG cs.CV 57%

A semantic communication-based workload-adjustable transceiver for wireless AI-generated content (AIGC) delivery

Runze Cheng, Yao Sun, Lan Zhang, Lei Feng, Lei Zhang, Muhammad Ali Imran

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20085 2025-03-25 cs.CV 57%

Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language

Yicheng Chen, Xiangtai Li, Yining Li, Yanhong Zeng, Jianzong Wu, Xiangyu Zhao, Kai Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18386 2025-03-25 cs.CV cs.AI 57%

Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance

Sicong Feng, Jielong Yang, Li Peng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08295 2025-03-25 cs.CV 57%

LayerAnimate: Layer-level Control for Animation

Yuxue Yang, Lue Fan, Zuzeng Lin, Feng Wang, Zhaoxiang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://layeranimate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05892 2025-03-25 cs.CV 57%

Beyond Flat Text: Dual Self-inherited Guidance for Visual Text Generation

Minxing Luo, Zixun Xia, Liaojun Chen, Zhenhang Li, Weichao Zeng, Jianye Wang, Wentao Cheng, Yaxing Wang, Yu Zhou, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08601 2025-03-25 cs.SD cs.MM eess.AS 57%

STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Yong Ren, Chenxing Li, Manjie Xu, Wei Liang, Yu Gu, Rilin Chen, Dong Yu

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

Comments ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏