arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2509.01596 2025-09-03 cs.CV cs.AI 57%

O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing

Yuqing Chen, Junjie Wang, Lin Liu, Ruihang Chu, Xiaopeng Zhang, Qi Tian, Yujiu Yang

机构 * Tsinghua University(清华大学) Huawei Inc.(华为公司) Pengcheng National Laboratory(Pengcheng国家实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21090 2025-09-01 cs.CV 57%

Q-Align: Alleviating Attention Leakage in Zero-Shot Appearance Transfer via Query-Query Alignment

Namu Kim, Wonbin Kweon, Minsoo Kim, Hwanjo Yu

机构 * KT Corporation, South Korea(韩国KT公司) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) Pohang University of Science and Technology (POSTECH), South Korea(浦项科技大学(POSTECH))

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19320 2025-08-29 cs.CV cs.AI 57%

MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation

Ming Chen, Liyuan Cui, Wenyuan Zhang, Haoxian Zhang, Yan Zhou, Xiaohan Li, Songlin Tang, Jiwen Liu, Borui Liao, Hejia Chen, Xiaoqiang Liu, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Technical Report. Project Page: https://chenmingthu.github.io/milm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07817 2025-08-29 cs.RO cs.CV 57%

Pixel Motion as Universal Representation for Robot Control

Kanchana Ranasinghe, Xiang Li, E-Ro Nguyen, Cristina Mata, Jongwoo Park, Michael S Ryoo

机构 * Stony Brook University(石溪大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14316 2025-08-29 cs.CV 57%

T-Stars-Poster: A Framework for Product-Centric Advertising Image Design

Hongyu Chen, Min Zhou, Jing Jiang, Jiale Chen, Yang Lu, Zihang Lin, Bo Xiao, Tiezheng Ge, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19626 2025-08-28 cs.CV 57%

Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model

Jiajun Sun, Zhen Yu, Siyuan Yan, Jason J. Ong, Zongyuan Ge, Lei Zhang

机构 * School of Translational Medicine, Faculty of Medicine, Nursing and Health Sciences, Monash University(转化医学学院,医学、护理与健康科学学院,墨尔本大学) Melbourne Sexual Health Centre, Alfred Health(墨尔本性健康中心,阿尔弗雷德健康中心) AIM for Health Lab, Monash University(健康促进实验室,墨尔本大学) Faculty of IT, Monash University(信息技术学院,墨尔本大学) Faculty of Engineering, Monash University(工程学院,墨尔本大学) Faculty of Infectious and Tropical Diseases, London School of Hygiene and Tropical Medicine(传染病与热带医学学院,伦敦热带医学学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19604 2025-08-28 cs.CV cs.AI 57%

IELDG: Suppressing Domain-Specific Noise with Inverse Evolution Layers for Domain Generalized Semantic Segmentation

Qizhe Fan, Chaoyu Liu, Zhonghua Qiao, Xiaoqin Shen

机构 * School of Sciences, Xi’an University of Technology, Xi’an 710054, China(西安理工大学科学学院) Department of Applied Mathematics(应用数学系) Theoretical Physics, University of Cambridge, UK(理论物理,剑桥大学,英国) Department of Applied Mathematics, The Hong Kong Polytechnic University, Hung Hom, Hong Kong(应用数学系,香港理工大学,九龙)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22141 2025-08-28 cs.CV cs.AI 57%

FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing

Guanwen Feng, Zhiyuan Ma, Yunan Li, Jiahao Yang, Junwei Jing, Qiguang Miao

机构 * Xi’an Key Laboratory of Big Data and Intelligent Vision, Xidian University, Xi’an 710071, China(西安大数据与智能视觉重点实验室,西安电子科技大学,西安710071,中国) Key Laboratory of Collaborative Intelligence Systems, Ministry of Education, Xidian University, Xi’an 710071, China(协同智能系统重点实验室,教育部,西安电子科技大学,西安710071,中国) School of Computer Science and Technology, Xidian University, Xi’an 710071, China(计算机科学与技术学院,西安电子科技大学,西安710071,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19254 2025-08-28 cs.CV cs.AI cs.HC 57%

Real-Time Intuitive AI Drawing System for Collaboration: Enhancing Human Creativity through Formal and Contextual Intent Integration

Jookyung Song, Mookyoung Kang, Nojun Kwak

机构 * SNU(首尔国立大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 6 pages, 4 figures, NeurIPS Creative AI Track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17957 2025-08-27 cs.LG cs.CV 57%

Generative Feature Imputing -- A Technique for Error-resilient Semantic Communication

Jianhao Huang, Qunsong Zeng, Hongyang Du, Kaibin Huang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(电子与电气工程系,香港大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17062 2025-08-26 cs.CV cs.AI 57%

SSG-Dit: A Spatial Signal Guided Framework for Controllable Video Generation

Peng Hu, Yu Gu, Liang Luo, Fuji Ren

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17029 2025-08-26 cs.CV 57%

A Novel Local Focusing Mechanism for Deepfake Detection Generalization

Mingliang Li, Lin Yuanbo Wu, Changhong Liu, Hanxi Li

机构 * Jiangxi Normal University, China(江西师范大学) Swansea University, United Kingdom(斯旺西大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20439 2025-08-26 cs.CV 57%

Image Augmentation Agent for Weakly Supervised Semantic Segmentation

Wangyu Wu, Xianglin Qiu, Siqi Song, Zhenhong Chen, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at Neurocomputing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06602 2025-08-26 cs.CL cs.AI cs.LG cs.MM cs.SD eess.AS 57%

Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey

Tianxin Xie, Yan Rong, Pengfei Zhang, Wenwu Wang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Surrey(萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

Comments The first comprehensive survey on controllable TTS. Accepted to the EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22979 2025-08-26 cs.CV 57%

LumiSculpt: Enabling Consistent Portrait Lighting in Video Generation

Yuxin Zhang, Dandan Zheng, Biao Gong, Shiwen Wang, Jingdong Chen, Ming Yang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciecnes(MAIS,自动化研究所,中国科学院) Ant Group(蚂蚁集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11183 2025-08-25 cs.CV 57%

OccScene: Semantic Occupancy-based Cross-task Mutual Learning for 3D Scene Generation

Bohan Li, Xin Jin, Jianan Wang, Yukai Shi, Yasheng Sun, Xiaofeng Wang, Zhuang Ma, Baao Xie, Chao Ma, Xiaokang Yang, Wenjun Zeng

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(电子信息与电气工程学院,上海交通大学) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所,东部技术研究所) PhiGent Robotics, Beijing, China(PhiGent Robotics,北京,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09588 2025-08-22 cs.CV cs.AI 57%

TextSplat: Text-Guided Semantic Fusion for Generalizable Gaussian Splatting

Zhicong Wu, Hongbin Xu, Gang Xu, Ping Nie, Zhixin Yan, Jinkai Zheng, Liangqiong Qu, Ming Li, Liqiang Nie

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) Peking University(北京大学) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Hangzhou Dianzi University(杭州电子科技大学) Central Laboratory of Lishui Hospital of Wenzhou Medical University, The First Affiliated Hospital of Lishui University, Lishui People's Hospital(丽水市人民医院中央实验室、丽水大学第一附属医院、丽水人民医院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14814 2025-08-21 cs.CV cs.AI 57%

TransLight: Image-Guided Customized Lighting Control with Generative Decoupling

Zongming Li, Lianghui Zhu, Haocheng Shen, Longjin Ran, Wenyu Liu, Xinggang Wang

机构 * OpenAI

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13738 2025-08-20 cs.GR 57%

Eliminating Rasterization: Direct Vector Floor Plan Generation with DiffPlanner

Shidong Wang, Renato Pajarola

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments accepted to IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13153 2025-08-19 cs.CV 57%

IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion

Wenhao Hu, Zesheng Li, Haonan Zhou, Liu Liu, Xuexiang Wen, Zhizhong Su, Xi Li, Gaoang Wang

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Project page: https://whhu7.github.io/IGFuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19183 2025-08-19 cs.CV 57%

Segmenting Objectiveness and Task-awareness Unknown Region for Autonomous Driving

Mi Zheng, Guanglei Yang, Zitong Huang, Zhenhua Guo, Kevin Han, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianyijiaotong Technology Ltd.(天翼交通科技有限公司) Independent Researcher(独立研究者)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11256 2025-08-18 cs.CV cs.AI 57%

Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception

Junjie Wang, Keyu Chen, Yulin Li, Bin Chen, Hengshuang Zhao, Xiaojuan Qi, Zhuotao Tian

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2505.04410

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10397 2025-08-15 cs.CV cs.AI 57%

PQ-DAF: Pose-driven Quality-controlled Data Augmentation for Data-scarce Driver Distraction Detection

Haibin Sun, Xinghui Song

机构 * College of Computer Science and Engineering, Shandong University of Science and Technology(计算机科学与工程学院,山东科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08588 2025-08-13 cs.CV eess.IV 57%

RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space

Jingyun Liang, Jingkai Zhou, Shikai Li, Chenjie Cao, Lei Sun, Yichen Qian, Weihua Chen, Fan Wang

机构 * DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(华盘实验室) INSAIT Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://jingyunliang.github.io/RealisMotion

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16868 2025-08-12 cs.IT cs.AI cs.CV math.IT 57%

Codebook-enabled Generative End-to-end Semantic Communication Powered by Transformer

Peigen Ye, Yaping Sun, Shumin Yao, Hao Chen, Xiaodong Xu, Shuguang Cui

机构 * The Shenzhen Campus of Sun Yat-sen University, Sun Yat-sen University, Shenzhen, China(中山大学深圳校区,中山大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) SSE, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学深圳校区,香港中文大学,深圳,中国) Beijing University of Posts(北京邮电大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments IEEE INFOCOM PerAI6G 2024(accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20471 2025-08-08 cs.CV cs.AI cs.ET cs.LG cs.RO 57%

WeatherEdit: Controllable Weather Editing with 4D Gaussian Field

Chenghao Qian, Wenjing Li, Yuhu Guo, Gustav Markkula

机构 * University of Leeds(利兹大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16948 2025-08-08 cs.CV 57%

Follow-Your-Color: Multi-Instance Sketch Colorization

Yinhan Zhang, Yue Ma, Bingyuan Wang, Qifeng Chen, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06510 2025-08-08 cs.CV cs.AI 57%

AnomalyControl: Learning Cross-modal Semantic Features for Controllable Anomaly Synthesis

Shidan He, Lei Liu, Xiujun Shu, Bo Wang, Yuanhao Feng, Shen Zhao

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03069 2025-08-08 cs.CV cs.AI 57%

TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation

Liao Qu, Huichao Zhang, Yiheng Liu, Xu Wang, Yi Jiang, Yiming Gao, Hu Ye, Daniel K. Du, Zehuan Yuan, Xinglong Wu

机构 * ByteDance(字节跳动)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments CVPR 2025; Code and models: https://github.com/ByteVisionLab/TokenFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03754 2025-08-07 cs.CV 57%

Generating Synthetic Invoices via Layout-Preserving Content Replacement

Bevin V, Ananthakrishnan P, Ragesh KR, Sanjay M, Vineeth S, Bibin Wilson

机构 * BEO AI Address(BEO AI)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏