arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2503.18364 2025-07-09 cs.CV 57%

MaSS13K: A Matting-level Semantic Segmentation Benchmark

Chenxi Xie, Minghan Li, Hui Zeng, Jun Luo, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04961 2025-07-08 cs.CV 57%

InterGSEdit: Interactive 3D Gaussian Splatting Editing with 3D Geometry-Consistent Attention Prior

Minghao Wen, Shengjie Wu, Kangkan Wang, Dong Liang

机构 * MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(信息产业部模式分析与机器智能重点实验室,计算机科学与技术学院,南京航空航天大学) The Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(教育部高维信息智能感知与系统重点实验室,计算机科学与工程学院,南京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08553 2025-07-08 cs.CV 57%

DynamicFace: High-Quality and Consistent Face Swapping for Image and Video using Composable 3D Facial Priors

Runqi Wang, Yang Chen, Sijie Xu, Tianyao He, Wei Zhu, Dejia Song, Nemo Chen, Xu Tang, Yao Hu

机构 * Xiaohongshu(小红书) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. Project page: https://dynamic-face.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14419 2025-07-08 cs.CV 57%

HOTS3D: Hyper-Spherical Optimal Transport for Semantic Alignment of Text-to-3D Generation

Zezeng Li, Weimin Wang, Yuming Zhao, Wenhai Li, Na Lei, Xianfeng Gu

机构 * School of Software, Dalian University of Technology(大连理工大学软件学院) Department of Computer Science and Applied Mathematics, State University of New York at Stony Brook(石溪大学计算机科学与应用数学系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments accepted by tvcg

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07759 2025-07-08 cs.CV 57%

3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation

Xiao Fu, Xian Liu, Xintao Wang, Sida Peng, Menghan Xia, Xiaoyu Shi, Ziyang Yuan, Pengfei Wan, Di Zhang, Dahua Lin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICLR 2025. Project Page & Code & Data: http://fuxiao0719.github.io/projects/3dtrajmaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02857 2025-07-04 cs.CV 57%

AnyI2V: Animating Any Conditional Image with Motion Control

Ziye Li, Hao Luo, Xincheng Shuai, Henghui Ding

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba group(阿里达摩院) Hupan Lab(虎扑实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.com/AnyI2V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02217 2025-07-04 cs.CV cs.AI 57%

Understanding Trade offs When Conditioning Synthetic Data

Brandon Trabucco, Qasim Wani, Benjamin Pikus, Vasu Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Advex AI Facebook AI Research(脸书人工智能研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01409 2025-07-03 cs.CV 57%

CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning

Kuniaki Saito, Donghyun Kim, Kwanyong Park, Atsushi Hashimoto, Yoshitaka Ushiku

机构 * University of Seoul(首尔大学)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17301 2025-07-03 cs.GR 57%

FramePrompt: In-context Controllable Animation with Zero Structural Changes

Guian Fang, Yuchao Gu, Mike Zheng Shou

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments Project page: https://frameprompt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17269 2025-07-02 cs.CV 57%

Towards Generalized and Training-Free Text-Guided Semantic Manipulation

Yu Hong, Xiao Cai, Pengpeng Zeng, Shuai Zhang, Jingkuan Song, Lianli Gao, Heng Tao Shen

机构 * Tongji University(同济大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://ayanami-yu.github.io/GTF-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23618 2025-07-01 cs.CV 57%

TurboVSR: Fantastic Video Upscalers and Where to Find Them

Zhongdao Wang, Guodongfang Zhao, Jingjing Ren, Bailan Feng, Shifeng Zhang, Wenbo Li

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22065 2025-06-30 cs.CV 57%

MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation

Dechao Meng, Steven Xiao, Xindi Zhang, Guangyuan Wang, Peng Zhang, Qi Wang, Bang Zhang, Liefeng Bo

机构 * Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21276 2025-06-27 cs.CV 57%

WordCon: Word-level Typography Control in Scene Text Rendering

Wenda Shi, Yiren Song, Zihan Rao, Dengming Zhang, Jiaming Liu, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18369 2025-06-24 cs.RO cs.AI cs.CV cs.SY eess.SY 57%

G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation

Tianxing Chen, Yao Mu, Zhixuan Liang, Zanxin Chen, Shijia Peng, Qiangyu Chen, Mingkun Xu, Ruizhen Hu, Hongyuan Zhang, Xuelong Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Shenzhen University(深圳大学) AgileX Robotics(AgileX机器人) GDIIST HKU Shanghai Intelligent Computing Research Center(香港大学上海智能计算研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Webpage: https://tianxingchen.github.io/G3Flow/, accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17383 2025-06-24 cs.CV 57%

AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation

Ziyi Xu, Ziyao Huang, Juan Cao, Yong Zhang, Xiaodong Cun, Qing Shuai, Yuchen Wang, Linchao Bao, Jintao Li, Fan Tang

机构 * Institute of Computing Technique, Chinese Academy of Sciences(中国科学院计算技术研究所) Meituan(美团) Great Bay University(大湾区大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19186 2025-06-24 cs.CV cs.LG 57%

Disentangling representations of retinal images with generative models

Sarah Müller, Lisa M. Koch, Hendrik P. A. Lensch, Philipp Berens

机构 * Hertie Institute for AI in Brain Health, Faculty of Medicine, University of Tübingen(人工智能与脑健康赫特研究所,医学院,图宾根大学) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department of Diabetes, Endocrinology, Nutritional Medicine and Metabolism UDEM, Inselspital, Bern University Hospital, University of Bern, Bern, Switzerland(糖尿病、内分泌学、营养医学和代谢学部门UDEM,伯尔尼大学医院,伯尔尼大学,伯尔尼,瑞士) Department of Computer Science, University of Tübingen, Tübingen, Germany(计算机科学系,图宾根大学,图宾根,德国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Final journal paper version for Medical Image Analysis (MedIA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17201 2025-06-23 cs.CV 57%

Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition

Jiaqi Li, Junshu Tang, Zhiyong Xu, Longhuang Wu, Yuan Zhou, Shuai Shao, Tianbao Yu, Zhiguo Cao, Qinglin Lu

机构 * Tencent Hunyuan(腾讯 Hunyuan)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://hunyuan-gamecraft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16852 2025-06-23 cs.CV 57%

Controllable and Expressive One-Shot Video Head Swapping

Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang, Liefeng Bo

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://humanaigc.github.io/SwapAnyHead/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16730 2025-06-23 cs.CV 57%

TeSG: Textual Semantic Guidance for Infrared and Visible Image Fusion

Mingrui Zhu, Xiru Chen, Xin Wei, Nannan Wang, Xinbo Gao

机构 * Xidian University(西电大学) Chongqing University of Post and Telecommunications(重庆邮电大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11302 2025-06-23 cs.CV cs.AI 57%

TARDIS STRIDE: A Spatio-Temporal Road Image Dataset and World Model for Autonomy

Héctor Carrión, Yutong Bai, Víctor A. Hernández Castro, Kishan Panaganti, Ayush Zenith, Matthew Trang, Tony Zhang, Pietro Perona, Jitendra Malik

机构 * Tera AI UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) California Institute of Technology(加州理工学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments Computer Vision, Pattern Recognition, Early-Fusion, Dataset, Data Augmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06679 2025-06-18 cs.CV 57%

T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks

Jiayang Liu, Siyuan Liang, Shiqian Zhao, Rongcheng Tu, Wenbo Zhou, Aishan Liu, Dacheng Tao, Siew Kei Lam

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09323 2025-06-17 cs.CV 57%

T-SVG: Text-Driven Stereoscopic Video Generation

Qiao Jin, Xiaodong Chen, Wu Liu, Tao Mei, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hidream Inc.(海dream公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18458 2025-06-17 eess.IV cs.CV cs.LG physics.med-ph 57%

A robust and scalable framework for hallucination detection in virtual tissue staining and digital pathology

Luzhe Huang, Yuzhu Li, Nir Pillar, Tal Keidar Haran, William Dean Wallace, Aydogan Ozcan

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 45 Pages, 22 Figures, 2 Tables

Journal ref Nature Biomedical Engineering (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13238 2025-06-17 cs.CV 57%

Learning Coherent Matrixized Representation in Latent Space for Volumetric 4D Generation

Qitong Yang, Mingtao Feng, Zijie Wu, Shijie Sun, Weisheng Dong, Yaonan Wang, Ajmal Mian

机构 * School of Artificial Intelligence(人工智能学院) School of Information Engineering(信息工程学院) School of Electrical and Information Engineering(电气与信息工程学院) Computer Science and Software Engineering(计算机科学与软件工程) The University of Western Australia(西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03082 2025-06-16 cs.CV 57%

SG2VID: Scene Graphs Enable Fine-Grained Control for Video Synthesis

Ssharvien Kumar Sivakumar, Yannik Frisch, Ghazal Ghazaei, Anirban Mukhopadhyay

机构 * Technical University Darmstadt(达姆施塔特技术大学) Universitätsmedizin der Johannes Gutenberg-Universität Mainz(美因茨约翰尼斯·古滕贝格大学医学中心) Carl Zeiss AG(蔡司股份公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15939 2025-06-16 cs.CV 57%

Diversifying Human Pose in Synthetic Data for Aerial-view Human Detection

Yi-Ting Shen, Hyungtae Lee, Heesung Kwon, Shuvra S. Bhattacharyya

机构 * University of Maryland, College Park(马里兰大学 College Park分校) BlueHalo DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16160 2025-06-12 cs.CV 57%

MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling

Yifang Men, Yuan Yao, Miaomiao Cui, Liefeng Bo

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://menyifang.github.io/projects/MIMO/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07740 2025-06-10 cs.CV 57%

Flow-Anything: Learning Real-World Optical Flow Estimation from Large-Scale Single-view Images

Yingping Liang, Ying Fu, Yutao Hu, Wenqi Shao, Jiaming Liu, Debing Zhang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computer Science and Engineering, Southeast University(计算机科学与工程学院,东南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tiamat AI Xiaohongshu(小红书)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18417 2025-06-10 cs.CV 57%

GHOST 2.0: generative high-fidelity one shot transfer of heads

Alexander Groshev, Anastasiia Iashchenko, Pavel Paramonov, Denis Dimitrov, Andrey Kuznetsov

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05338 2025-06-09 cs.CV 57%

Defurnishing with X-Ray Vision: Joint Removal of Furniture from Panoramas and Mesh

Alan Dolhasz, Chen Ma, Dave Gausebeck, Kevin Chen, Gregor Miller, Lucas Hayne, Gunnar Hovden, Azwad Sabik, Olaf Brandt, Mira Slavcheva

机构 * Matterport

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Paper website: https://matterport.github.io/defurnishing-with-x-ray-vision/

详情

展开后加载摘要…

URL PDF HTML 收藏