arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

2311.17963 2025-08-08 cs.CV 79%

M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation

Xiaowei Chi, Junbo Qi, Rongyu Zhang, Shanghang Zhang, Qifeng Liu, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Waseda University(早稻田大学) Peking University(北京大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04147 2025-08-07 cs.CV 79%

IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control

Lijuan Liu, Wenfa Li, Dongbo Zhang, Shuo Wang, Shaohui Jiao

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21008 2025-08-07 cs.CV 79%

The Aging Multiverse: Generating Condition-Aware Facial Aging Tree via Training-Free Diffusion

Bang Gong, Luchao Qi, Jiaye Wu, Zhicheng Fu, Chunbo Song, David W. Jacobs, John Nicholson, Roni Sengupta

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland(马里兰大学) Lenovo(联想公司)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23340 2025-08-01 cs.CV 79%

MagicRoad: Semantic-Aware 3D Road Surface Reconstruction via Obstacle Inpainting

Xingyue Peng, Yuandong Lyu, Lang Zhang, Jian Zhu, Songtao Wang, Jiaxin Deng, Songxin Lu, Weiliang Ma, Dangen She, Peng Jia, XianPeng Lang

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22825 2025-07-31 cs.CV 79%

DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion

Qingcheng Zhao, Xiang Zhang, Haiyang Xu, Zeyuan Chen, Jianwen Xie, Yuan Gao, Zhuowen Tu

机构 * ShanghaiTech University(上海科技大学) UC San Diego(加州大学圣地亚哥分校) Lambda, Inc.(Lambda公司) Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06109 2025-07-16 cs.CV 79%

PerLDiff: Controllable Street View Synthesis Using Perspective-Layout Diffusion Models

Jinhua Zhang, Hualian Sheng, Sijia Cai, Bing Deng, Qiao Liang, Wen Li, Ying Fu, Jieping Ye, Shuhang Gu

专题命中 可控生成 :diffusion(title);image generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00153 2025-07-02 cs.CV 79%

Diffusion-Based Image Augmentation for Semantic Segmentation in Outdoor Robotics

Peter Mortimer, Mirko Maehlisch

机构 * Perception for Autonomous Driving Lab University of the Bundeswehr Munich(国防军自主驾驶感知实验室 柏林国防军大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments Presented at the 2025 IEEE ICRA Workshop on Field Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19851 2025-06-25 cs.CV 79%

AnimaX: Animating the Inanimate in 3D with Joint Video-Pose Diffusion Models

Zehuan Huang, Haoran Feng, Yangtian Sun, Yuanchen Guo, Yanpei Cao, Lu Sheng

机构 * Beihang University(北航) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments Project page: https://anima-x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16301 2025-06-24 cs.CV cs.LG 79%

DiffDesign: Controllable Diffusion with Meta Prior for Efficient Interior Design Generation

Yuxuan Yang, Tao Geng

机构 * Nanjing Forestry University(南京林业大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03551 2025-06-23 eess.IV cs.AI cs.CV 79%

Enhancing Weakly Supervised Semantic Segmentation for Fibrosis via Controllable Image Generation

Zhiling Yue, Yingying Fang, Liutao Yang, Nikhil Baid, Simon Walsh, Guang Yang

机构 * Imperial College London(帝国理工学院伦敦分校) University College London(伦敦大学学院) National Heart and Lung Institute(国家心肺研究所)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

Journal ref 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07992 2025-06-10 cs.CV 79%

PairEdit: Learning Semantic Variations for Exemplar-based Image Editing

Haoguang Lu, Jiacheng Chen, Zhenguo Yang, Aurele Tohokantche Gnanha, Fu Lee Wang, Li Qing, Xudong Mao

机构 * Sun Yat-sen University(中山大学) Guangdong University of Technology(广东工业大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室) Hong Kong Metropolitan University(香港理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :image editing(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01955 2025-06-03 cs.CV cs.CL cs.LG 79%

Dual-Process Image Generation

Grace Luo, Jonathan Granskog, Aleksander Holynski, Trevor Darrell

机构 * UC Berkeley(伯克利大学) Runway

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24636 2025-06-02 cs.CV 79%

Category-Level 6D Object Pose Estimation in Agricultural Settings Using a Lattice-Deformation Framework and Diffusion-Augmented Synthetic Data

Marios Glytsos, Panagiotis P. Filntisis, George Retsinas, Petros Maragos

机构 * Robotics Institute, Athena Research and Innovation Center(机器人研究所,雅典研究与创新中心)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments 7 pages, 4 figures. Submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23325 2025-05-30 cs.CV 79%

Dimension-Reduction Attack! Video Generative Models are Experts on Controllable Image Synthesis

Hengyuan Cao, Yutong Feng, Biao Gong, Yijing Tian, Yunhong Lu, Chuang Liu, Bin Wang

机构 * Zhejiang University(浙江大学) Kunbyte AI Ant Group(蚂蚁集团) Hangzhou Normal University(杭州师范大学)

专题命中 可控生成 :image synthesis(title);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14841 2025-05-21 cs.CV cs.AI 79%

Diffusion based Semantic Outlier Generation via Nuisance Awareness for Out-of-Distribution Detection

Suhee Yoon, Sanghyu Yoon, Ye Seul Sim, Sungik Choi, Kyungeun Lee, Hye-Seung Cho, Hankook Lee, Woohyung Lim

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00735 2025-05-09 eess.IV cs.CV 79%

Leveraging Depth Maps and Attention Mechanisms for Enhanced Image Inpainting

Jin Hyun Park, Harine Choi, Praewa Pitiphat

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系) Texas A&M University(德克萨斯A&M大学) Dept. of Multidisciplinary Engineering(多学科工程系)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03679 2025-05-07 cs.CV 79%

CaRaFFusion: Improving 2D Semantic Segmentation with Camera-Radar Point Cloud Fusion and Zero-Shot Image Inpainting

Huawei Sun, Bora Kunter Sahin, Georg Stettinger, Maximilian Bernhard, Matthias Schubert, Robert Wille

机构 * Huawei Sun ⋆ 1,2(华为(深圳)技术有限公司) Bora Kunter Sahin ⋆ 1,3(华为(深圳)技术有限公司) Georg Stettinger 1(华为(深圳)技术有限公司) Maximilian Bernhard 3(慕尼黑工业大学) Matthias Schubert 3(慕尼黑工业大学) Robert Wille 2(华为(深圳)技术有限公司)

专题命中 可控生成 :inpainting(title);diffusion(abstract);分类 cs.CV

Comments Accepted at RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18673 2025-05-07 cs.CV 79%

AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers

Sherwin Bahmani, Ivan Skorokhodov, Guocheng Qian, Aliaksandr Siarohin, Willi Menapace, Andrea Tagliasacchi, David B. Lindell, Sergey Tulyakov

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Snap Inc.(Snap公司)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments CVPR 2025; Project Page: https://snap-research.github.io/ac3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01857 2025-05-06 cs.CV 79%

DualDiff: Dual-branch Diffusion Model for Autonomous Driving with Semantic Fusion

Haoteng Li, Zhao Yang, Zezhong Qian, Gongpeng Zhao, Yuqi Huang, Jun Yu, Huazheng Zhou, Longjun Liu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家级人机混合增强智能实验室) National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments 8 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11801 2025-04-29 cs.CV cs.LG 79%

3D Gaussian Inpainting with Depth-Guided Cross-View Consistency

Sheng-Yu Huang, Zi-Ting Chou, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所) NVIDIA, Taiwan(NVIDIA台湾分公司)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2025. For project page, see https://peterjohnsonhuang.github.io/3dgic-pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19455 2025-04-24 cs.GR 79%

FLAP: Fully-controllable Audio-driven Portrait Video Generation through 3D head conditioned diffusion model

Lingzhou Mu, Baiji Liu, Ruonan Zhang, Guiming Mo, Jiawei Jin, Kai Zhang, Haozhi Huang

专题命中 可控生成 :diffusion(title,abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10433 2025-04-15 cs.CV cs.RO 79%

MonoDiff9D: Monocular Category-Level 9D Object Pose Estimation via Diffusion Model

Jian Liu, Wei Sun, Hui Yang, Jin Zheng, Zichen Geng, Hossein Rahmani, Ajmal Mian

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by ICRA'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12885 2025-04-15 cs.CV 79%

DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models

Dewei Zhou, Mingwei Li, Zongxin Yang, Yi Yang

专题命中 可控生成 :text-to-image(title);image synthesis(abstract);分类 cs.CV

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05763 2025-04-15 cs.CV 79%

StarGen: A Spatiotemporal Autoregression Framework with Video Diffusion Model for Scalable and Controllable Scene Generation

Shangjin Zhai, Zhichao Ye, Jialin Liu, Weijian Xie, Jiaqi Hu, Zhen Peng, Hua Xue, Danpeng Chen, Xiaomeng Wang, Lei Yang, Nan Wang, Haomin Liu, Guofeng Zhang

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08003 2025-04-14 cs.CV 79%

Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability

Ning Li, Jingran Zhang, Justin Cui

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

Comments Early work, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07405 2025-04-11 cs.CV 79%

FlexIP: Dynamic Control of Preservation and Personality for Customized Image Generation

Linyan Huang, Haonan Lin, Yanning Zhou, Kaiwen Xiao

专题命中 可控生成 :image generation(title);personalized generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07046 2025-04-10 cs.CV cs.CL 79%

A Unified Agentic Framework for Evaluating Conditional Image Generation

Jifang Wang, Xue Yang, Longyue Wang, Zhenran Xu, Yiyu Wang, Yaowei Wang, Weihua Luo, Kaifu Zhang, Baotian Hu, Min Zhang

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

Comments Work in progress. GitHub: https://github.com/HITsz-TMG/Agentic-CIGEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05979 2025-04-02 cs.CV 79%

VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer

Xinyu Liu, Ailing Zeng, Wei Xue, Harry Yang, Wenhan Luo, Qifeng Liu, Yike Guo

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20644 2025-03-27 cs.CV 79%

MMGen: Unified Multi-modal Image Generation and Understanding in One Go

Jiepeng Wang, Zhaoqing Wang, Hao Pan, Yuan Liu, Dongdong Yu, Changhu Wang, Wenping Wang

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

Comments Our project page: https://jiepengwang.github.io/MMGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19661 2025-03-26 cs.CV 79%

CoSimGen: Controllable Diffusion Model for Simultaneous Image and Mask Generation

Rupak Bose, Chinedu Innocent Nwoye, Aditya Bhat, Nicolas Padoy

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments 15 pages, 14 figure, 2 tables, project page at https://camma-public.github.io/endogen/cosimgen

详情

展开后加载摘要…

URL PDF HTML 收藏