arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2505.09723 2025-05-16 cs.RO cs.CV 57%

EnerVerse-AC: Envisioning Embodied Environments with Action Condition

Yuxin Jiang, Shengcong Chen, Siyuan Huang, Liliang Chen, Pengfei Zhou, Yue Liao, Xindong He, Chiming Liu, Hongsheng Li, Maoqing Yao, Guanghui Ren

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Website: https://annaj2178.github.io/EnerverseAC.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08607 2025-05-14 cs.CV 57%

Boosting Zero-shot Stereo Matching using Large-scale Mixed Images Sources in the Real World

Yuran Wang, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08234 2025-05-14 cs.CV cs.AI cs.CR 57%

Removing Watermarks with Partial Regeneration using Semantic Information

Krti Tallam, John Kevin Cava, Caleb Geniesse, N. Benjamin Erichson, Michael W. Mahoney

机构 * International Computer Science Institute(国际计算机科学研究所) School of Computing and Augmented Intelligence(计算与增强智能学院) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Department of Statistics(统计学系) University of California at Berkeley(加州大学伯克利分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02240 2025-05-14 cs.CV cs.AI 57%

SCA: Improve Semantic Consistent in Unrestricted Adversarial Attacks via DDPM Inversion

Zihao Pan, Lifeng Chen, Weibin Wu, Yuhang Cao, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Computer Science, Beijing Jiaotong University(北京交通大学计算机科学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07747 2025-05-13 cs.CV 57%

Step1X-3D: Towards High-Fidelity and Controllable Generation of Textured 3D Assets

Weiyu Li, Xuanyang Zhang, Zheng Sun, Di Qi, Hao Li, Wei Cheng, Weiwei Cai, Shihao Wu, Jiarui Liu, Zihao Wang, Xiao Chen, Feipeng Tian, Jianxiong Pan, Zeming Li, Gang Yu, Xiangyu Zhang, Daxin Jiang, Ping Tan

机构 * Step1X-3D Team(Step1X-3D 团队) LightIllusions Team(LightIllusions 团队)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11936 2025-05-06 cs.GR cs.HC eess.SP 57%

Mind2Matter: Creating 3D Models from EEG Signals

Xia Deng, Shen Chen, Jiale Zhou, Lei Li

专题命中 可控生成 :image generation(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00135 2025-05-02 cs.CV 57%

Eye2Eye: A Simple Approach for Monocular-to-Stereo Video Synthesis

Michal Geyer, Omer Tov, Linyi Jin, Richard Tucker, Inbar Mosseri, Tali Dekel, Noah Snavely

机构 * Google DeepMind(谷歌DeepMind) Weizmann Institute of Science(魏茨曼科学研究院) University of Michigan(密歇根大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18416 2025-05-02 cs.CV 57%

3D StreetUnveiler with Semantic-aware 2DGS -- a simple baseline

Jingwei Xu, Yikai Wang, Yiqun Zhao, Yanwei Fu, Shenghua Gao

机构 * ShanghaiTech University(上海科技大学) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学) HKU Shanghai Intelligent Computing Research Center(香港大学上海智能计算研究中心) Fudan University(复旦大学) Fudan ISTBI–ZJNU Algorithm Centre for Brain-inspired Intelligence, Zhejiang Normal University(复旦大学脑启发式智能算法中心,浙江师范大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Project page: https://streetunveiler.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21814 2025-05-01 cs.CV 57%

Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields

Yixin Gao, Xiaohan Pan, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15032 2025-05-01 cs.CV 57%

DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation

Weijie He, Mushui Liu, Yunlong Yu, Zhao Wang, Chao Wu

机构 * Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20042 2025-04-29 cs.CV 57%

CompleteMe: Reference-based Human Image Completion

Yu-Ju Tsai, Brian Price, Qing Liu, Luis Figueroa, Daniil Pakhomov, Zhihong Ding, Scott Cohen, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) Adobe Research(Adobe研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Project page: https://liagm.github.io/CompleteMe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19645 2025-04-29 cs.RO cs.AI cs.CV cs.LG 57%

Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success

Moo Jin Kim, Chelsea Finn, Percy Liang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to Robotics: Science and Systems (RSS) 2025. Project website: https://openvla-oft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11934 2025-04-29 cs.CV cs.AI 57%

SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input

Zhen Lv, Yangqi Long, Congzhentao Huang, Cao Li, Chengfei Lv, Hao Ren, Dian Zheng

机构 * Alibaba Group(阿里巴巴集团) Sun Yat-sen University(中山大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments website, see https://spatialdreamer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20332 2025-04-29 eess.IV cs.CV 57%

Devil is in Details: Locality-Aware 3D Abdominal CT Volume Generation for Self-Supervised Organ Segmentation

Yuran Wang, Zhijing Wan, Yansheng Qiu, Zheng Wang

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering(湖北省多媒体与网络通信工程重点实验室) Institute of Artificial Intelligence(人工智能研究院) School of Computer Science(计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ACM MM 2024. Code is available at https://github.com/Ryann-Ran/Lad

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18332 2025-04-28 cs.CV cs.HC 57%

SSD-Poser: Avatar Pose Estimation with State Space Duality from Sparse Observations

Shuting Zhao, Linxin Bai, Liangjing Shao, Ye Zhang, Xinrong Chen

机构 * Academy for Engineering & Technology, Fudan University(复旦大学工程与技术学院) College of Vocational and Technical Teacher Education, Shanghai Polytechnic University(上海理工大学职业技术与教师教育学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 9 pages, 6 figures, conference ICMR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16874 2025-04-28 cs.CV 57%

CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild

Xingqun Qi, Hengyuan Zhang, Yatian Wang, Jiahao Pan, Chen Liu, Peng Li, Xiaowei Chi, Mengfei Li, Wei Xue, Shanghang Zhang, Wenhan Luo, Qifeng Liu, Yike Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments After the submission of the paper, we realized that the study still has room for expansion. In order to make the research findings more profound and comprehensive, we have decided to withdraw the paper so that we can conduct further research and expansion

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17234 2025-04-25 cs.CV 57%

Scene Perceived Image Perceptual Score (SPIPS): combining global and local perception for image quality assessment

Zhiqiang Lao, Heather Yu

机构 * Futurewei Technologies Inc(未来科技公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17067 2025-04-25 cs.CV 57%

PPS-Ctrl: Controllable Sim-to-Real Translation for Colonoscopy Depth Estimation

Xinqi Xiong, Andrea Dunn Beltran, Jun Myeong Choi, Marc Niethammer, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21979 2025-04-23 cs.CV 57%

Harmonizing Visual Representations for Unified Multimodal Understanding and Generation

Size Wu, Wenwei Zhang, Lumin Xu, Sheng Jin, Zhonghua Wu, Qingyi Tao, Wentao Liu, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory Research(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) SenseTime Research and Tetras.AI(SenseTime研究部和Tetras.AI) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14606 2025-04-22 cs.CV 57%

MP-Mat: A 3D-and-Instance-Aware Human Matting and Editing Framework with Multiplane Representation

Siyi Jiao, Wenzheng Zeng, Yerong Li, Huayu Zhang, Changxin Gao, Nong Sang, Mike Zheng Shou

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) Show Lab, National University of Singapore(Show实验室,新加坡国立大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00387 2025-04-22 cs.CV 57%

Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse Exploration

Zilong Huang, Jun He, Junyan Ye, Lihan Jiang, Weijia Li, Yiping Chen, Ting Han

机构 * Sun Yat-sen University(中山大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025, 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19204 2025-04-22 cs.CV 57%

Distill Any Depth: Distillation Creates a Stronger Monocular Depth Estimator

Xiankang He, Dongyan Guo, Hongji Li, Ruibo Li, Ying Cui, Chi Zhang

机构 * Zhejiang University of Technology(浙江工业大学) AGI Lab, Westlake University(西湖大学AGI实验室) Lanzhou University(兰州大学) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments project page: https://distill-any-depth-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14548 2025-04-22 cs.CV cs.AI 57%

VGNC: Reducing the Overfitting of Sparse-view 3DGS via Validation-guided Gaussian Number Control

Lifeng Lin, Rongfeng Lu, Quan Chen, Haofan Ren, Ming Lu, Yaoqi Sun, Chenggang Yan, Anke Xue

机构 * Hangzhou Dianzi University(杭州电子科技大学) Intel Labs China(英特尔中国实验室) Lishui University(丽水大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 10 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13172 2025-04-18 cs.IR cs.CL cs.MM 57%

SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs

Haoxuan Li, Yi Bin, Yunshan Ma, Guoqing Wang, Yang Yang, See-Kiong Ng, Tat-Seng Chua

专题命中 可控生成 :text-to-image(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12245 2025-04-17 cs.CV eess.IV 57%

SIDME: Self-supervised Image Demoiréing via Masked Encoder-Decoder Reconstruction

Xia Wang, Haiyang Sun, Tiantian Cao, Yueying Sun, Min Feng

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12048 2025-04-17 cs.CV 57%

Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM

Zirui Pan, Xin Wang, Yipeng Zhang, Hong Chen, Kwan Man Cheng, Yaofei Wu, Wenwu Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments AAAI 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09887 2025-04-15 cs.CV 57%

Enhanced Semantic Extraction and Guidance for UGC Image Super Resolution

Yiwen Wang, Ying Liang, Yuxuan Zhang, Xinning Chai, Zhengxue Cheng, Yingsheng Qin, Yucai Yang, Rong Xie, Li Song

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07224 2025-04-15 cs.CV 57%

Painting 3D Nature in 2D: View Synthesis of Natural Scenes from a Single Semantic Mask

Shangzan Zhang, Sida Peng, Tianrun Chen, Linzhan Mou, Haotong Lin, Kaicheng Yu, Yiyi Liao, Xiaowei Zhou

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00569 2025-04-15 cs.CV cs.LG 57%

Probing Visual Language Priors in VLMs

Tiange Luo, Ang Cao, Gunhee Lee, Justin Johnson, Honglak Lee

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Project Page: https://vilp-team.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08654 2025-04-14 cs.CV 57%

The Invisible EgoHand: 3D Hand Forecasting through EgoBody Pose Estimation

Masashi Hatano, Zhifan Zhu, Hideo Saito, Dima Damen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏