arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2502.07685 2025-03-24 cs.CV 57%

Matrix3D: Large Photogrammetry Model All-in-One

Yuanxun Lu, Jingyang Zhang, Tian Fang, Jean-Daniel Nahmias, Yanghai Tsin, Long Quan, Xun Cao, Yao Yao, Shiwei Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025 camera ready. Project Page: https://nju-3dv.github.io/projects/matrix3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06699 2025-03-24 cs.CV 57%

You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale

Baorui Ma, Huachen Gao, Haoge Deng, Zhengxiong Luo, Tiejun Huang, Lulu Tang, Xinlong Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025, Project Page: https://vision.baai.ac.cn/see3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14517 2025-03-20 cs.CV cs.AI 57%

Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control

Hejia Chen, Haoxian Zhang, Shoulong Zhang, Xiaoqiang Liu, Sisi Zhuang, Yuan Zhang, Pengfei Wan, Di Zhang, Shuai Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14272 2025-03-20 cs.CV eess.IV 57%

CTSR: Controllable Fidelity-Realness Trade-off Distillation for Real-World Image Super Resolution

Runyi Li, Bin Chen, Jian Zhang, Radu Timofte

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13265 2025-03-20 cs.CV 57%

FlexWorld: Progressively Expanding 3D Scenes for Flexiable-View Synthesis

Luxi Chen, Zihan Zhou, Min Zhao, Yikai Wang, Ge Zhang, Wenhao Huang, Hao Sun, Ji-Rong Wen, Chongxuan Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14129 2025-03-19 cs.CV 57%

SketchFusion: Learning Universal Sketch Features through Fusing Foundation Models

Subhadeep Koley, Tapas Kumar Dutta, Aneeshan Sain, Pinaki Nath Chowdhury, Ayan Kumar Bhunia, Yi-Zhe Song

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted in CVPR 2025. Project page available at https://subhadeepkoley.github.io/SketchFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13721 2025-03-19 cs.CV 57%

SED-MVS: Segmentation-Driven and Edge-Aligned Deformation Multi-View Stereo with Depth Restoration and Occlusion Constraint

Zhenlong Yuan, Zhidong Yang, Yujun Cai, Kuangxin Wu, Mufan Liu, Dapeng Zhang, Hao Jiang, Zhaoxin Li, Zhaoqi Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02009 2025-03-19 cs.CV 57%

Morpheus: Text-Driven 3D Gaussian Splat Shape and Color Stylization

Jamie Wynn, Zawar Qureshi, Jakub Powierza, Jamie Watson, Mohamed Sayed

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11040 2025-03-19 eess.IV cs.CV 57%

Co-Learning Semantic-aware Unsupervised Segmentation for Pathological Image Registration

Yang Liu, Shi Gu

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 13 pages, 7 figures, published in Medical Image Computing and Computer Assisted Intervention (MICCAI) 2023

Journal ref International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 537-547. Cham: Springer Nature Switzerland, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12450 2025-03-18 cs.CV 57%

LazyMAR: Accelerating Masked Autoregressive Models via Feature Caching

Feihong Yan, Qingyan Wei, Jiayi Tang, Jiajun Li, Yulin Wang, Xuming Hu, Huiqi Li, Linfeng Zhang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19189 2025-03-18 cs.CV 57%

Video Depth without Video Models

Bingxin Ke, Dominik Narnhofer, Shengyu Huang, Lei Ke, Torben Peters, Katerina Fragkiadaki, Anton Obukhov, Konrad Schindler

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: rollingdepth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17048 2025-03-18 cs.CV 57%

PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation

Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, Deng Cai

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17555 2025-03-18 cs.CV 57%

Scribble Hides Class: Promoting Scribble-Based Weakly-Supervised Semantic Segmentation with Its Class Label

Xinliang Zhang, Lei Zhu, Hangzhou He, Lujia Jin, Yanye Lu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11038 2025-03-17 cs.CV 57%

ACMo: Attribute Controllable Motion Generation

Mingjie Wei, Xuemei Xie, Guangming Shi

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02101 2025-03-17 cs.CV 57%

CameraCtrl: Enabling Camera Control for Text-to-Video Generation

Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, Ceyuan Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://hehao13.github.io/projects-CameraCtrl/ Code: https://github.com/hehao13/CameraCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09733 2025-03-14 cs.CV 57%

I2V3D: Controllable image-to-video generation with 3D guidance

Zhiyuan Zhang, Dongdong Chen, Jing Liao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://bestzzhang.github.io/I2V3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10815 2025-03-13 cs.CV cs.AI 57%

Depth Any Video with Scalable Synthetic Data

Honghui Yang, Di Huang, Wei Yin, Chunhua Shen, Haifeng Liu, Xiaofei He, Binbin Lin, Wanli Ouyang, Tong He

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://depthanyvideo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10782 2025-03-13 cs.CV cs.HC 57%

3DArticCyclists: Generating Synthetic Articulated 8D Pose-Controllable Cyclist Data for Computer Vision Applications

Eduardo R. Corral-Soto, Yang Liu, Tongtong Cao, Yuan Ren, Liu Bingbing

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08663 2025-03-12 cs.RO cs.AI cs.CV cs.CY cs.HC 57%

Generating Robot Constitutions & Benchmarks for Semantic Safety

Pierre Sermanet, Anirudha Majumdar, Alex Irpan, Dmitry Kalashnikov, Vikas Sindhwani

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08168 2025-03-12 cs.CV 57%

TSCnet: A Text-driven Semantic-level Controllable Framework for Customized Low-Light Image Enhancement

Miao Zhang, Jun Yin, Pengyu Zeng, Yiqing Shen, Shuai Lu, Xueqian Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07152 2025-03-11 cs.CV 57%

Controllable 3D Outdoor Scene Generation via Scene Graphs

Yuheng Liu, Xinke Li, Yuning Zhang, Lu Qi, Xin Li, Wenping Wang, Chongshou Li, Xueting Li, Ming-Hsuan Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://yuheng.ink/project-page/control-3d-scene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06660 2025-03-11 cs.CV 57%

AxisPose: Model-Free Matching-Free Single-Shot 6D Object Pose Estimation via Axis Generation

Yang Zou, Zhaoshuai Qi, Yating Liu, Zihao Xu, Weipeng Sun, Weiyi Liu, Xingyuan Li, Jiaqi Yang, Yanning Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18150 2025-03-11 cs.CV 57%

Realistic Clothed Human and Object Joint Reconstruction from a Single Image

Ayushi Dutta, Marco Pesavento, Marco Volino, Adrian Hilton, Armin Mustafa

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11925 2025-03-11 cs.AI cs.CV cs.LG 57%

GRAPHGPT-O: Synergistic Multimodal Comprehension and Generation on Graphs

Yi Fang, Bowen Jin, Jiacheng Shen, Sirui Ding, Qiaoyu Tan, Jiawei Han

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06070 2025-03-11 cs.CV 57%

ControlNeXt: Powerful and Efficient Control for Image and Video Generation

Bohao Peng, Jian Wang, Yuechen Zhang, Wenbo Li, Ming-Chang Yang, Jiaya Jia

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments controllable generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04829 2025-03-10 cs.CV cs.AI 57%

StickMotion: Generating 3D Human Motions by Drawing a Stickman

Tao Wang, Zhihua Wu, Qiaozhi He, Jiaming Chu, Ling Qian, Yu Cheng, Junliang Xing, Jian Zhao, Lei Jin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 5 figures, accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18335 2025-03-10 cs.RO cs.AI cs.CV 57%

FloNa: Floor Plan Guided Embodied Visual Navigation

Jiaxin Li, Weiqi Huang, Zan Wang, Wei Liang, Huijun Di, Feng Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04842 2025-03-07 cs.CV 57%

UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving

Rui Chen, Zehuan Wu, Yichen Liu, Yuxin Guo, Jingcheng Ni, Haifeng Xia, Siyu Xia

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05738 2025-03-06 cs.CV 57%

StdGEN: Semantic-Decomposed 3D Character Generation from Single Images

Yuze He, Yanning Zhou, Wang Zhao, Zhongkai Wu, Kaiwen Xiao, Wei Yang, Yong-Jin Liu, Xiao Han

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025. 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02883 2025-03-05 cs.CV 57%

ARINAR: Bi-Level Autoregressive Feature-by-Feature Generative Models

Qinyu Zhao, Stephen Gould, Liang Zheng

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Technical report. Our code is available at https://github.com/Qinyu-Allen-Zhao/Arinar

详情

展开后加载摘要…

URL PDF HTML 收藏