arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2506.05554 2025-06-09 cs.CV 57%

EX-4D: EXtreme Viewpoint 4D Video Synthesis via Depth Watertight Mesh

Tao Hu, Haoyang Peng, Xiao Liu, Yuewen Ma

机构 * Pico, Bytedance(字节跳动)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05217 2025-06-06 cs.CV 57%

DSG-World: Learning a 3D Gaussian World Model from Dual State Videos

Wenhao Hu, Xuexiang Wen, Xi Li, Gaoang Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学-伊利诺伊大学联合研究所)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04612 2025-06-06 cs.CV 57%

Perfecting Depth: Uncertainty-Aware Enhancement of Metric Depth

Jinyoung Jun, Lei Chu, Jiahao Li, Yan Lu, Chang-Su Kim

机构 * Korea University(韩国大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04606 2025-06-06 cs.CV 57%

SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents

Alexander Huang-Menders, Xinhang Liu, Andy Xu, Yuyao Zhang, Chi-Keung Tang, Yu-Wing Tai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14184 2025-06-06 cs.CV cs.LG 57%

Bayesian SegNet for Semantic Segmentation with Improved Interpretation of Microstructural Evolution During Irradiation of Materials

Marjolein Oostrom, Alex Hagen, Nicole LaHaye, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03191 2025-06-05 cs.CV cs.AI 57%

Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward

Muhammad Islam, Tao Huang, Euijoon Ahn, Usman Naseem

机构 * College of Science and Engineering(科学与工程学院) James Cook University(詹姆斯库克大学) School of Computing(计算学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02697 2025-06-04 cs.CV 57%

LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation

Yuxuan Wu, Le Wang, Sanping Zhou, Mengnan Liu, Gang Hua, Haoxiang Li

机构 * Xi’an Jiaotong University(西安交通大学) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20156 2025-06-04 cs.CV 57%

HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters

Yi Chen, Sen Liang, Zixiang Zhou, Ziyao Huang, Yifeng Ma, Junshu Tang, Qin Lin, Yuan Zhou, Qinglin Lu

机构 * Tencent(腾讯)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20218 2025-06-04 cs.CV 57%

Video Motion Graphs

Haiyang Liu, Zhan Xu, Fa-Ting Hong, Hsin-Ping Huang, Yi Zhou, Yang Zhou

机构 * The University of Tokyo(东京大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 14 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03498 2025-06-04 eess.IV cs.GR 57%

Controllable Satellite-to-Street-View Synthesis with Precise Pose Alignment and Zero-Shot Environmental Control

Xianghui Ze, Zhenbo Song, Qiwei Wang, Jianfeng Lu, Yujiao Shi

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01037 2025-06-03 cs.CV 57%

Self-supervised ControlNet with Spatio-Temporal Mamba for Real-world Video Super-resolution

Shijun Shi, Jing Xu, Lijing Lu, Zhihang Li, Kai Hu

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 10 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00173 2025-06-03 cs.GR cs.RO 57%

MotionPersona: Characteristics-aware Locomotion Control

Mingyi Shi, Wei Liu, Jidong Mei, Wangpok Tse, Rui Chen, Xuelin Chen, Taku Komura

机构 * The University of Hong Kong(香港大学) Shandong University(山东大学) Hong Kong University of Science and Technology(香港科技大学) Adobe Research

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments 15 pages, 13 figures, webpage: https://motionpersona25.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02980 2025-06-02 cs.CV 57%

GPT4Point: A Unified Framework for Point-Language Understanding and Generation

Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23439 2025-05-30 cs.CV 57%

VITON-DRR: Details Retention Virtual Try-on via Non-rigid Registration

Ben Li, Minqi Li, Jie Ren, Kaibing Zhang

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 31 pages, 12 figures, Accepted by Computers & Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23192 2025-05-30 cs.CV cs.AI cs.CR 57%

Fooling the Watchers: Breaking AIGC Detectors via Semantic Prompt Attacks

Run Hao, Peng Ying

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01427 2025-05-29 cs.CV 57%

VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control

Yuanpeng Tu, Hao Luo, Xi Chen, Sihui Ji, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) HUST(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by SIGGRAPH2025 Project page: https://videoanydoor.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20861 2025-05-28 cs.CV 57%

Exploring Timeline Control for Facial Motion Generation

Yifeng Ma, Jinwei Qi, Chaonan Ji, Peng Zhang, Bang Zhang, Zhidong Deng, Liefeng Bo

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025, Project Page: https://humanaigc.github.io/facial-motion-timeline-control/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20814 2025-05-28 cs.RO cs.CV 57%

Spatial RoboGrasp: Generalized Robotic Grasping Control Policy

Yiqi Huang, Travis Davies, Jiahuan Yan, Jiankai Sun, Xiang Chen, Luhui Hu

机构 * Stanford University(斯坦福大学) Peking University(北京大学) ZhiCheng AI(智城AI)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00396 2025-05-28 cs.CV 57%

SPF-Portrait: Towards Pure Text-to-Portrait Customization with Semantic Pollution-Free Fine-Tuning

Xiaole Xian, Zhichao Liao, Qingyu Li, Wenyu Qin, Pengfei Wan, Weicheng Xie, Long Zeng, Linlin Shen, Pingfa Feng

机构 * Shenzhen University(深圳大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19569 2025-05-27 cs.CV 57%

What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation

Jianghang Lin, Yue Hu, Jiangtao Shen, Yunhang Shen, Liujuan Cao, Shengchuan Zhang, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19239 2025-05-27 cs.CV 57%

DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving

Chen Shi, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18650 2025-05-27 cs.CV 57%

ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos

Xiaodong Wang, Peixi Peng

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05721 2025-05-27 cs.CV 57%

Semantic-Space-Intervened Diffusive Alignment for Visual Classification

Zixuan Li, Lei Meng, Guoqing Chao, Wei Wu, Xiaoshuo Yan, Yimeng Yang, Zhuang Qi, Xiangxu Meng

机构 * School of Software, Shandong University(软件学院,山东大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13548 2025-05-27 cs.CV cs.AI 57%

Beyond One-Hot Labels: Semantic Mixing for Model Calibration

Haoyang Luo, Linwei Tao, Minjing Dong, Chang Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17358 2025-05-26 cs.CV 57%

Repurposing Marigold for Zero-Shot Metric Depth Estimation via Defocus Blur Cues

Chinmay Talegaonkar, Nikhil Gandudi Suresh, Zachary Novack, Yash Belhe, Priyanka Nagasamudra, Nicholas Antipa

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17256 2025-05-26 cs.CV 57%

ExpertGen: Training-Free Expert Guidance for Controllable Text-to-Face Generation

Liang Shi, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12199 2025-05-20 cs.CV cs.AI 57%

Always Clear Depth: Robust Monocular Depth Estimation under Adverse Weather

Kui Jiang, Jing Cao, Zhaocheng Yu, Junjun Jiang, Jingchun Zhou

机构 * Harbin Institute of Technology(哈尔滨工业大学) Dalian Maritime University(大连海事大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05530 2025-05-20 cs.RO cs.AI cs.CV 57%

This&That: Language-Gesture Controlled Video Generation for Robot Planning

Boyang Wang, Nikhil Sridhar, Chao Feng, Mark Van der Merwe, Adam Fishman, Nima Fazeli, Jeong Joon Park

机构 * University of Michigan(密歇根大学) University of Washington(华盛顿大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10565 2025-05-16 cs.CV 57%

Depth Anything with Any Prior

Zehan Wang, Siyu Chen, Lihe Yang, Jialei Wang, Ziang Zhang, Hengshuang Zhao, Zhou Zhao

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Home page: https://prior-depth-anything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10405 2025-05-16 eess.IV cs.AI cs.CV cs.LG 57%

Visual Fidelity Index for Generative Semantic Communications with Critical Information Embedding

Jianhao Huang, Qunsong Zeng, Kaibin Huang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(电子与电气工程系,香港大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏