arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2508.03691 2025-08-06 cs.CV cs.RO 57%

La La LiDAR: Large-Scale Layout Generation from LiDAR Data

Youquan Liu, Lingdong Kong, Weidong Yang, Xin Li, Ao Liang, Runnan Chen, Ben Fei, Tongliang Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Preprint; 10 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03690 2025-08-06 cs.CV cs.RO 57%

Veila: Panoramic LiDAR Generation from a Monocular RGB Image

Youquan Liu, Lingdong Kong, Weidong Yang, Ao Liang, Jianxiong Gao, Yang Wu, Xiang Xu, Xin Li, Linfeng Li, Runnan Chen, Ben Fei

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Preprint; 10 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03669 2025-08-06 cs.CV cs.RO 57%

OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World

Katherine Liu, Sergey Zakharov, Dian Chen, Takuya Ikeda, Greg Shakhnarovich, Adrien Gaidon, Rares Ambrus

机构 * Toyota Research Institute(丰田研究院) Woven by Toyota(丰田编织) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 8 pages, 5 figures. This version has typo fixes on top of the version published at ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01650 2025-08-05 cs.CV 57%

StrandDesigner: Towards Practical Strand Generation with Sketch Guidance

Na Zhang, Moran Li, Chengming Xu, Han Feng, Xiaobin Hu, Jiangning Zhang, Weijian Cao, Chengjie Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01152 2025-08-05 cs.CV 57%

LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation

Xinyu Yan, Meijun Sun, Ge-Peng Ji, Fahad Shahbaz Khan, Salman Khan, Deng-Ping Fan

机构 * Tianjin University(天津大学) Tianjin Key Laboratory of Machine Learning(天津机器学习重点实验室) Australian National University(澳大利亚国立大学) Nankai Institute of Advanced Research (SHENZHEN FUTIAN)(南开先进研究院(深圳福田)) Nankai University(南开大学) MBZUAI

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 17 pages, 10 figures, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23309 2025-08-05 cs.CV 57%

PriorFusion: Unified Integration of Priors for Robust Road Perception in Autonomous Driving

Xuewei Tang, Mengmeng Yang, Tuopu Wen, Peijin Jia, Le Cui, Mingshang Luo, Kehua Sheng, Bo Zhang, Diange Yang, Kun Jiang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00698 2025-08-05 cs.CV 57%

Rectifying Magnitude Neglect in Linear Attention

Qihang Fan, Huaibo Huang, Yuang Ai, Ran He

机构 * MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by ICCV2025, highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06957 2025-08-05 cs.CV 57%

GAS: Generative Avatar Synthesis from a Single Image

Yixing Lu, Junting Dong, Youngjoong Kwon, Qin Zhao, Bo Dai, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai AI Laboratory(上海人工智能实验室) Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025; Project Page: https://humansensinglab.github.io/GAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00299 2025-08-04 cs.CV cs.AI cs.RO 57%

Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence

Danzhen Fu, Jiagao Hu, Daiguo Zhou, Fei Wang, Zepeng Wang, Wenhua Liao

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments ICCV 2025 Workshop (HiGen)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23487 2025-08-01 cs.CV cs.RO 57%

Online Estimation of Table-Top Grown Strawberry Mass in Field Conditions with Occlusions

Jinshan Zhen, Yuanyue Ge, Tianxiao Zhu, Hui Zhao, Ya Xiong

机构 * The Intelligent Equipment Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农业林业科学研究院智能装备研究中心) The College of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气与自动化学院) The College of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22003 2025-07-31 cs.CV 57%

See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs

Ziyun Dai, Xiaoqiang Li, Shaohua Zhang, Yuanchen Wu, Jide Li

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by ACM MM25

Journal ref 33rd ACM International Conference on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21371 2025-07-30 cs.CV 57%

Top2Pano: Learning to Generate Indoor Panoramas from Top-Down View

Zitong Zhang, Suranjan Gautam, Rui Yu

机构 * University of Louisville(路易斯维尔大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://top2pano.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21367 2025-07-30 cs.CV 57%

Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation

I-Hsiang Chen, Hua-En Chang, Wei-Ting Chen, Jenq-Neng Hwang, Sy-Yen Kuo

机构 * National Taiwan University(台湾大学) University of Washington(华盛顿大学) Microsoft(微软) Chang Gung University(长庚大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20855 2025-07-29 cs.CV 57%

Compositional Video Synthesis by Temporal Object-Centric Learning

Adil Kaan Akan, Yucel Yemez

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 12+21 pages, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19950 2025-07-29 cs.CV cs.AI 57%

RARE: Refine Any Registration of Pairwise Point Clouds via Zero-Shot Learning

Chengyu Zheng, Jin Huang, Honghua Chen, Mingqiang Wei

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Shenzhen Research Institute, Nanjing University of Aeronautics and Astronautics(南京航空航天大学深圳研究院) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21771 2025-07-29 cs.CV 57%

A Unified Image-Dense Annotation Generation Model for Underwater Scenes

Hongkai Lin, Dingkang Liang, Zhenghao Qi, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments Accepted by CVPR 2025. The code is available at https://github.com/HongkLin/TIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08714 2025-07-29 cs.CV cs.AI 57%

Versatile Multimodal Controls for Expressive Talking Human Animation

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Zixin Zhu, Sanping Zhou, Ming Yang, Le Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) University at Buffalo(布法罗大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ACM MM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06438 2025-07-29 cs.CV 57%

Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning

Maomao Li, Lijian Lin, Yunfei Liu, Ye Zhu, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 19 pages

Journal ref TVCG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19071 2025-07-28 cs.CV 57%

Cross-Subject Mind Decoding from Inaccurate Representations

Yangyang Xu, Bangzhen Liu, Wenqi Shao, Yong Du, Shengfeng He, Tingting Zhu

机构 * The University of Oxford(牛津大学) South China University of Technology(华南理工大学) Shanghai AI Lab(上海人工智能实验室) Ocean University of China(中国海洋大学) Singapore Management University(新加坡管理大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15265 2025-07-28 cs.CV cs.AI cs.CR 57%

Blind Spot Navigation: Evolutionary Discovery of Sensitive Semantic Concepts for LVLMs

Zihao Pan, Yu Tong, Weibin Wu, Jingyi Wang, Lifeng Chen, Zhe Zhao, Jiajia Wei, Yitong Qiao, Zibin Zheng

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments The paper needs major revisions, so it is being withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13807 2025-07-28 cs.CV 57%

MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control

Ruiyuan Gao, Kai Chen, Bo Xiao, Lanqing Hong, Zhenguo Li, Qiang Xu

机构 * CUHK(中文大学) HKUST(香港科技大学) Huawei Cloud(华为云) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025 camera-ready version, Project Website: https://flymin.github.io/magicdrive-v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17388 2025-07-24 cs.CV eess.IV 57%

EndoGen: Conditional Autoregressive Endoscopic Video Generation

Xinyu Liu, Hengyu Liu, Cheng Wang, Tianming Liu, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) University of Georgia(佐治亚大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17083 2025-07-24 cs.CV cs.AI 57%

SDGOCC: Semantic and Depth-Guided Bird's-Eye View Transformation for 3D Multimodal Occupancy Prediction

Zaipeng Duan, Chenxu Dang, Xuzhong Hu, Pei An, Junfeng Ding, Jie Zhan, Yunbiao Xu, Jie Ma

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15728 2025-07-22 cs.CV 57%

TokensGen: Harnessing Condensed Tokens for Long Video Generation

Wenqi Ouyang, Zeqi Xiao, Danni Yang, Yifan Zhou, Shuai Yang, Lei Yang, Jianlou Si, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://vicky0522.github.io/tokensgen-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15064 2025-07-22 cs.CV cs.AI 57%

StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation

Shuyuan Tu, Zhen Xing, Xintong Han, Zhi-Qi Cheng, Qi Dai, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Tencent Inc.(腾讯公司) University of Washington(华盛顿大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2411.17697

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01425 2025-07-22 cs.CV 57%

Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation

Xincheng Shuai, Henghui Ding, Zhenyuan Qin, Hao Luo, Xingjun Ma, Dacheng Tao

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba group(阿里集团 DAMO 院) Hupan Lab(虎派实验室) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.github.io/SynFMC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03021 2025-07-22 cs.CV cs.AI 57%

PEMF-VTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm

Tianyu Chang, Xiaohao Chen, Zhichao Wei, Xuanpu Zhang, Qing-Guo Chen, Weihua Luo, Peipei Song, Xun Yang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) School of Electrical and Information Engineering, Tianjin University(电气与信息工程学院,天津大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01729 2025-07-21 cs.CV 57%

PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth

Bu Jin, Weize Li, Baihan Yang, Zhenxin Zhu, Junpeng Jiang, Huan-ang Gao, Haiyang Sun, Kun Zhan, Hengtong Hu, Xueyang Zhang, Peng Jia, Hao Zhao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Li Auto BAAI(北京人工智能研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at IEEE/RSJ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10059 2025-07-15 cs.CV 57%

RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control

Teng Li, Guangcong Zheng, Rui Jiang, Shuigen Zhan, Tao Wu, Yehao Lu, Yining Lin, Chuanyun Deng, Yepan Xiong, Min Chen, Lin Cheng, Xi Li

机构 * College of Computer Science & Technology, Zhejiang University(浙江大学计算机科学与技术学院) Central Media Technology Institute, 2012 Lab, Huawei(华为2012实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05426 2025-07-09 cs.CV 57%

Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors

Lanqing Guo, Yufei Wang, Hezhen Hu, Yan Zheng, Yeying Jin, Siyu Huang, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snap Research Tencent(腾讯) Clemson University(克莱姆森大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏