arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2511.19856 2025-11-26 cs.CV 57%

Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks

时间-视觉语义对齐:一种统一架构,用于从视觉模型中转移空间先验到零样本时间任务

Xiangkai Ma, Han Zhang, Wenzhong Li, Sanglu Lu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 TimeArtist通过时间-视觉语义对齐框架,实现从时间序列到高质量图像生成的跨模态转换,并在零样本时间任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 57%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18277 2025-11-25 cs.CV 57%

Point-to-Point: Sparse Motion Guidance for Controllable Video Editing

点到点:用于可控视频编辑的稀疏运动引导

Yeji Song, Jaehyun Lee, Mijin Koo, JunHoo Lee, Nojun Kwak

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 57%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17450 2025-11-24 cs.CV cs.AI cs.CL 57%

Planning with Sketch-Guided Verification for Physics-Aware Video Generation

基于草图引导验证的物理感知视频生成规划

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) FieldAI Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchVerify通过草图验证和动态轨迹优化提升物理感知视频生成的效率与质量。

Comments website: https://sketchverify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17269 2025-11-24 cs.CV cs.AI 57%

Range-Edit: Semantic Mask Guided Outdoor LiDAR Scene Editing

Range-Edit: 基于语义掩码的户外激光雷达场景编辑

Suchetan G. Uppur, Hemant Kumar, Vaibhav Kumar

机构 * GeoAI4Cities Lab(GeoAI4Cities实验室) IISER Bhopal(印度比哈尔理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Range-Edit通过语义掩码指导生成高质量的激光雷达点云,提升自动驾驶系统的鲁棒性与泛化能力。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16825 2025-11-24 cs.CV cs.AI 57%

WorldGen: From Text to Traversable and Interactive 3D Worlds

WorldGen: 从文本到可遍历和交互的3D世界

Dilin Wang, Hyunyoung Jung, Tom Monnier, Kihyuk Sohn, Chuhang Zou, Xiaoyu Xiang, Yu-Ying Yeh, Di Liu, Zixuan Huang, Thu Nguyen-Phuoc, Yuchen Fan, Sergiu Oprea, Ziyan Wang, Roman Shapovalov, Nikolaos Sarafianos, Thibault Groueix, Antoine Toisoul, Prithviraj Dhar, Xiao Chu, Minghao Chen, Geon Yeong Park, Mahima Gupta, Yassir Azziz, Rakesh Ranjan, Andrea Vedaldi

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 WorldGen通过结合LLM、程序生成和扩散模型,实现从文本到可交互3D世界的自动创建,提升虚拟空间的生成效率与表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02260 2025-11-21 cs.CV 57%

MagicFace: High-Fidelity Facial Expression Editing with Action-Unit Control

MagicFace: 通过动作单元控制实现高保真的面部表情编辑

Mengting Wei, Tuomas Varanka, Xingxun Jiang, Huai-Qian Khor, Guoying Zhao

机构 * Center for Machine Vision and Signal Analysis, Faculty of Information Technology and Electrical Engineering, University of Oulu(机器视觉与信号分析中心,信息科技与电气工程学院,奥卢大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MagicFace通过动作单元控制实现高保真的面部表情编辑,结合扩散模型和ID编码器,能够精细调整表情并保持身份和背景一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13684 2025-11-18 cs.CV cs.LG 57%

Training-Free Multi-View Extension of IC-Light for Textual Position-Aware Scene Relighting

Jiangnan Ye, Jiedong Zhuang, Lianrui Mu, Wenjie Zheng, Jiaqi Hu, Xingze Zou, Jing Wang, Haoji Hu

机构 * College of Information Science(信息科学学院) Electronic Engineering, Zhejiang University, Hangzhou, 310027, Zhejiang, China(电子工程系,浙江大学,杭州,310027,浙江,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Submitting for Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13191 2025-11-18 cs.CV 57%

Birth of a Painting: Differentiable Brushstroke Reconstruction

Ying Jiang, Jiayin Lu, Yunuo Chen, Yumeng He, Kui Wu, Yin Yang, Chenfanfu Jiang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26196 2025-11-18 cs.CV 57%

Sketch2PoseNet: Efficient and Generalized Sketch to 3D Human Pose Prediction

Li Wang, Yiyu Zhuang, Yanwen Wang, Xun Cao, Chuan Guo, Xinxin Zuo, Hao Zhu

机构 * Nanjing University(南京大学) Snap Inc.(Snap公司) Concordia University(Concordia大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19946 2025-11-18 cs.CV 57%

SCALAR: Scale-wise Controllable Visual Autoregressive Learning

Ryan Xu, Dongyang Jin, Yancheng Bai, Rui Lan, Xu Duan, Lei Sun, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15095 2025-11-18 cs.CV 57%

VistaDepth: Improving far-range Depth Estimation with Spectral Modulation and Adaptive Reweighting

Mingxia Zhan, Li Zhang, Yingjie Wang, Xiaomeng Chu, Beibei Wang, Yanyong Zhang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12030 2025-11-18 cs.CV 57%

VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation

Jun Zhou, Chi Xu, Kaifeng Tang, Yuting Ge, Tingrui Guo, Li Cheng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 14 pages, 9 figures, extended version of the AAAI 2026 paper "VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06421 2025-11-18 cs.CV cs.AI cs.LG 57%

Using Self-Supervised Auxiliary Tasks to Improve Fine-Grained Facial Representation

Mahdi Pourmirzaei, Gholam Ali Montazer, Farzaneh Esmaili

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18959 2025-11-17 cs.CV 57%

Generative AI in Map-Making: A Technical Exploration and Its Implications for Cartographers

Claudio Affolter, Sidi Wu, Yizi Chen, Lorenz Hurni

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10074 2025-11-14 cs.CV cs.SY eess.SY 57%

VLF-MSC: Vision-Language Feature-Based Multimodal Semantic Communication System

Gwangyeon Ahn, Jiwan Seo, Joonhyuk Kang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments To appear in the AI4NextG Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08036 2025-11-12 cs.CV 57%

WEDepth: Efficient Adaptation of World Knowledge for Monocular Depth Estimation

Gongshu Wang, Zhirui Wang, Kan Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01292 2025-11-12 eess.IV cs.AI cs.CV 57%

CoCoLIT: ControlNet-Conditioned Latent Image Translation for MRI to Amyloid PET Synthesis

Alec Sargood, Lemuel Puglisi, James H. Cole, Neil P. Oxtoby, Daniele Ravì, Daniel C. Alexander

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Article accepted at AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06709 2025-11-11 cs.CV 57%

K-Stain: Keypoint-Driven Correspondence for H&E-to-IHC Virtual Staining

Sicheng Yang, Zhaohu Xing, Haipeng Zhou, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18232 2025-11-11 cs.CV 57%

Free-T2M: Robust Text-to-Motion Generation for Humanoid Robots via Frequency-Domain

Wenshuo Chen, Haozhe Jia, Songning Lai, Lei Wang, Yuqi Lin, Hongru Xiao, Lijie Hu, Yutao Yue

机构 * Shandong University(山东大学) Griffith University(格里菲斯大学) Data61/CSIRO Tongji University(同济大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06271 2025-11-11 cs.CV 57%

RelightMaster: Precise Video Relighting with Multi-plane Light Images

Weikang Bian, Xiaoyu Shi, Zhaoyang Huang, Jianhong Bai, Qinghe Wang, Xintao Wang, Pengfei Wan, Kun Gai, Hongsheng Li

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) CPII under InnoHK(创新香港 CPII) Zhejiang University(浙江大学) Dalian University of Technology(大连理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://wkbian.github.io/Projects/RelightMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20358 2025-11-11 cs.CV 57%

PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation

Chen Wang, Chuhao Chen, Yiming Huang, Zhiyang Dou, Yuan Liu, Jiatao Gu, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) HKU(香港大学) HKUST(香港科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09649 2025-11-11 cs.AI cs.CV cs.LG cs.RO 57%

ImitDiff: Transferring Foundation-Model Priors for Distraction Robust Visuomotor Policy

Yuhang Dong, Haizhou Ge, Yupei Zeng, Jiangning Zhang, Beiwen Tian, Hongrui Zhu, Yufei Jia, Ruixiang Wang, Zhucun Xue, Guyue Zhou, Longhua Ma, Guanzhong Tian

机构 * Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Tsinghua University(清华大学) Youtu, Tencent(腾讯优图) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05219 2025-11-10 cs.CV 57%

FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction

Jiang Lin, Xinyu Chen, Song Wu, Zhiqiu Zhang, Jizhi Zhang, Ye Wang, Qiang Tang, Qian Wang, Jian Yang, Zili Yi

机构 * Nanjing University(南京大学) JIUTIAN Research(JIUTIAN研究) University of British Columbia(不列颠哥伦比亚大学) Jilin University(吉林大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13816 2025-11-10 cs.CV 57%

MOSAIC: Generating Consistent, Privacy-Preserving Scenes from Multiple Depth Views in Multi-Room Environments

Zhixuan Liu, Haokun Zhu, Rui Chen, Jonathan Francis, Soonmin Hwang, Ji Zhang, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for AI(博世人工智能中心) Hanyang University(翰阳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08186 2025-11-10 cs.GR 57%

City Street Layout Generation via Conditional Adversarial Learning

Lehao Yang, Cui Zhu, Tian Feng

专题命中 可控生成 :image synthesis(abstract);分类 cs.GR

Comments in Chinese language

Journal ref Bulletin of Science and Technology, 2025, 41(10):83-90+115

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04317 2025-11-07 cs.CV 57%

RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation

Xiangjun Zhang, Litong Gong, Yinglin Zheng, Yansong Liu, Wentao Jiang, Mingyi Xu, Biao Wang, Tiezheng Ge, Ming Zeng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15980 2025-11-07 cs.CV cs.AI 57%

Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization

Cong Wang, Zexuan Deng, Zhiwei Jiang, Yafeng Yin, Fei Shen, Zifeng Cheng, Shiping Ge, Shiwei Gan, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04123 2025-11-07 cs.CV 57%

Text to Sketch Generation with Multi-Styles

Tengjie Li, Shikui Tu, Lei Xu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏