arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2512.08229 2025-12-10 cs.CV cs.RO 57%

Geometry-Aware Sparse Depth Sampling for High-Fidelity RGB-D Depth Completion in Robotic Systems

基于几何的稀疏深度采样用于机器人系统中高保真的RGB-D深度补全

Tony Salloom, Dandi Zhou, Xinhai Sun

机构 * Saisuode (Shanghai) Intelligent Technology Co., Ltd. (Synthoid.ai)(上海思度智能科技有限公司(Synthoid.ai))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于几何的稀疏深度采样方法,利用表面法线估计提升RGB-D深度补全的准确性和现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08215 2025-12-10 cs.CV 57%

Blur2Sharp: Human Novel Pose and View Synthesis with Generative Prior Refinement

Blur2Sharp: 基于生成先验细化的人体新颖姿态与视角合成

Chia-Hern Lai, I-Hsuan Lo, Yen-Ku Yeh, Thanh-Nguyen Truong, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Blur2Sharp通过整合3D感知神经渲染和扩散模型,实现从单一视角生成清晰且几何一致的新视角图像,提升复杂场景下的姿态与视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 57%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01254 2025-12-09 cs.CV 57%

EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation

EmojiDiff: 高精度面部表情控制与高保真身份保持在肖像生成中

Liangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EmojiDiff通过解耦训练和微调方法,实现了高精度面部表情控制与高保真身份保持的端到端肖像生成解决方案。

Comments accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18405 2025-12-09 cs.CV cs.LG 57%

Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows

Iwin Transformer:基于交错窗口的分层视觉Transformer

Simin Huo, Ning Li

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 Iwin Transformer通过交错窗口注意力和深度可分离卷积实现无位置嵌入的分层视觉Transformer,提升图像分类、语义分割和视频动作识别等任务的性能。

Comments 17 pages, 12 figures, Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence. Add additional video experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13558 2025-12-09 cs.CV 57%

X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability

X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成

Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。

Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10339 2025-12-09 cs.CV 57%

Towards Unsupervised Domain Bridging via Image Degradation in Semantic Segmentation

通过图像退化实现无监督领域桥接的语义分割方法

Wangkai Li, Rui Sun, Huayu Mai, Tianzhu Zhang

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DiDA通过图像退化构建中间领域并补偿语义偏移,提升语义分割在不同领域间的适应性能。

Comments Accepted by Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05557 2025-12-08 cs.CV cs.AI 57%

2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency

2K角色-10K故事:一个具有解耦控制和序列一致性的质量门控风格化叙事数据集

Xingxi Yin, Yicheng Li, Gong Yan, Chenglin Li, Jian Zhao, Cong Huang, Yue Deng, Yin Zhang

机构 * Zhejiang University(浙江大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出2K-Characters-10K-Stories数据集,通过解耦控制和质量门控机制,实现高质量的风格化叙事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2025-12-05 cs.CV 57%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments Project Page: https://19reborn.github.io/Bullet4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04534 2025-12-05 cs.CV 57%

Refaçade: Editing Object with Given Reference Texture

Refaçade: 基于给定参考纹理的物体编辑

Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Jianan Wang, Rong Xiao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Refaçade通过纹理去除和局部纹理统计增强,实现精确可控的物体纹理迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03510 2025-12-04 cs.CV cs.RO 57%

CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving

CSMapping: 可扩展的众包语义制图与拓扑推断用于自动驾驶

Zhijian Qiao, Zehuan Yu, Tong Li, Chih-Chung Chou, Wenchao Ding, Shaojie Shen

机构 * the Department of Electronic and Computer Engineering, the Hong Kong University of Science and Technology, Hong Kong, China(电子与计算机工程系,香港科技大学,香港,中国) the Academy for Engineering and Technology, Fudan University, Shanghai, China(工程与技术学院,复旦大学,上海,中国) Zhuoyu Technology Co., Ltd., Shenzhen, China(珠海优创科技有限公司,深圳,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CSMapping通过潜在扩散模型和拓扑优化方法,实现高质量的语义地图和道路中心线生成,适用于自动驾驶场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03345 2025-12-04 cs.CV cs.AI 57%

HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration

HalluGen: 合成逼真且可控的幻觉以评估图像修复

Seunghoi Kim, Henry F. J. Tregidgo, Chen Jin, Matteo Figini, Daniel C. Alexander

机构 * Hawkes Institute, UCL(UCL哈维斯研究所) Dept. of Medical Physics and Biomedical Engineering, UCL(UCL医学物理与生物医学工程系) Dept. of Computer Science, UCL(UCL计算机科学系) Centre for AI, DS&AI, AstraZeneca, UK(阿斯利康AI中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HalluGen 通过合成逼真可控的幻觉,构建首个大规模幻觉数据集,用于评估图像修复中的幻觉检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02972 2025-12-03 cs.CV cs.RO 57%

BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection

BEVDilation:以LiDAR为中心的多模态融合用于3D目标检测

Guowen Zhang, Chenhang He, Liyi Chen, Lei Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BEVDilation提出以LiDAR为中心的多模态融合方法,通过稀疏体素扩张和语义引导BEV扩张模块提升3D目标检测性能,有效缓解深度误差带来的空间错位问题。

Comments Accept by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01686 2025-12-02 cs.CV 57%

DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models

DreamingComics: 通过主体和布局定制生成实现故事可视化管道

Patrick Kwon, Chen Chen

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamingComics通过结合视频模型和布局生成技术,实现了基于主体和布局定制的高效故事可视化方法,提升了角色一致性和风格相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12170 2025-12-02 cs.CV cs.AI 57%

Rethinking Multimodal Point Cloud Completion: A Completion-by-Correction Perspective

重新思考多模态点云补全:一种补全-修正视角

Wang Luo, Di Wu, Hengyuan Na, Yinlin Zhu, Miao Hu, Guocong Quan

机构 * Wang Luo, Di Wu, Hengyuan Na, Yinlin Zhu, Miao Hu, Guocong Quan(作者)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 PGNet通过补全-修正范式,结合多阶段框架和双特征编码,实现更鲁棒的点云补全,提升重建精度与结构一致性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22643 2025-12-02 cs.CV 57%

SPIRAL: Semantic-Aware Progressive LiDAR Scene Generation and Understanding

SPIRAL: 基于语义的渐进式LiDAR场景生成与理解

Dekai Zhu, Yixuan Hu, Youquan Liu, Dongyue Lu, Lingdong Kong, Slobodan Ilic

机构 * Technical University of Munich(慕尼黑技术大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Spiral提出了一种基于范围视图的LiDAR扩散模型,能够同时生成深度、反射图像和语义地图,实现高效的3D场景生成与理解。

Comments NeurIPS 2025; 24 pages, 10 figures, 9 tables; Code at https://github.com/worldbench/SPIRAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07247 2025-12-02 eess.IV cs.CV cs.LG 57%

GuideGen: A Text-Guided Framework for Paired Full-torso Anatomy and CT Volume Generation

GuideGen: 一种基于文本引导的完整躯干解剖和CT体积生成框架

Linrui Dai, Rongzhao Zhang, Yongrui Yu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GuideGen通过文本引导生成完整躯干解剖和CT体积,提升医学影像数据合成效率与质量。

Comments accepted as AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00355 2025-12-02 cs.CV 57%

SMamDiff: Spatial Mamba for Stochastic Human Motion Prediction

SMamDiff: 基于空间Mamba的随机人体运动预测

Junqiao Fan, Pengfei Liu, Haocong Rao

机构 * School of Computer Science, Nanyang Technological University(计算机科学学院,南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SMamDiff通过空间Mamba和余数-DCT编码提升随机人体运动预测的时空一致性,实现更高效且准确的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV 57%

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23051 2025-12-01 cs.CV 57%

GOATex: Geometry & Occlusion-Aware Texturing

GOATex: 几何与遮挡感知纹理生成

Hyunjin Kim, Kunho Kim, Adam Lee, Wonkwang Lee

机构 * KRAFTON AI(KRAFTON人工智能研究院) NC AI(NC人工智能研究院) UC Berkeley(伯克利大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GOATex通过基于命中层级的遮挡感知框架,实现高质量3D网格内外表面纹理生成,无需微调扩散模型,具备结构连贯性与无缝纹理输出。

Comments Accepted to NeurIPS 2025; Project Page: https://goatex3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22991 2025-12-01 cs.CV 57%

Guiding Visual Autoregressive Models through Spectrum Weakening

通过频谱弱化引导视觉自回归模型

Chaoyang Wang, Tianmeng Yang, Jingdong Wang, Yunhai Tong

机构 * Peking University(北京大学) Baidu(百度)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种无需重新训练的频谱弱化框架,用于提升视觉自回归模型的生成质量与条件对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 57%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04931 2025-12-01 cs.CV cs.AI 57%

CzechLynx: A Dataset for Individual Identification and Pose Estimation of the Eurasian Lynx

CzechLynx:用于欧亚猞猁个体识别和姿态估计的数据集

Lukas Picek, Elisa Belotti, Michal Bojda, Ludek Bufka, Vojtech Cermak, Martin Dula, Rostislav Dvorak, Luboslav Hrdy, Miroslav Jirik, Vaclav Kocourek, Josefa Krausova, Jirı Labuda, Jakub Straka, Ludek Toman, Vlado Trulık, Martin Vana, Miroslav Kutal

机构 * Faculty of Applied Sciences, University of West Bohemia in Pilsen, Czechia(西波西米亚大学应用科学学院) Inria, LIRMM, University of Montpellier, France(Inria、LIRMM、蒙彼利埃大学,法国) Faculty of Forestry and Wood Sciences, Czech University of Life Sciences Prague, Czechia(林业与木科学学院,捷克生命科学大学布拉格,捷克) Department of Research and Nature Protection, Šumava National Park Administration, Czechia(研究与自然保护部门,Šumava国家公园管理局,捷克) Department of Forest Ecology, Faculty of Forestry and Wood Technology, Mendel University in Brno, Czechia(森林生态学系,林业与木技术学院,梅德利大学布拉格,捷克) Friends of the Earth Czech Republic, Carnivore Conservation Programme, Czechia(捷克地球之友、食肉动物保护计划,捷克) Center for Machine Perception, Czech Technical University in Prague, Czechia(机器感知中心,布拉格捷克技术大学,捷克)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CzechLynx数据集通过合成图像和生成管道,为欧亚猞猁的个体识别和姿态估计提供了大规模、开放的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22135 2025-12-01 cs.CV 57%

EASL: Multi-Emotion Guided Semantic Disentanglement for Expressive Sign Language Generation

EASL: 多情绪引导的语义解耦用于表达性手语生成

Yanchao Zhao, Jihao Zhu, Yu Liu, Weizhuo Chen, Yuling Yang, Kun Peng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Health and Rehabilitation Sciences(康复科学大学) The University of Aberdeen(阿伯丁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EASL通过多情绪引导的语义解耦架构,提升手语生成的表达性和情感表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07769 2025-12-01 cs.CV 57%

Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation

Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成

Xiaoyan Liu, Kangrui Li, Yuehao Song, Jiaxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学) The University of New South Wales(新南威尔士大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。

Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13911 2025-12-01 cs.CV 57%

GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object Interaction

GraspDiffusion: 合成逼真的全身手-物体交互

Patrick Kwon, Chen Chen, Hanbyul Joo

机构 * University of Central Florida(中央佛罗里达大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GraspDiffusion通过结合身体和手姿态的生成先验知识,生成逼真的全身手-物体交互场景,优于现有方法。

Comments Paper has been accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21043 2025-11-27 cs.CV 57%

PG-ControlNet: A Physics-Guided ControlNet for Generative Spatially Varying Image Deblurring

PG-ControlNet:一种用于生成空间变化图像去模糊的物理引导ControlNet

Hakki Motorcu, Mujdat Cetin

机构 * 1 Computer Science Department, University of Rochester 2 Goergen Institute for Data Science \& AIS, University of Rochester Computer Engineering Department, University of Rochester

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PG-ControlNet通过结合物理约束与生成模型,提升空间变化图像去模糊的物理准确性和感知真实感。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20784 2025-11-27 cs.CV 57%

One Patch is All You Need: Joint Surface Material Reconstruction and Classification from Minimal Visual Cues

一个补丁就够了:从最小的视觉线索联合表面材料重建与分类

Sindhuja Penchala, Gavin Money, Gabriel Marques, Samuel Wood, Jessica Kirschman, Travis Atkison, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 SMARC通过单个补丁实现表面材料重建与分类,以应对稀疏视觉输入下的挑战,取得最佳性能。

Comments 9 pages,3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20563 2025-11-26 cs.CV 57%

A Reason-then-Describe Instruction Interpreter for Controllable Video Generation

用于可控视频生成的指令解释器

Shengqiong Wu, Weicai Ye, Yuanxing Zhang, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Hao Fei, Tat-Seng Chua

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。

Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19919 2025-11-26 cs.CV 57%

HybriDLA: Hybrid Generation for Document Layout Analysis

HybriDLA:文档布局分析的混合生成

Yufan Chen, Omar Moured, Ruiping Liu, Junwei Zheng, Kunyu Peng, Jiaming Zhang, Rainer Stiefelhagen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HybriDLA通过结合扩散和自回归解码,实现文档布局分析的高精度区域预测,达到83.5%的mAP性能。

Comments Accepted by AAAI 2026 (Oral). Project page at https://yufanchen96.github.io/projects/HybriDLA

详情

展开后加载摘要…

URL PDF HTML 收藏