arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-10 至 2026-03-10 共收录 146 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2508.11952 2026-03-10 cs.CV 57%

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

UniUGG: 通过几何-语义编码实现统一的3D理解与生成

Yueming Xu, Jiahui Zhang, Ze Huang, Yurui Chen, Yanpeng Zhou, Zhenyu Chen, Yu-Jie Yuan, Pengxiang Xia, Guowei Huang, Xinyue Cai, Zhongang Qi, Xingyue Quan, Jianye Hao, Hang Xu, Li Zhang

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06672 2026-03-10 cs.CV cs.AI 57%

Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study

语义噪声初始化能否从图像迁移到视频?一项配对诊断研究

Yixiao Jing, Chaoyu Zhang, Zixuan Zhong, Peizhou Huang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究探讨了语义噪声初始化在文本到视频生成中的有效性,发现其在时间相关维度有小幅度提升,但整体效果与基线相当,建议采用提示级评估和噪声空间分析作为标准方法。

Comments 8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17908 2026-03-10 cs.CV cs.AI cs.LG 57%

ReDepth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

ReDepth Anything: 通过自监督重照明进行测试时深度细化

Ananta R. Bhattarai, Helge Rhodin

机构 * Bielefeld University(比勒菲尔德大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。

Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11364 2026-03-10 cs.RO 56%

ActivePose: Active 6D Object Pose Estimation and Tracking for Robotic Manipulation

ActivePose: 用于机器人操作的主动6D物体姿态估计与跟踪

Sheng Liu, Zhe Li, Weiheng Wang, Han Sun, Heng Zhang, Hongpeng Chen, Yusen Qin, Arash Ajoudani, Yizhao Wang

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工大学) Shanghai Jiao Tong University(上海交通大学) Istituto Italiano di Tecnologia(意大利理工学院) The Hong Kong Polytechnic University(香港理工大学) D-Robotics(D-机器人)

专题命中 可控生成 :diffusion(abstract,comments)

AI总结 ActivePose通过结合视觉-语言模型与机器人想象力,实现主动6D物体姿态估计与跟踪,提升机器人操作的可靠性。

Comments 6D Pose, Diffusion Policy, Robot Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01587 2026-03-10 math.NA cs.NA math.OC 50%

The State-Dependent Riccati Equation in Nonlinear Optimal Control: Analysis, Error Estimation and Numerical Approximation

非线性最优控制中的状态依赖性里卡蒂方程:分析、误差估计与数值近似

Luca Saluzzi

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了非线性最优控制中状态依赖性里卡蒂方程的理论分析、误差估计及数值近似方法,提出最优半线性分解策略并评估了两种数值方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06831 2026-03-10 cs.RO math.OC 50%

Learning-Based Robust Control: Unifying Exploration and Distributional Robustness for Reliable Robotics via Free Energy

基于学习的鲁棒控制:通过自由能统一探索与分布鲁棒性以实现可靠的机器人控制

Hozefa Jesawada, Giovanni Russo, Abdalla Swikir, Fares Abu-Dakka

机构 * Mechanical Engineering Program, New York University Abu Dhabi(纽约大学阿布扎赫尔分校机械工程项目) Department of Information and Electrical Engineering & Applied Mathematics, University of Salerno(萨勒诺大学信息与电气工程及应用数学系) Mohammed bin Zayed University for Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于自由能原理的鲁棒控制方法,通过联合学习环境动态和奖励,提升机器人在真实环境中的鲁棒性和可重复操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2603.07441 2026-03-10 cs.CV 83%

DogWeave: High-Fidelity 3D Canine Reconstruction from a Single Image via Normal Fusion and Conditional Inpainting

DogWeave: 通过法线融合与条件修复从单张图像实现高保真3D犬只重建

Shufan Sun, Chenchen Wang, Zongfu Yu

机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 DogWeave通过法线融合与条件修复技术,从单张图像实现高保真3D犬只重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19736 2026-03-10 cs.CV 57%

InfScene-SR: Arbitrary-Size Image Super-Resolution via Iterative Joint-Denoising

InfScene-SR: 通过迭代联合去噪实现任意尺寸图像超分辨率

Shoukun Sun, Zhe Wang, Xiang Que, Jiyin Zhang, Xiaogang Ma

机构 * Synthesis (NCEAS),\ of California Santa Barbara, Santa Barbara, California, USA College of Computer Forestry University, China

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 InfScene-SR通过迭代联合去噪方法,实现了任意尺寸图像的高保真超分辨率,解决了传统方法在处理大尺度场景时的边界伪影问题,并提升了语义分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 6 篇

2603.08228 2026-03-10 cs.CV 79%

GarmentPainter: Efficient 3D Garment Texture Synthesis with Character-Guided Diffusion Model

GarmentPainter: 基于字符引导扩散模型的高效3D服装纹理合成

Jinbo Wu, Xiaobo Gao, Xing Liu, Chen Zhao, Jialun Liu

机构 * Baidu Inc.(百度公司) TeleAI

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 GarmentPainter通过基于字符引导的扩散模型,实现了高效且高质量的3D服装纹理合成,提升了纹理生成的灵活性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07540 2026-03-10 cs.CV cs.AI 74%

How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation

统一多模态模型能可靠生成图像多长?通过上下文筛选驯服长周期交错图像生成

Haoyu Chen, Qing Liu, Yuqian Zhou, He Zhang, Zhaowen Wang, Mengwei Ren, Jingjing Ren, Xiang Wang, Zhe Lin, Lei Zhu

机构 * The Hong Kong University of Science(香港科学与技术大学) Adobe Research(Adobe研究) Huazhong University of Science(华中科技大学)

专题命中 个性化与一致性 :image generation(title);分类 cs.CV

AI总结 本研究提出UniLongGen,通过动态筛选模型记忆以提升长周期图像生成的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07543 2026-03-10 cs.CV cs.MM 73%

CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware Quantization

CONSTANT:通过补丁对比增强和风格感知量化实现高质量单次手写生成

Anh-Duy Le, Van-Linh Pham, Thanh-Nam Vo, Xuan Toan Mai, Tuan-Anh Tran

机构 * Viettel Artificial Intelligence and Data Services Center(越南 Viettel 人工智能与数据服务中心) Ho Chi Minh City University of Technology(胡志明市技术大学)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 CONSTANT通过补丁对比增强和风格感知量化,实现高质量单次手写生成,有效提升图像细节与风格适应性。

Comments Accepted as oral presentation at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18734 2026-03-10 cs.CV cs.AI 70%

Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion

Yo'City:通过自批评扩展实现个性化和无边界的3D逼真城市场景生成

Keyang Lu, Sifan Zhou, Hongbin Xu, Gang Xu, Zhifei Yang, Yikai Wang, Zhen Xiao, Jieyi Long, Ming Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beihang University(北航) Southeast University(东南大学) ByteDance Seed(字节跳动种子) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) Beijing Normal University(北京师范大学) Theta Labs(Theta实验室)

专题命中 个性化与一致性 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Yo'City通过自批评扩展实现个性化和无边界的3D城市生成,利用大模型的推理能力提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08445 2026-03-10 cs.CV 57%

Alfa: Attentive Low-Rank Filter Adaptation for Structure-Aware Cross-Domain Personalized Gaze Estimation

Alfa: 用于结构感知跨域个性化眼动估计的注意力低秩滤波适应

He-Yen Hsieh, Wei-Te Mark Ting, H. T. Kung

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Alfa通过重新加权预训练滤波器中的语义模式,实现结构感知的跨域个性化眼动估计,有效提升模型性能。

Comments 21 pages, 16 figures, AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20989 2026-03-10 cs.CV 57%

Cycle-Consistent Tuning for Layered Image Decomposition

循环一致性调谐用于分层图像分解

Zheng Gu, Min Lu, Zhida Sun, Dani Lischinski, Daniel Cohen-Or, Hui Huang

机构 * Shenzhen University(深圳大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于循环一致性调谐的图像分解框架,通过轻量级LoRA适应和双向监督提升分层分离的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026. Project page: https://vcc.tech/research/2026/ImgDecom

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2409.16990 2026-03-10 cs.CV 57%

Single Image, Any Face: Generalisable 3D Face Generation

单张图像,任意人脸:可泛化的3D人脸生成

Wenqing Wang, Haosen Yang, Josef Kittler, Xiatian Zhu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Gen3D-Face模型,通过单张无约束图像生成逼真的3D人脸,解决了现有方法在泛化能力上的不足,并在跨域和域内设置中均取得优异表现。

Comments Accepted by Pattern Recognition, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17881 2026-03-10 cs.CV 57%

Deepfake Generation and Detection: A Benchmark and Survey

深度伪造生成与检测:基准与综述

Gan Pei, Jiangning Zhang, Menghan Hu, Zhenyu Zhang, Chengjie Wang, Yunsheng Wu, Guangtao Zhai, Jian Yang, Dacheng Tao

机构 * East China Normal University(华东师范大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Youtu Lab, Tencent(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了深度伪造生成与检测的最新进展,分析了相关技术、数据集及未来研究方向。

Comments This paper has been accepted by ACM Computing Surveys. We closely follow the latest developments in this \href{https://github.com/flyingby/Awesome-Deepfake-Generation-and-Detection}{project}

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11148 2026-03-10 cs.CL cs.AI 50%

Improving the Efficiency of Visually Augmented Language Models

提升视觉增强语言模型的效率

Paula Ontalvilla, Aitor Ormazabal, Gorka Azkune

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心 - Ixa,巴斯克大学)

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文提出BLIND-VALM模型,通过使用CLIP获取的视觉 grounding 文本表示,提升视觉增强语言模型的效率和性能。

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 8 篇

2603.08258 2026-03-10 cs.CV 83%

WaDi: Weight Direction-aware Distillation for One-step Image Synthesis

WaDi:基于权重方向的扩散模型一步图像合成知识蒸馏

Lei Wang, Yang Cheng, Senmao Li, Ge Wu, Yaxing Wang, Jian Yang

专题命中 效率与蒸馏 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 WaDi通过LoRaD方法实现一步扩散模型蒸馏,以更高效的方式生成图像,同时保持高质量输出。

Comments Accepted to CVPR 2026;Code:https://github.com/gudaochangsheng/WaDi

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23681 2026-03-10 cs.CV 79%

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

QuantSparse: 通过模型量化和注意力稀疏化全面压缩视频扩散变换器

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 QuantSparse通过结合模型量化和注意力稀疏化,实现视频扩散变换器的高效压缩,提升性能并减少存储与推理时间。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04016 2026-03-10 cs.CV 79%

S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

S$^2$Q-VDiT: 精确量化视频扩散变换器与显著数据和稀疏令牌蒸馏

Weilun Feng, Haotong Qin, Chuanguang Yang, Xiangqi Li, Han Yang, Yuqi Li, Zhulin An, Libo Huang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 S$^2$Q-VDiT通过显著数据选择和稀疏令牌蒸馏提升视频扩散变换器的量化性能,实现无损压缩和加速推理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07276 2026-03-10 cs.CV cs.LG stat.ML 70%

Variational Flow Maps: Make Some Noise for One-Step Conditional Generation

变分流映射:为一步条件生成引入噪声

Abbas Mammadov, So Takao, Bohan Chen, Ricardo Baptista, Morteza Mardani, Yee Whye Teh, Julius Berner

机构 * University of Oxford(牛津大学) California Institute of Technology(加州理工学院) University of Toronto(多伦多大学) NVIDIA(英伟达公司)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 变分流映射通过学习初始噪声分布,实现单步条件生成,提升逆问题求解效率和样本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07799 2026-03-10 cs.CV cs.RO 57%

MWM: Mobile World Models for Action-Conditioned Consistent Prediction

MWM: 移动世界模型用于动作条件一致预测

Han Yan, Zishang Xiang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07476 2026-03-10 cs.CV 57%

EVLF: Early Vision-Language Fusion for Generative Dataset Distillation

EVLF: 早期视觉-语言融合用于生成数据集蒸馏

Wenqi Cai, Yawen Zou, Guang Li, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(东福冈大学) Hokkaido University(北海道大学) University of Fukui(福井大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EVLF通过早期视觉-语言融合提升生成数据集蒸馏的语义准确性和视觉一致性。

Comments CVPR2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07192 2026-03-10 cs.CV 57%

FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis

FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成

Sungwoong Yune, Suheon Jeong, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10466 2026-03-10 cs.LG cs.AI cs.CR cs.CV 57%

Efficient Semi-Supervised Adversarial Training via Latent Clustering-Based Data Reduction

通过基于潜在聚类的数据减少实现高效的半监督对抗训练

Somrita Ghosh, Yuelin Xu, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全赫尔姆霍兹中心)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于潜在聚类的数据减少方法,有效降低半监督对抗训练的数据和计算需求,同时保持鲁棒性优势。

Comments Shorter version of this work accepted by NextGenAISafety Workshop at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2603.08069 2026-03-10 cs.CV 74%

Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models

利用多模态大语言模型生成合成缺陷图像用于电力线路绝缘子检测

Xuesong Wang, Caisheng Wang

机构 * Department of Electrical and Computer Engineering, Wayne State University(电气与计算机工程系,韦恩州立大学)

专题命中 其他图像生成 :image generation(title);分类 cs.CV

AI总结 利用多模态大语言模型生成合成缺陷图像,提升电力线路绝缘子缺陷识别的准确率和数据效率。

Comments Submitted to Engineering Applications of Artificial Intelligence, Feb. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏