arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-31 至 2026-03-31 共收录 15 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 15 篇

2603.27115 2026-03-31 cs.CV 79%

SJD-VP: Speculative Jacobi Decoding with Verification Prediction for Autoregressive Image Generation

SJD-VP:带有验证预测的推测雅可比解码

Bingqi Shan, Baoquan Zhang, Xiaochen Qi, Xutao Li, Yunming Ye, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Perceptual Intelligence, Pengcheng Laboratory, Shenzhen(鹏城实验室感知智能研究所)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出SJD-VP,通过利用token概率变化指导采样,提升验证通过率,加速自回归生成并提高图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27199 2026-03-31 cs.CV 77%

Let Triggers Control: Frequency-Aware Dropout for Effective Token Control

让触发器控制:面向频率的Dropout用于有效的标记控制

Junyoung Koh, Hoyeon Moon, Dongha Kim, Seungmin Lee, Sanghyun Park, Min Song

机构 * Yonsei University(延世大学) Onoma AI

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出频率感知Dropout方法,通过分析触发器与上下文的共现关系,提升文本到图像生成中触发器的可控性与个性化能力,无需增加参数或架构修改。

Comments CVPR 2026 P13N: Personalization in Generative AI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG 62%

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02190 2026-03-31 cs.CV cs.AI cs.GR cs.HC cs.LG 62%

Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

Sketch2Colab: 通过可控流蒸馏实现基于草图的多人体动画

Divyanshu Daiya, Aniket Bera

机构 * IDEAS Lab, Department of Computer Science, Purdue University(普渡大学计算机科学系IDEAS实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Sketch2Colab通过可控流蒸馏将故事板风格的2D草图转化为连贯的3D多人体运动,实现对代理、关节、时序和接触的精细控制,实验显示其在约束遵循和感知质量上优于基线方法。

Comments Accepted to CVPR 2026 Main Conference (11 pages, 8 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28605 2026-03-31 cs.CV cs.CY cs.LG 57%

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

Unsafe2Safe: 可控图像匿名化以保障下游效用

Mih Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Unsafe2Safe通过多模态引导的扩散编辑实现图像隐私保护,减少敏感信息并保持下游任务性能。

Comments Accepted at CVPR 2026 and CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV 57%

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV 57%

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27666 2026-03-31 cs.CV 57%

Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

门控条件注入无需多模态注意:迈向可控的线性注意变换器

Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于线性注意架构的可控扩散模型,解决现有方法在多类型条件输入灵活性和收敛速度上的不足,通过统一门控条件模块实现高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27513 2026-03-31 cs.CV cs.AI 57%

Understanding Semantic Perturbations on In-Processing Generative Image Watermarks

理解生成图像水印在处理过程中的语义扰动

Anirudh Nakra, Min Wu

机构 * University of Maryland, College Park, MD, USA(马里兰大学帕克分校)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 研究探讨了生成图像水印在处理过程中对语义扰动的鲁棒性,提出多阶段框架进行系统压力测试,发现语义编辑会显著降低水印检测能力,揭示当前水印评估存在的关键缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27206 2026-03-31 cs.CV 57%

Make It Up: Fake Images, Real Gains in Generalized Few-shot Semantic Segmentation

让它补上:假图像,真实增益在通用少样本语义分割中

Guohuan Xie, Xin He, Dingying Fan, Le Zhang, Ming-Ming Cheng, Yun Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Syn4Seg框架,通过生成增强方法提升通用少样本语义分割的新型类别覆盖和伪标签质量,实验显示在PASCAL-5i和COCO-20i上实现了1-shot和5-shot设置下的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV 57%

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22054 2026-03-31 cs.CV 57%

FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

FontCrafter: 基于元素驱动的高保真艺术字体创作与视觉上下文生成

Wuyang Luo, Chengkai Tan, Chang Ge, Binye Hong, Su Yang, Yongjiu Ma

机构 * Dalian University of Technology(大连理工大学) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学上海市智能信息处理重点实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出FontCrafter框架,通过元素驱动方法生成艺术字体,结合上下文生成策略和轻量级CMA模块,实现高保真纹理与结构重建及灵活风格控制。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05422 2026-03-31 cs.CV 57%

ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成

Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室) Huawei Inc.(华为技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ParaUni通过并行提取多层视觉语言模型特征并结合强化学习动态调整机制,提升统一多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27135 2026-03-31 cs.LG stat.ML 50%

Spectral-Aware Text-to-Time Series Generation with Billion-Scale Multimodal Meteorological Data

具有十亿级多模态气象数据的频谱感知文本到时间序列生成

Shijie Zhang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出MTransformer模型,通过频谱提示生成器实现文本到时间序列的精确语义控制,利用大规模气象数据提升生成质量与跨模态对齐精度。

Comments Accepted By IJCNN 2026 (WCCI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27012 2026-03-31 cs.RO cs.AI 50%

UMI-Underwater: Learning Underwater Manipulation without Underwater Teleoperation

UMI-Underwater:无需水下遥控的学习水下操作

Hao Li, Long Yin Chung, Jack Goler, Ryan Zhang, Xiaochi Xie, Huy Ha, Shuran Song, Mark Cutkosky

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出UMI-Underwater系统,通过自监督数据收集管道自主获取水下抓取示范,并利用基于深度的 affordance 表示将陆地到水下领域差距桥接,提升水下抓取性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏