arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-12 至 2026-03-12 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2603.03281 2026-03-12 cs.CV cs.LG 85%

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

CFG-Ctrl: 基于控制的分类器自由扩散引导

Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。

Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10519 2026-03-12 cs.CV 85%

Visually-Guided Controllable Medical Image Generation via Fine-Grained Semantic Disentanglement

通过细粒度语义解耦实现视觉引导的可控医学图像生成

Xin Huang, Junjie Liang, Qingshan Hou, Peng Cao, Jinzhu Yang, Xiaoli Liu, Osmar R. Zaiane

机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,中国沈阳) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,中国沈阳) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,中国沈阳) AiShiWeiLai AI Research, China(艾世维来人工智能研究,中国) Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学艾米人工智能研究所,加拿大埃德蒙顿,阿尔伯塔)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出视觉引导的文本解耦框架,通过细粒度语义解耦提升医学图像生成的可控性和生成质量。

Comments 10 pages, 7 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13702 2026-03-12 cs.CV cs.AI 79%

MVCustom: Multi-View Customized Diffusion via Geometric Latent Rendering and Completion

MVCustom: 通过几何潜在渲染和完成实现多视图定制化扩散

Minjung Shin, Hyunin Cho, Sooyeon Go, Jin-Hwa Kim, Youngjung Uh

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 MVCustom通过几何潜在渲染和完成技术,实现多视图定制化扩散,解决多视图一致性和定制化保真度的统一问题。

Comments ICLR 2026, Project page: https://minjung-s.github.io/mvcustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02182 2026-03-12 q-bio.NC cs.CV cs.LG 79%

Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion

通过互信息引导的扩散模型揭示高级视觉皮层潜在群体的语义选择性

Yule Wang, Joseph Yu, Chengrui Li, Weihan Li, Anqi Wu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 MIG-Vis通过互信息引导的扩散模型揭示高级视觉皮层中神经潜在群体的语义选择性,提供结构化语义表示的直接证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00638 2026-03-12 cs.CV cs.GR 62%

Sketch-Guided Stylized Landscape Cinemagraph Synthesis

草图引导的风格化景观cinemagraph合成

Hao Jin, Hengyuan Chang, Xiaoxuan Xie, Zhengyang Wang, Xusheng Du, Shaojun Hu, Haoran Xie

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Sketch2Cinemagraph通过草图引导生成风格化景观cinemagraph,结合文本提示和运动草图控制,实现连续时间流动的高质量合成。

Comments 16 pages, 18 figures, accepted in Computer and Graphics

Journal ref Computers & Graphics,Volume 135,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10702 2026-03-12 cs.CV 57%

UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations

UniCom: 通过压缩的连续语义表示实现统一多模态建模

Yaqi Zhao, Wang Lin, Zijian Zhang, Miles Yang, Jingyuan Chen, Wentao Zhang, Zhao Zhong, Liefeng Bo

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14552 2026-03-12 cs.CV 57%

OmniVTON++: Training-Free Universal Virtual Try-On with Principal Pose Guidance

OmniVTON++: 无需训练的通用虚拟试衣系统 with 主要姿态引导

Zhaotong Yang, Yong Du, Shengfeng He, Yuhui Li, Xinzhe Li, Yangyang Xu, Junyu Dong, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 OmniVTON++是一种无需训练的通用虚拟试衣系统,通过协调结构化服装变形、主要姿态引导和连续边界缝合,实现跨数据集和服装类型的高性能虚拟试衣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14178 2026-03-12 cs.CV cs.AI 57%

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型

Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。

Comments 29 pages, 9 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏