arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2404.01959 2024-04-09 cs.CV cs.CR cs.LG 70%

Bi-LORA: A Vision-Language Approach for Synthetic Image Detection

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdenour Hadid, Abdelmalik Taleb-Ahmed

专题命中 个性化与一致性 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01207 2024-04-09 cs.CV 70%

Towards a Simultaneous and Granular Identity-Expression Control in Personalized Face Generation

Renshuai Liu, Bowen Ma, Wei Zhang, Zhipeng Hu, Changjie Fan, Tangjie Lv, Yu Ding, Xuan Cheng

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10701 2024-03-19 cs.CV 70%

IMPRINT: Generative Object Compositing by Learning Identity-Preserving Representation

Yizhi Song, Zhifei Zhang, Zhe Lin, Scott Cohen, Brian Price, Jianming Zhang, Soo Ye Kim, He Zhang, Wei Xiong, Daniel Aliaga

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06775 2024-03-12 cs.CV 70%

FaceChain-SuDe: Building Derived Class to Inherit Category Attributes for One-shot Subject-Driven Generation

Pengchong Qiao, Lei Shang, Chang Liu, Baigui Sun, Xiangyang Ji, Jie Chen

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01800 2024-03-06 cs.CV 70%

AtomoVideo: High Fidelity Image-to-Video Generation

Litong Gong, Yiran Zhu, Weijie Li, Xiaoyang Kang, Biao Wang, Tiezheng Ge, Bo Zheng

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Technical report. Page: https://atomo-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11849 2024-02-20 cs.CV 70%

ComFusion: Personalized Subject Generation in Multiple Specific Scenes From Single Image

Yan Hong, Jianfu Zhang

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03775 2023-12-22 cs.CV 70%

FAAC: Facial Animation Generation with Anchor Frame and Conditional Control for Superior Fidelity and Editability

Linze Li, Sunqi Fan, Hengjun Pu, Zhaodong Bing, Yao Tang, Tianzhu Ye, Tong Yang, Liangyu Chen, Jiajun Liang

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09109 2023-12-15 cs.CV cs.AI 70%

VideoLCM: Video Latent Consistency Model

Xiang Wang, Shiwei Zhang, Han Zhang, Yu Liu, Yingya Zhang, Changxin Gao, Nong Sang

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14256 2023-12-15 cs.CV cs.AI 70%

FaceChain: A Playground for Human-centric Artificial Intelligence Generated Content

Yang Liu, Cheng Yu, Lei Shang, Yongyi He, Ziheng Wu, Xingjun Wang, Chao Xu, Haoyu Xie, Weida Wang, Yuze Zhao, Lin Zhu, Chen Cheng, Weitao Chen, Yuan Yao, Wenmeng Zhou, Jiaqi Xu, Qiang Wang, Yingda Chen, Xuansong Xie, Baigui Sun

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments This is an ongoing work that will be consistently refined and improved upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04433 2023-12-08 cs.CV 70%

DreamVideo: Composing Your Dream Videos with Customized Subject and Motion

Yujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan, Zhiheng Liu, Yu Liu, Yingya Zhang, Jingren Zhou, Hongming Shan

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02663 2023-12-07 cs.CV cs.AI 70%

FaceStudio: Put Your Face Everywhere in Seconds

Yuxuan Yan, Chi Zhang, Rui Wang, Yichao Zhou, Gege Zhang, Pei Cheng, Gang Yu, Bin Fu

专题命中 个性化与一致性 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Project homepage: https://icoz69.github.io/facestudio/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00339 2023-11-02 cs.CV stat.ML 70%

Space Narrative: Generating Images and 3D Scenes of Chinese Garden from Text using Deep Learning

Jiaxi Shi1, Hao Hua1

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 8 pages, 5 figures, xArch symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03734 2023-10-06 cs.CV 70%

Leveraging Unpaired Data for Vision-Language Generative Models via Cycle Consistency

Tianhong Li, Sangnie Bhardwaj, Yonglong Tian, Han Zhang, Jarred Barber, Dina Katabi, Guillaume Lajoie, Huiwen Chang, Dilip Krishnan

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07954 2023-09-19 cs.CV 70%

Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation

Shuai Yang, Yifan Zhou, Ziwei Liu, Chen Change Loy

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2023. Project page: https://www.mmlab-ntu.com/project/rerender/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05566 2023-08-21 cs.CV eess.IV 70%

YoloCurvSeg: You Only Label One Noisy Skeleton for Vessel-style Curvilinear Structure Segmentation

Li Lin, Linkai Peng, Huaqing He, Pujin Cheng, Jiewei Wu, Kenneth K. Y. Wong, Xiaoying Tang

专题命中 个性化与一致性 :inpainting(abstract);image synthesis(abstract);分类 cs.CV

Comments 20 pages, 15 figures, MEDIA accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18247 2023-05-31 cs.CV 70%

TaleCrafter: Interactive Story Visualization with Multiple Characters

Yuan Gong, Youxin Pang, Xiaodong Cun, Menghan Xia, Yingqing He, Haoxin Chen, Longyue Wang, Yong Zhang, Xintao Wang, Ying Shan, Yujiu Yang

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Github repository: https://github.com/VideoCrafter/TaleCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18286 2023-05-30 cs.CV cs.AI 70%

Photoswap: Personalized Subject Swapping in Images

Jing Gu, Yilin Wang, Nanxuan Zhao, Tsu-Jui Fu, Wei Xiong, Qing Liu, Zhifei Zhang, He Zhang, Jianming Zhang, HyunJoon Jung, Xin Eric Wang

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14522 2023-05-25 cs.CV 70%

Design a Delicious Lunchbox in Style

Yutong Zhou

专题命中 个性化与一致性 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by WiCV @CVPR2023 (In Progress). Dataset: https://github.com/Yutong-Zhou-cv/Bento800_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11337 2023-05-22 cs.CV 70%

RoomDreamer: Text-Driven 3D Indoor Scene Synthesis with Coherent Geometry and Texture

Liangchen Song, Liangliang Cao, Hongyu Xu, Kai Kang, Feng Tang, Junsong Yuan, Yang Zhao

专题命中 个性化与一致性 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Video results: https://youtu.be/p4xgwj4QJcQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10562 2023-05-04 cs.CL cs.CV 70%

Character-Aware Models Improve Visual Text Rendering

Rosanne Liu, Dan Garrette, Chitwan Saharia, William Chan, Adam Roberts, Sharan Narang, Irina Blok, RJ Mical, Mohammad Norouzi, Noah Constant

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08465 2022-10-25 cs.CV cs.CL 70%

Character-Centric Story Visualization via Visual Planning and Token Alignment

Hong Chen, Rujun Han, Te-Lin Wu, Hideki Nakayama, Nanyun Peng

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments accepted by EMNLP2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.09855 2022-07-21 cs.CV cs.AI 70%

Everything is There in Latent Space: Attribute Editing and Attribute Style Manipulation by StyleGAN Latent Space Exploration

Rishubh Parihar, Ankit Dhiman, Tejan Karmali, R. Venkatesh Babu

专题命中 个性化与一致性 :image generation(abstract);image editing(abstract);分类 cs.CV

Comments Project page: https://sites.google.com/view/flamelatentediting

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.15334 2022-03-30 cs.CV 70%

AnyFace: Free-style Text-to-Face Synthesis and Manipulation

Jianxin Sun, Qiyao Deng, Qi Li, Muyi Sun, Min Ren, Zhenan Sun

专题命中 个性化与一致性 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.01286 2016-11-08 cs.CV 70%

Incorporating long-range consistency in CNN-based texture generation

G. Berger, R. Memisevic

专题命中 个性化与一致性 :image generation(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12583 2026-07-23 cs.DC 版本更新 67%

Scaling Synthetic-Image Pre-Training for Federated Fine-Tuning of Large Vision Models

扩展用于大型视觉模型联邦微调的合成图像预训练

Qianpiao Ma, Xiaozhu Song, Junlong Zhou, Yue Zeng, Jianchun Liu, Huaqing Tu

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

AI总结 研究针对联邦微调中资源限制、系统异构性和非IID数据等挑战,提出统一框架FeDiSyn。通过缩放定律、基于扩散的合成图像生成及贡献感知LoRA配置和带宽分配算法,减少训练时间和通信成本,提升训练和准确率。

Comments This paper has been accepted by International Conference on Parallel Processing (ICPP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09303 2026-06-24 cs.LG cs.NA math.NA 版本更新 67%

Stabilizing Physics-Informed Consistency Models via Structure-Preserving Training

通过保结构训练稳定物理信息一致性模型

Che-Chia Chang, Chen-Yang Dai, Te-Sheng Lin, Ming-Chih Lai, Chieh-Hsin Lai

机构 * Institute of Artificial Intelligence Innovation(人工智能创新研究所) National Yang Ming Chiao Tung University(国立阳明交通大学) Department of Applied Mathematics(应用数学系) National Center for Theoretical Sciences(理论科学研究中心) National Taiwan University(国立台湾大学)

专题命中 个性化与一致性 :diffusion(abstract);inpainting(abstract)

AI总结 提出物理信息一致性建模框架,通过保结构两阶段训练策略和两步残差目标,解决物理约束下一致性训练的不稳定性,实现快速、高保真的PDE求解。

Comments Accepted to KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22448 2026-05-22 cs.AI 67%

S2ED: From Story to Executable Descriptions for Consistency-Aware Story Illustration

S2ED:从故事到可执行描述以实现一致性感知的故事插图

Sijing Yin, Jiamou Liu, Xiao Tang, Yaser Shakib, Qian Liu

机构 * University of Auckland(奥克兰大学) Wuhan College of Communication(武汉通信学院)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract)

AI总结 本文提出S2ED框架,通过将完整故事转换为可编辑的可执行描述,提升故事插图的一致性和角色真实性,适用于多帧故事插图的长时程一致性需求。

Comments 6 pages, 5 figures. Accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18831 2026-04-22 cs.GR cs.AI cs.CV cs.LG cs.MM 67%

Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters

Text Slider: 一种高效且即插即用的连续概念控制框架,通过LoRA适配器实现图像/视频合成

Pin-Yen Chiu, I-Sheng Fang, Jun-Cheng Chen

机构 * Research Center for Information Technology Innovation, Academia Sinica(学术院信息科技创新研究中心)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 Text Slider通过LoRA适配器在预训练文本编码器中识别低秩方向,实现图像和视频合成中的连续概念控制,提升效率并减少训练时间和GPU内存消耗。

Comments Accepted by WACV 2026. We provide more experimental results on the train-free version of our algorithm. Project page: https://textslider.github.io/ Code: https://github.com/aiiu-lab/TextSlider

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05183 2026-03-06 eess.IV 67%

Limited-Angle CT Reconstruction Using Multi-Volume Latent Consistency Model

有限角度CT重建使用多体积潜在一致性模型

Hinako Isogai, Naruki Murahashi, Mitsuhiro Nakamura, Megumi Nakao

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

AI总结 本研究提出多体积潜在扩散模型,用于有限角度CT重建,实现高精度图像生成和不同成像条件下的稳定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15711 2025-11-27 cs.AI q-bio.NC 67%

Semi-supervised Multimodal Representation Learning through a Global Workspace

通过全局工作空间实现半监督多模态表示学习

Benjamin Devillers, Léopold Maytié, Rufin VanRullen

机构 * CerCo, CNRS UMR 5549, Université de Toulouse and ANITI, Artificial and Natural Intelligence Toulouse Institute(CerCo、CNRS UMR 5549、图卢兹大学和ANITI人工智能与自然智能图卢兹研究所)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract)

AI总结 本文提出了一种受全局工作空间概念启发的神经网络架构,通过自监督学习实现多模态表示对齐与转换,显著减少对匹配数据的需求。

Comments Under review

Journal ref IEEE Transactions on Neural Networks and Learning Systems 36 (5), 7843-7857 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏