arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2511.09977 2025-11-17 cs.CV 57%

STELLAR: Scene Text Editor for Low-Resource Languages and Real-World Data

Yongdeuk Seo, Hyun-seok Min, Sungchul Choi

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted to AAAI 2026 Workshop (Artificial Intelligence with Biased or Scarce Data)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01278 2025-11-12 cs.CV cs.AI cs.CC cs.LG 57%

fruit-SALAD: A Style Aligned Artwork Dataset to reveal similarity perception in image embeddings

Tillmann Ohm, Andres Karjus, Mikhail Tamm, Maximilian Schich

机构 * Tallinn University(塔林大学)

专题命中 个性化与一致性 :image synthesis(abstract);分类 cs.CV

Journal ref Scientific Data volume 12, 254 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07233 2025-11-11 cs.CV cs.LG 57%

Noise & pattern: identity-anchored Tikhonov regularization for robust structural anomaly detection

Alexander Bauer, Klaus-Robert Müller

机构 * Machine Learning Group, TU Berlin(柏林技术大学机器学习组) BIFOLD, Berlin, Germany(柏林BIFOLD) Dept. of AI, Korea University, Seoul, Republic of Korea(韩国大学人工智能系) MPI for Informatics, Saarbrücken, Germany(信息学Max Planck研究所)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01619 2025-11-05 cs.CV 57%

3DBonsai: Structure-Aware Bonsai Modeling Using Conditioned 3D Gaussian Splatting

Hao Wu, Hao Wang, Ruochong Li, Xuran Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00107 2025-11-04 cs.CV cs.AI cs.IR 57%

AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency

Piyushkumar Patel

机构 * Microsoft(微软)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27364 2025-11-03 cs.CV cs.AI 57%

Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V

Meftun Akarsu, Kerem Catay, Sedat Bin Vedat, Enes Kutay Yarkan, Ilke Senturk, Arda Sar, Dafne Eksioglu

机构 * AI Yapım Hagia Labs Singapore(AI Yapım 赫亚实验室新加坡) AI Engineer Hagia Labs İstanbul(AI工程师 赫亚实验室伊斯坦布尔) Full Stack Engineer Hagia Labs İstanbul(全栈工程师 赫亚实验室伊斯坦布尔) Chief Creator Hagia Labs İstanbul(首席创作者 赫亚实验室伊斯坦布尔)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments video generation, image-to-video, dif- fusion transformer, LoRA, fine-tuning, cinematic scene synthesis, multi-GPU inference, fully sharded data parallelism, computational efficiency

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15743 2025-11-03 cs.CV 57%

SRAGAN: Saliency Regularized and Attended Generative Adversarial Network for Chinese Ink-wash Painting Style Transfer

Xiang Gao, Yuqi Zhang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Pattern Recognition, Volume 162, June 2025, 111344

Journal ref Pattern Recognition, 2025, 162: 111344

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22810 2025-10-28 cs.CV 57%

MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control

Fatemeh Nazarieh, Zhenhua Feng, Diptesh Kanojia, Muhammad Awais, Josef Kittler

机构 * School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音和信号处理中心)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04705 2025-10-28 cs.CV 57%

Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations

Yuji Wang, Moran Li, Xiaobin Hu, Ran Yi, Jiangning Zhang, Han Feng, Weijian Cao, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University, Tencent Youtu Lab(上海交通大学,腾讯云图实验室) Tencent Youtu Lab(腾讯云图实验室) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

Comments ACM Multimedia 2025; code URL: https://github.com/rain152/IPVG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21857 2025-10-28 cs.CV cs.AI 57%

Poisson Flow Consistency Training

Anthony Zhang, Mahmut Gokmen, Dennis Hein, Rongjun Ge, Wenjun Xia, Ge Wang, Jin Chen

机构 * Pratt School of Engineering Duke University(普拉特工程学院 哥伦比亚大学) Biomedical Imaging Center Rensselaer Polytechnic Institute(生物医学成像中心 莱文森理工学院) Department of Computer Science University of Kentucky(计算机科学系 肯塔基大学) Department of Medicine Department of Biomedical Informations University of Alabama at Birmingham(医学系 生物医学信息学系 亚拉巴马大学伯明翰分校) School of Engineering Sciences Department of Physics KTH Royal Institute of Technology(工程科学学院 物理系 瑞典皇家理工学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21696 2025-10-27 cs.CV 57%

BachVid: Training-Free Video Generation with Consistent Background and Character

Han Yan, Xibin Song, Yifu Wang, Hongdong Li, Pan Ji, Chao Ma

机构 * MoE Key Lab of Artificial, AI Institute, Shanghai Jiao Tong University(人工智能研究院,上海交通大学) Vertex Lab(Vertex实验室) Australian National University(澳大利亚国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Project page: https://wolfball.github.io/bachvid

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19193 2025-10-24 cs.CV 57%

Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning

Takehiro Aoshima, Yusuke Shinohara, Byeongseon Park

机构 * LY Corporation(LY公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15277 2025-10-22 cs.CV 57%

Foundation Cures Personalization: Improving Personalized Models' Prompt Consistency via Hidden Foundation Knowledge

Yiyang Cai, Zhengkai Jiang, Yulong Liu, Chunyang Jiang, Wei Xue, Yike Guo, Wenhan Luo

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tencent Hunyuan(腾讯文元)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16332 2025-10-21 cs.CV 57%

TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement

Haiyue Sun, Qingdong He, Jinlong Peng, Peng Tang, Jiangning Zhang, Junwei Zhu, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15194 2025-10-20 cs.CV 57%

Salient Concept-Aware Generative Data Augmentation

Tianchen Zhao, Xuanbai Chen, Zhihua Li, Jun Fang, Dongsheng An, Xiang Xu, Zhuowen Tu, Yifan Xing

机构 * AWS DS3

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

Comments 10 pages, 4 figures, NeurIPS2025

Journal ref NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15021 2025-10-20 cs.CV 57%

Constantly Improving Image Models Need Constantly Improving Benchmarks

Jiaxin Ge, Grace Luo, Heekyung Lee, Nishant Malpani, Long Lian, XuDong Wang, Aleksander Holynski, Trevor Darrell, Sewon Min, David M. Chan

机构 * UC Berkeley(伯克利大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15671 2025-10-20 cs.CV 57%

CHROME: Clothed Human Reconstruction with Occlusion-Resilience and Multiview-Consistency from a Single Image

Arindam Dutta, Meng Zheng, Zhongpai Gao, Benjamin Planche, Anwesha Choudhuri, Terrence Chen, Amit K. Roy-Chowdhury, Ziyan Wu

机构 * University of California, Riverside(加州大学河滨分校) United Imaging Intelligence(联合影像智能)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14241 2025-10-17 cs.CV 57%

PIA: Deepfake Detection Using Phoneme-Temporal and Identity-Dynamic Analysis

Soumyya Kanti Datta, Tanvi Ranga, Chengzhe Sun, Siwei Lyu

机构 * University at Buffalo, SUNY Buffalo, NY, USA(布法罗大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10497 2025-10-14 cs.CV 57%

Jigsaw3D: Disentangled 3D Style Transfer via Patch Shuffling and Masking

Yuteng Ye, Zheng Zhang, Qinchuan Zhang, Di Wang, Youjia Zhang, Wenxiao Zhang, Wei Yang, Yuan Liu

机构 * Huawei, Media Innovation Lab(华为媒体创新实验室) Huazhong University of Science & Technology(华中科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 23 pages, 16 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18369 2025-10-13 cs.CV 57%

RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models

Yeongtak Oh, Dohyun Chung, Juhyeon Shin, Sangha Park, Johan Barthelemy, Jisoo Mok, Sungroh Yoon

专题命中 个性化与一致性 :personalized generation(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04450 2025-10-07 cs.CV 57%

REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization

Qiyuan He, Yicong Li, Haotian Ye, Jinghao Wang, Xinyao Liao, Pheng-Ann Heng, Stefano Ermon, James Zou, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 27 pages, 23 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18825 2025-10-07 cs.LG cs.CV 57%

How to build a consistency model: Learning flow maps via self-distillation

Nicholas M. Boffi, Michael S. Albergo, Eric Vanden-Eijnden

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) Courant Institute of Mathematical Sciences(数学科学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02631 2025-10-06 cs.CV 57%

Deep Generative Continual Learning using Functional LoRA: FunLoRA

Victor Enescu, Hichem Sahbi

机构 * Sorbonne University(索邦大学) CNRS(法国国家科学研究中心) LIP6(LIP6研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00658 2025-10-02 cs.CV cs.AI cs.LG 57%

Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents

Beomsu Kim, Byunghee Cha, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00633 2025-10-02 cs.CV cs.LG 57%

Virtual Fashion Photo-Shoots: Building a Large-Scale Garment-Lookbook Dataset

Yannick Hauri, Luca A. Lanzendörfer, Till Aczel

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00006 2025-10-02 cs.SD cs.CL cs.CY cs.MM eess.AS 57%

Unpacking Musical Symbolism in Online Communities: Content-Based and Network-Centric Approaches

Kajwan Ziaoddini

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07754 2025-10-02 cs.CV cs.AI cs.LG 57%

PortraitTalk: Towards Customizable One-Shot Audio-to-Talking Face Generation

Fatemeh Nazarieh, Zhenhua Feng, Diptesh Kanojia, Muhammad Awais, Josef Kittler

机构 * School of Computer Science and Electronic Engineering, University of Surrey(计算机科学与电子工程系,塞夫顿大学) Centre for Vision, Speech and Signal Processing, University of Surrey(视觉、语音与信号处理中心,塞夫顿大学) School of Artificial Intelligence and Computer Science, Jiangnan University(人工智能与计算机科学系,江南大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03621 2025-10-01 cs.CV cs.AI 57%

Negative-Guided Subject Fidelity Optimization for Zero-Shot Subject-Driven Generation

Chaehun Shin, Jooyoung Choi, Johan Barthelemy, Jungbeom Lee, Sungroh Yoon

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25172 2025-09-30 cs.CV cs.LG 57%

Personalized Vision via Visual In-Context Learning

Yuxin Jiang, Yuchao Gu, Yiren Song, Ivor Tsang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) A*STAR, Singapore(新加坡科技研究局)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Project page: https://yuxinn-j.github.io/projects/PICO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24878 2025-09-30 cs.CV cs.RO 57%

ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation

Jiuhong Xiao, Roshan Nayak, Ning Zhang, Daniel Tortei, Giuseppe Loianno

机构 * New York University(纽约大学) Technology Innovation Institute(技术创新研究所) University of California, Berkeley(加州大学伯克利分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 23 pages including the checklist and appendix. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏