arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2504.19894 2025-04-29 cs.CV 70%

CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition

Quynh Phung, Long Mai, Fabian David Caba Heilbron, Feng Liu, Jia-Bin Huang, Cusuh Ham

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Adobe Research(Adobe研究院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments link website: https://cinevers.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17804 2025-04-28 cs.CV 70%

Spectral Dictionary Learning for Generative Image Modeling

Andrew Kiruluta

机构 * Department of Computer Science UC Berkeley, CA(计算机科学系加州大学伯克利分校)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01019 2025-04-22 cs.CV cs.AI 70%

MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations

Ziyang Zhang, Yang Yu, Yucheng Chen, Xulei Yang, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) ECE, Northwestern University(电子工程系,西北大学) Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究所(I2R),A*STAR,新加坡) Lee Kong Chian School of Medicine, Nanyang Technological University(Lee Kong Chian医学院,南洋理工大学)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments To be pubilshed in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14216 2025-04-22 cs.CV 70%

DreamDistribution: Learning Prompt Distribution for Diverse In-distribution Generation

Brian Nlong Zhao, Yuhang Xiao, Jiashu Xu, Xinyang Jiang, Yifan Yang, Dongsheng Li, Laurent Itti, Vibhav Vineet, Yunhao Ge

机构 * University of Southern California(南加州大学) Harvard University(哈佛大学) Microsoft Research Asia(微软亚洲研究院) Microsoft Research Redmond(微软红mond研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11520 2025-04-21 cs.CV cs.AI 70%

EditSplat: Multi-View Fusion and Attention-Guided Optimization for View-Consistent 3D Scene Editing with 3D Gaussian Splatting

Dong In Lee, Hyeongcheol Park, Jiyoung Seo, Eunbyung Park, Hyunje Park, Ha Dam Baek, Sangheon Shin, Sangmin Kim, Sangpil Kim

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12018 2025-04-17 cs.CV 70%

Instruction-augmented Multimodal Alignment for Image-Text and Element Matching

Xinli Yue, JianHui Sun, Junda Lu, Liangchao Yao, Fan Xia, Tianyi Wang, Fengyun Rao, Jing Lyu, Yuetang Deng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09328 2025-04-15 cs.CV cs.LG 70%

Text To 3D Object Generation For Scalable Room Assembly

Sonia Laguna, Alberto Garcia-Garcia, Marie-Julie Rakotosaona, Stylianos Moschoglou, Leonhard Helminger, Sergio Orts-Escolano

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Published at the ICLR 2025 Workshop on Synthetic Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00990 2025-04-15 cs.CV 70%

VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models

Hong Chen, Xin Wang, Guanning Zeng, Yipeng Zhang, Yuwei Zhou, Feilin Han, Yaofei Wu, Wenwu Zhu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06666 2025-04-10 cs.CV 70%

Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception

Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02879 2025-04-07 cs.GR 70%

Robust AI-Synthesized Image Detection via Multi-feature Frequency-aware Learning

Hongfei Cai, Chi Liu, Sheng Shen, Youyang Qu, Peng Gui

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01916 2025-04-03 cs.CV cs.AI cs.CL 70%

FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs

Mothilal Asokan, Kebin Wu, Fatima Albreiki

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10034 2025-03-31 cs.CV 70%

TULIP: Token-length Upgraded CLIP

Ivona Najdenkoska, Mohammad Mahdi Derakhshani, Yuki M. Asano, Nanne van Noord, Marcel Worring, Cees G. M. Snoek

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19373 2025-03-26 cs.CV cs.AI 70%

DeClotH: Decomposable 3D Cloth and Human Body Reconstruction from a Single Image

Hyeongjin Nam, Donghwan Kim, Jeongtaek Oh, Kyoung Mu Lee

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Published at CVPR 2025, 17 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19011 2025-03-26 cs.CV 70%

RomanTex: Decoupling 3D-aware Rotary Positional Embedded Multi-Attention Network for Texture Synthesis

Yifei Feng, Mingxin Yang, Shuhui Yang, Sheng Zhang, Jiaao Yu, Zibo Zhao, Yuhong Liu, Jie Jiang, Chunchao Guo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18948 2025-03-25 cs.CV 70%

Equivariant Image Modeling

Ruixiao Dong, Mengde Xu, Zigang Geng, Li Li, Han Hu, Shuyang Gu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16394 2025-03-21 cs.CV cs.AI cs.CL cs.RO 70%

Do Visual Imaginations Improve Vision-and-Language Navigation Agents?

Akhil Perincherry, Jacob Krantz, Stefan Lee

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17592 2025-03-20 cs.CV 70%

VideoDirector: Precise Video Editing via Text-to-Video Models

Yukun Wang, Longguang Wang, Zhiyuan Ma, Qibin Hu, Kai Xu, Yulan Guo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07658 2025-03-18 cs.CV cs.AI cs.LG 70%

TraSCE: Trajectory Steering for Concept Erasure

Anubhav Jain, Yuya Kobayashi, Takashi Shibuya, Yuhta Takida, Nasir Memon, Julian Togelius, Yuki Mitsufuji

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10697 2025-03-17 cs.CV cs.AI eess.IV 70%

Zero-Shot Subject-Centric Generation for Creative Application Using Entropy Fusion

Kaifeng Zou, Xiaoyi Feng, Peng Wang, Tao Huang, Zizhou Huang, Zhang Haihang, Yuntao Zou, Dagang Li

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 8 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17532 2025-03-17 cs.CV 70%

ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance

Jiannan Huang, Jun Hao Liew, Hanshu Yan, Yuyang Yin, Yao Zhao, Humphrey Shi, Yunchao Wei

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR2025, Code is available at https://github.com/Rbrq03/ClassDiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09662 2025-03-14 cs.CV 70%

CoRe^2: Collect, Reflect and Refine to Generate Better and Faster

Shitong Shao, Zikai Zhou, Dian Xie, Yuetong Fang, Tian Ye, Lichen Bai, Zeke Xie

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09122 2025-03-13 cs.CV 70%

Training Data Provenance Verification: Did Your Model Use Synthetic Data from My Generative Model for Training?

Yuechen Xie, Jie Song, Huiqiong Wang, Mingli Song

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08650 2025-03-12 cs.CV 70%

MF-VITON: High-Fidelity Mask-Free Virtual Try-On with Minimal Input

Zhenchen Wan, Yanwu xu, Dongting Hu, Weilun Cheng, Tianxi Chen, Zhaoqing Wang, Feng Liu, Tongliang Liu, Mingming Gong

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments The project page is available at: https://zhenchenwan.github.io/MF-VITON/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01156 2025-03-12 cs.CV cs.AI cs.LG 70%

TexAVi: Generating Stereoscopic VR Video Clips from Text Descriptions

Vriksha Srihari, R. Bhavya, Shruti Jayaraman, V. Mary Anita Rajam

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Co-authors do not consent to publishing on Arxiv

Journal ref TexAVi: Generating Stereoscopic VR Video Clips from Text Descriptions, 2024 IEEE International Conference on Computer Vision and Machine Intelligence (CVMI), Prayagraj, India, 2024, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07209 2025-03-11 cs.CV cs.LG 70%

Synthetic Lung X-ray Generation through Cross-Attention and Affinity Transformation

Ruochen Pi, Lianlei Shan

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06956 2025-03-11 cs.CV 70%

LatexBlend: Scaling Multi-concept Customized Generation with Latent Textual Blending

Jian Jin, Zhenbo Yu, Yang Shen, Zhenyong Fu, Jian Yang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments cvpr2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05665 2025-03-10 cs.CV cs.LG 70%

AIM-Fair: Advancing Algorithmic Fairness via Selectively Fine-Tuning Biased Models with Contextual Synthetic Data

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Ioannis Patras

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025. Github: https://github.com/zengqunzhao/AIM-Fair. Project page: https://zengqunzhao.github.io/AIMFair

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00962 2025-03-10 cs.CV cs.CY cs.LG 70%

OASIS Uncovers: High-Quality T2I Models, Same Old Stereotypes

Sepehr Dehdashtian, Gautam Sreekumar, Vishnu Naresh Boddeti

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted as a Spotlight paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03236 2025-03-06 cs.HC cs.CV 70%

GenColor: Generative Color-Concept Association in Visual Design

Yihan Hou, Xingchen Zeng, Yusong Wang, Manling Yang, Xiaojiao Chen, Wei Zeng

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 19 pages, 16 figures. Accepted at CHI Conference on Human Factors in Computing Systems (CHI'25), April 26-May 1, 2025, Yokohama, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03204 2025-03-06 cs.CV 70%

Find Matching Faces Based On Face Parameters

Setu A. Bhatt, Harshadkumar B. Prajapati, Vipul K. Dabhi, Ankush Tyagi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏