arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2402.01002 2024-11-22 cs.CV cs.AI 70%

AI-generated faces influence gender stereotypes and racial homogenization

Nouar AlDahoul, Talal Rahwan, Yasir Zaki

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 47 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18068 2024-11-19 cs.CV 70%

SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model

Bin Cao, Jianhao Yuan, Yexin Liu, Jian Li, Shuyang Sun, Jing Liu, Bo Zhao

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08642 2024-11-14 cs.CV cs.AI 70%

Towards More Accurate Fake Detection on Images Generated from Advanced Generative and Neural Rendering Models

Chengdong Dong, Vijayakumar Bhagavatula, Zhenyu Zhou, Ajay Kumar

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments 13 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07708 2024-11-13 cs.CV 70%

Emotion Classification of Children Expressions

Sanchayan Vivekananthan

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07472 2024-11-13 cs.CV 70%

Semi-Truths: A Large-Scale Dataset of AI-Augmented Images for Evaluating Robustness of AI-Generated Image detectors

Anisha Pal, Julia Kruk, Mansi Phute, Manognya Bhattaram, Diyi Yang, Duen Horng Chau, Judy Hoffman

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2024 Track Datasets & Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09633 2024-11-07 cs.CV 70%

In-Context Translation: Towards Unifying Image Recognition, Processing, and Generation

Han Xue, Qianru Sun, Li Song, Wenjun Zhang, Zhiwu Huang

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07593 2024-10-30 cs.CV cs.AI 70%

A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks

Hoin Jung, Taeuk Jang, Xiaoqian Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2024 (Spotlight), the Thirty-Eighth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02793 2024-10-30 cs.CV cs.CL 70%

ImageInWords: Unlocking Hyper-Detailed Image Descriptions

Roopal Garg, Andrea Burns, Burcu Karagol Ayan, Yonatan Bitton, Ceslee Montgomery, Yasumasa Onoe, Andrew Bunner, Ranjay Krishna, Jason Baldridge, Radu Soricut

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Webpage (https://google.github.io/imageinwords), GitHub (https://github.com/google/imageinwords), HuggingFace (https://huggingface.co/datasets/google/imageinwords)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20279 2024-10-24 cs.CV cs.AI eess.IV 70%

CV-VAE: A Compatible Video VAE for Latent Generative Video Models

Sijie Zhao, Yong Zhang, Xiaodong Cun, Shaoshu Yang, Muyao Niu, Xiaoyu Li, Wenbo Hu, Ying Shan

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://ailab-cvc.github.io/cvvae/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13861 2024-10-22 cs.CV 70%

PUMA: Empowering Unified MLLM with Multi-granular Visual Generation

Rongyao Fang, Chengqi Duan, Kun Wang, Hao Li, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Hongsheng Li, Xihui Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: https://rongyaofang.github.io/puma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13823 2024-10-18 cs.CV 70%

Deep Generative Models Unveil Patterns in Medical Images Through Vision-Language Conditioning

Xiaodan Xing, Junzhi Ning, Yang Nan, Guang Yang

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by AIM-FM Workshop of NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03209 2024-10-10 cs.CV 70%

iSeg: An Iterative Refinement-based Framework for Training-free Segmentation

Lin Sun, Jiale Cao, Jin Xie, Fahad Shahbaz Khan, Yanwei Pang

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Project Page: https://linsun449.github.io/iSeg/ Code: https://github.com/linsun449/iseg.code

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14206 2024-10-10 cs.CV 70%

LG-VQ: Language-Guided Codebook Learning

Guotao Liang, Baoquan Zhang, Yaowei Wang, Xutao Li, Yunming Ye, Huaibin Wang, Chuyao Luo, Kola Ye, linfeng Luo

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04701 2024-10-10 cs.CV cs.AI 70%

ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes

Hashmat Shadab Malik, Muhammad Huzaifa, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Journal ref Asian Conference on Computer Vision - 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18282 2024-10-02 eess.IV cs.CV physics.med-ph 70%

Synthesizing beta-amyloid PET images from T1-weighted Structural MRI: A Preliminary Study

Qing Lyu, Jin Young Kim, Jeongchul Kim, Christopher T Whitlow

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12024 2024-09-19 cs.CV 70%

LEMON: Localized Editing with Mesh Optimization and Neural Shaders

Furkan Mert Algan, Umut Yazgan, Driton Salihu, Cem Eteke, Eckehard Steinbach

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10578 2024-09-18 cs.CR cs.AI cs.CV cs.LG 70%

GLEAN: Generative Learning for Eliminating Adversarial Noise

Justin Lyu Kim, Kyoungwan Woo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01256 2024-09-17 cs.CV cs.CL 70%

VideoStudio: Generating Consistent-Content and Multi-Scene Videos

Fuchen Long, Zhaofan Qiu, Ting Yao, Tao Mei

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ECCV 2024. Source code is available at https://github.com/FuchenUSTC/VideoStudio

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05162 2024-09-10 cs.CV cs.LG 70%

Can OOD Object Detectors Learn from Foundation Models?

Jiahui Liu, Xin Wen, Shizhen Zhao, Yingxian Chen, Xiaojuan Qi

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 19 pages, 4 figures

Journal ref European Conference on Computer Vision (ECCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01835 2024-09-10 cs.CV cs.CL 70%

Towards Generative Class Prompt Learning for Fine-grained Visual Recognition

Soumitri Chattopadhyay, Sanket Biswas, Emanuele Vivoli, Josep Lladós

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted in BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12352 2024-08-26 cs.CV 70%

GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections

Shiyue Zhang, Zheng Chong, Xujie Zhang, Hanhui Li, Yuhao Cheng, Yiqiang Yan, Xiaodan Liang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05019 2024-08-12 cs.CV 70%

Instruction Tuning-free Visual Token Complement for Multimodal LLMs

Dongsheng Wang, Jiequan Cui, Miaoge Li, Wang Lin, Bo Chen, Hanwang Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by ECCV2024 (20pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15378 2024-07-23 cs.CV 70%

Long-CLIP: Unlocking the Long-Text Capability of CLIP

Beichen Zhang, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Jiaqi Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ECCV 2024. All codes and models are publicly available at https://github.com/beichenzbc/Long-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13663 2024-07-16 cs.CV 70%

Free-Editor: Zero-shot Text-driven 3D Scene Editing

Nazmul Karim, Hasan Iqbal, Umar Khalid, Jing Hua, Chen Chen

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09499 2024-07-16 cs.CV cs.AI cs.LG stat.ML 70%

Self-Consuming Generative Models with Curated Data Provably Optimize Human Preferences

Damien Ferbach, Quentin Bertrand, Avishek Joey Bose, Gauthier Gidel

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09622 2024-07-15 cs.CV 70%

Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering

Zeyu Liu, Weicong Liang, Zhanhao Liang, Chong Luo, Ji Li, Gao Huang, Yuhui Yuan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ECCV 2024, 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10762 2024-07-12 cs.CV 70%

Deep Image Fingerprint: Towards Low Budget Synthetic Image Detection and Model Lineage Analysis

Sergey Sinitsa, Ohad Fried

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06817 2024-07-10 cs.CV 70%

AstroSpy: On detecting Fake Images in Astronomy via Joint Image-Spectral Representations

Mohammed Talha Alam, Raza Imam, Mohsen Guizani, Fakhri Karray

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12592 2024-06-19 cs.CV 70%

Unmasking the Veil: An Investigation into Concept Ablation for Privacy and Copyright Protection in Images

Shivank Garg, Manyana Tiwari

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11331 2024-06-18 cs.CV cs.IR cs.LG 70%

They're All Doctors: Synthesizing Diverse Counterfactuals to Mitigate Associative Bias

Salma Abdel Magid, Jui-Hsien Wang, Kushal Kafle, Hanspeter Pfister

专题命中 文生图 :text-to-image(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏