arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2311.09084 2023-11-16 cs.CV 70%

Contrastive Transformer Learning with Proximity Data Generation for Text-Based Person Search

Hefeng Wu, Weifeng Chen, Zhibin Liu, Tianshui Chen, Zhiguang Chen, Liang Lin

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by IEEE T-CSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14053 2023-11-14 cs.CV cs.LG 70%

Parts of Speech-Grounded Subspaces in Vision-Language Models

James Oldfield, Christos Tzelepis, Yannis Panagakis, Mihalis A. Nicolaou, Ioannis Patras

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07005 2023-11-10 cs.CV cs.CR 70%

AI-Generated Image Detection using a Cross-Attention Enhanced Dual-Stream Network

Ziyi Xi, Wenmin Huang, Kangkang Wei, Weiqi Luo, Peijia Zheng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 8 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03716 2023-11-08 cs.CL cs.AI cs.CV 70%

LLM as an Art Director (LaDi): Using LLMs to improve Text-to-Media Generators

Allen Roush, Emil Zakirov, Artemiy Shirokov, Polina Lunina, Jack Gane, Alexander Duffy, Charlie Basil, Aber Whitcomb, Jim Benedetto, Chris DeWolfe

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 12 pages, System Demonstration/Industry paper. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02541 2023-11-07 cs.CV cs.GT 70%

Catch Missing Details: Image Reconstruction with Frequency Augmented Variational Autoencoder

Xinmiao Lin, Yikang Li, Jenhao Hsiao, Chiuman Ho, Yu Kong

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by CVPR 2023, code available at https://github.com/oppo-us-research/FA-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01361 2023-11-03 cs.CV cs.CL 70%

GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks

Xinlu Zhang, Yujie Lu, Weizhi Wang, An Yan, Jun Yan, Lianke Qin, Heng Wang, Xifeng Yan, William Yang Wang, Linda Ruth Petzold

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14356 2023-11-01 cs.LG cs.CL cs.CV 70%

COCO-Counterfactuals: Automatically Constructed Counterfactual Examples for Image-Text Pairs

Tiep Le, Vasudev Lal, Phillip Howard

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2023 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15393 2023-10-31 cs.CV cs.AI 70%

LayoutGPT: Compositional Visual Planning and Generation with Large Language Models

Weixi Feng, Wanrong Zhu, Tsu-jui Fu, Varun Jampani, Arjun Akula, Xuehai He, Sugato Basu, Xin Eric Wang, William Yang Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16532 2023-10-26 cs.CV 70%

Learning Robust Deep Visual Representations from EEG Brain Recordings

Prajwal Singh, Dwip Dalal, Gautam Vashishtha, Krishna Miyapuram, Shanmuganathan Raman

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted in WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16003 2023-10-25 cs.CV 70%

CVPR 2023 Text Guided Video Editing Competition

Jay Zhangjie Wu, Xiuyu Li, Difei Gao, Zhen Dong, Jinbin Bai, Aishani Singh, Xiaoyu Xiang, Youzeng Li, Zuwei Huang, Yuanxi Sun, Rui He, Feng Hu, Junhua Hu, Hai Huang, Hanyu Zhu, Xu Cheng, Jie Tang, Mike Zheng Shou, Kurt Keutzer, Forrest Iandola

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://sites.google.com/view/loveucvpr23/track4

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13361 2023-10-23 cs.CV cs.AI cs.CL 70%

Bridging the Gap between Synthetic and Authentic Images for Multimodal Machine Translation

Wenyu Guo, Qingkai Fang, Dong Yu, Yang Feng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to EMNLP 2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04488 2023-10-17 cs.LG cs.AI cs.CV 70%

Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards

Alexandre Ramé, Guillaume Couairon, Mustafa Shukor, Corentin Dancette, Jean-Baptiste Gaya, Laure Soulier, Matthieu Cord

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17216 2023-10-16 cs.CL cs.CV cs.LG 70%

Generating Images with Multimodal Language Models

Jing Yu Koh, Daniel Fried, Ruslan Salakhutdinov

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2023. Project page: http://jykoh.com/gill

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06968 2023-10-12 cs.CV cs.LG 70%

ObjectComposer: Consistent Generation of Multiple Objects Without Fine-tuning

Alec Helbling, Evan Montoya, Duen Horng Chau

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02988 2023-10-05 cs.CV cs.AI 70%

Probing Intersectional Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Vasudev Lal

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15564 2023-09-29 cs.LG cs.CL cs.CV 70%

Jointly Training Large Autoregressive Multimodal Models

Emanuele Aiello, Lili Yu, Yixin Nie, Armen Aghajanyan, Barlas Oguz

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15181 2023-09-27 cs.CV 70%

DreamStone: Image as Stepping Stone for Text-Guided 3D Shape Generation

Zhengzhe Liu, Peng Dai, Ruihui Li, Xiaojuan Qi, Chi-Wing Fu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14352 2023-09-21 cs.CV 70%

General Image-to-Image Translation with One-Shot Image Guidance

Bin Cheng, Zuhao Liu, Yunbo Peng, Yue Lin

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10020 2023-09-20 cs.CV cs.CL 70%

Multimodal Foundation Models: From Specialists to General-Purpose Assistants

Chunyuan Li, Zhe Gan, Zhengyuan Yang, Jianwei Yang, Linjie Li, Lijuan Wang, Jianfeng Gao

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 119 pages, PDF file size 58MB; Tutorial website: https://vlp-tutorial.github.io/2023/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02190 2023-09-06 cs.CV cs.AI 70%

Exchanging-based Multimodal Fusion with Transformer

Renyu Zhu, Chengcheng Han, Yong Qian, Qiushi Sun, Xiang Li, Ming Gao, Xuezhi Cao, Yunsen Xian

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15472 2023-08-30 cs.CV 70%

Learning Modulated Transformation in GANs

Ceyuan Yang, Qihang Zhang, Yinghao Xu, Jiapeng Zhu, Yujun Shen, Bo Dai

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10718 2023-08-24 cs.CR cs.CV 70%

Backdooring Textual Inversion for Concept Censorship

Yutong Wu, Jie Zhang, Florian Kerschbaum, Tianwei Zhang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11473 2023-08-23 cs.CV cs.AI 70%

IT3D: Improved Text-to-3D Generation with Explicit View Synthesis

Yiwen Chen, Chi Zhang, Xiaofeng Yang, Zhongang Cai, Gang Yu, Lei Yang, Guosheng Lin

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://github.com/buaacyw/IT3D-text-to-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07575 2023-08-22 cs.CV cs.AI cs.LG 70%

Story Visualization by Online Text Augmentation with Context Memory

Daechul Ahn, Daneul Kim, Gwangmo Song, Seung Hwan Kim, Honglak Lee, Dongyeop Kang, Jonghyun Choi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV 2023, Project page: https://dcahn12.github.io/projects/CMOTA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09278 2023-08-21 cs.CV 70%

MATLABER: Material-Aware Text-to-3D via LAtent BRDF auto-EncodeR

Xudong Xu, Zhaoyang Lyu, Xingang Pan, Bo Dai

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06712 2023-08-21 cs.CV 70%

What does CLIP know about a red circle? Visual prompt engineering for VLMs

Aleksandar Shtedritski, Christian Rupprecht, Andrea Vedaldi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV 2023 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08095 2023-08-11 cs.CV 70%

Will Large-scale Generative Models Corrupt Future Datasets?

Ryuichiro Hataya, Han Bao, Hiromi Arai

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01546 2023-08-04 cs.SD cs.AI cs.LG cs.MM eess.AS 70%

MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup Strategies

Ke Chen, Yusong Wu, Haohe Liu, Marianna Nezhurina, Taylor Berg-Kirkpatrick, Shlomo Dubnov

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.MM

Comments 16 pages, 3 figures, 2 tables, demo page: https://musicldm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00211 2023-07-18 cs.CV eess.IV 70%

AIGCIQA2023: A Large-scale Image Quality Assessment Database for AI Generated Images: from the Perspectives of Quality, Authenticity and Correspondence

Jiarui Wang, Huiyu Duan, Jing Liu, Shi Chen, Xiongkuo Min, Guangtao Zhai

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14708 2023-07-07 cs.CV 70%

A Simple and Effective Baseline for Attentional Generative Adversarial Networks

Mingyu Jin, Chong Zhang, Qinkai Yu, Haochen Xue, Xiaobo Jin, Xi Yang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏