arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2406.08798 2024-06-14 cs.CV 70%

FouRA: Fourier Low Rank Adaptation

Shubhankar Borse, Shreya Kadambi, Nilesh Prasad Pandey, Kartikeya Bhardwaj, Viswanath Ganapathy, Sweta Priyadarshi, Risheek Garrepalli, Rafael Esteves, Munawar Hayat, Fatih Porikli

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07699 2024-06-13 cs.CV cs.AI 70%

CUPID: Contextual Understanding of Prompt-conditioned Image Distributions

Yayan Zhao, Mingwei Li, Matthew Berger

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07502 2024-06-12 cs.CV cs.CL 70%

Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions

Renjie Pi, Jianshu Zhang, Jipeng Zhang, Rui Pan, Zhekai Chen, Tong Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06352 2024-06-11 cs.CV 70%

Latent Directions: A Simple Pathway to Bias Mitigation in Generative AI

Carolina Lopez Olmos, Alexandros Neophytou, Sunando Sengupta, Dim P. Papadopoulos

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR workshop 2024, proceedings of ReGenAI: First Workshop on Responsible Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05432 2024-06-11 cs.CV 70%

Regularized Training with Generated Datasets for Name-Only Transfer of Vision-Language Models

Minho Park, Sunghyun Park, Jooyeol Yun, Jaegul Choo

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07750 2024-06-10 cs.CV cs.AI 70%

Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings

Sahand Sharifzadeh, Christos Kaplanis, Shreya Pathak, Dharshan Kumaran, Anastasija Ilic, Jovana Mitrovic, Charles Blundell, Andrea Banino

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16277 2024-06-04 cs.CL cs.AI cs.CV cs.LG 70%

Picturing Ambiguity: A Visual Twist on the Winograd Schema Challenge

Brendan Park, Madeline Janecek, Naser Ezzati-Jivan, Yifeng Li, Ali Emami

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages (excluding references), accepted to ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20364 2024-06-03 cs.CV cs.AI cs.RO 70%

Learning 3D Robotics Perception using Inductive Priors

Muhammad Zubair Irshad

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Georgia Tech Ph.D. Thesis, December 2023. For more details: https://zubairirshad.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16501 2024-05-28 cs.CV 70%

User-Friendly Customized Generation with Multi-Modal Prompts

Linhao Zhong, Yan Hong, Wentao Chen, Binglin Zhou, Yiyi Zhang, Jianfu Zhang, Liqing Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12852 2024-05-27 eess.IV cs.CV 70%

Generative Enhancement for 3D Medical Images

Lingting Zhu, Noel Codella, Dongdong Chen, Zhenchao Jin, Lu Yuan, Lequan Yu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12425 2024-05-24 cs.CV cs.CL cs.LG 70%

The Neglected Tails in Vision-Language Models

Shubham Parashar, Zhiqiu Lin, Tian Liu, Xiangjue Dong, Yanan Li, Deva Ramanan, James Caverlee, Shu Kong

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://shubhamprshr27.github.io/neglected-tails-of-vlms/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12742 2024-05-22 cs.CV 70%

Multi-Subject Personalization

Arushi Jain, Shubham Paliwal, Monika Sharma, Vikram Jamwal, Lovekesh Vig

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 2023 Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13696 2024-05-17 cs.CV cs.AI eess.IV 70%

What Does DALL-E 2 Know About Radiology?

Lisa C. Adams, Felix Busch, Daniel Truhn, Marcus R. Makowski, Hugo JWL. Aerts, Keno K. Bressem

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 4 Figures

Journal ref J Med Internet Res 2023;25:e43110

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05222 2024-05-09 cs.CV 70%

Emu: Generative Pretraining in Multimodality

Quan Sun, Qiying Yu, Yufeng Cui, Fan Zhang, Xiaosong Zhang, Yueze Wang, Hongcheng Gao, Jingjing Liu, Tiejun Huang, Xinlong Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to ICLR 2024. Code and Models: https://github.com/baaivision/Emu

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01434 2024-05-03 cs.CV 70%

StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation

Yupeng Zhou, Daquan Zhou, Ming-Ming Cheng, Jiashi Feng, Qibin Hou

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00791 2024-05-03 cs.CV cs.AI 70%

Obtaining Favorable Layouts for Multiple Object Generation

Barak Battash, Amit Rozner, Lior Wolf, Ofir Lindenbaum

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19753 2024-05-01 cs.CV cs.AI cs.CL cs.LG 70%

DOCCI: Descriptions of Connected and Contrasting Images

Yasumasa Onoe, Sunayana Rane, Zachary Berger, Yonatan Bitton, Jaemin Cho, Roopal Garg, Alexander Ku, Zarana Parekh, Jordi Pont-Tuset, Garrett Tanzer, Su Wang, Jason Baldridge

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08832 2024-04-26 cs.CV 70%

Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding

Le Zhang, Rabiul Awal, Aishwarya Agrawal

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10874 2024-04-25 cs.CV 70%

Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation

Wenjing Wang, Huan Yang, Zixi Tuo, Huiguo He, Junchen Zhu, Jianlong Fu, Jiaying Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16388 2024-04-19 cs.CV 70%

Exposing Image Splicing Traces in Scientific Publications via Uncertainty-guided Refinement

Xun Lin, Wenzhong Tang, Haoran Wang, Yizhong Liu, Yakun Ju, Shuai Wang, Zitong Yu

专题命中 文生图 :inpainting(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00094 2024-04-16 cs.CV 70%

Generating Enhanced Negatives for Training Language-Based Object Detectors

Shiyu Zhao, Long Zhao, Vijay Kumar B. G, Yumin Suh, Dimitris N. Metaxas, Manmohan Chandraker, Samuel Schulter

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. The supplementary document included

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17205 2024-04-15 cs.CV 70%

EFHQ: Multi-purpose ExtremePose-Face-HQ dataset

Trung Tuan Dao, Duc Hong Vu, Cuong Pham, Anh Tran

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://bomcon123456.github.io/efhq/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00825 2024-04-11 cs.CV cs.AI 70%

SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. arXiv admin note: text overlap with arXiv:2310.02988

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05666 2024-04-09 cs.CV 70%

YaART: Yet Another ART Rendering Technology

Sergey Kastryulin, Artem Konev, Alexander Shishenya, Eugene Lyapustin, Artem Khurshudov, Alexander Tselousov, Nikita Vinokurov, Denis Kuznedelev, Alexander Markovich, Grigoriy Livshits, Alexey Kirillov, Anastasiia Tabisheva, Liubov Chubarova, Marina Kaminskaia, Alexander Ustyuzhanin, Artemii Shvetsov, Daniil Shlenskii, Valerii Startsev, Dmitrii Kornilov, Mikhail Romanov, Artem Babenko, Sergei Ovcharenko, Valentin Khrulkov

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Prompts and additional information are available on the project page, see https://ya.ru/ai/art/paper-yaart-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06704 2024-04-09 cs.CV 70%

SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human Reconstruction

Zechuan Zhang, Zongxin Yang, Yi Yang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2024; Project page https://river-zhang.github.io/SIFU-projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19964 2024-04-09 cs.CV cs.CY cs.LG 70%

FairRAG: Fair Human Generation via Fair Retrieval Augmentation

Robik Shrestha, Yang Zou, Qiuyu Chen, Zhiheng Li, Yusheng Xie, Siqi Deng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12468 2024-04-03 cs.CV 70%

MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers

Haoyu Ma, Shahin Mahdizadehaghdam, Bichen Wu, Zhipeng Fan, Yuchao Gu, Wenliang Zhao, Lior Shapira, Xiaohui Xie

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15789 2024-03-26 cs.CV 70%

In-Context Matting

He Guo, Zixuan Ye, Zhiguo Cao, Hao Lu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Code is available at https://github.com/tiny-smart/in-context-matting

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14966 2024-03-25 cs.CV 70%

DreamFlow: High-Quality Text-to-3D Generation by Approximating Probability Flow

Kyungmin Lee, Kihyuk Sohn, Jinwoo Shin

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12038 2024-03-25 cs.CL cs.CV 70%

Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages

Jinyi Hu, Yuan Yao, Chongyi Wang, Shan Wang, Yinxu Pan, Qianyu Chen, Tianyu Yu, Hanghao Wu, Yue Zhao, Haoye Zhang, Xu Han, Yankai Lin, Jiao Xue, Dahai Li, Zhiyuan Liu, Maosong Sun

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments https://github.com/OpenBMB/VisCPM.git

详情

展开后加载摘要…

URL PDF HTML 收藏