arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2503.00811 2025-03-04 cs.CV 70%

Evaluating and Predicting Distorted Human Body Parts for Generated Images

Lu Ma, Kaibo Cao, Hao Liang, Jiaxin Lin, Zhuang Li, Yuhong Liu, Jihong Zhang, Wentao Zhang, Bin Cui

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19842 2025-03-04 cs.CV 70%

CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation

Reza Abbasi, Ali Nazari, Aminreza Sefid, Mohammadali Banayeeanzade, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10781 2025-02-28 cs.CV cs.LG 70%

Bag of Design Choices for Inference of High-Resolution Masked Generative Transformer

Shitong Shao, Zikai Zhou, Tian Ye, Lichen Bai, Zhiqiang Xu, Zeke Xie

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06723 2025-02-28 cs.CV cs.AI cs.LG 70%

Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions

Yu-Guan Hsieh, Cheng-Yu Hsieh, Shih-Ying Yeh, Louis Béthune, Hadi Pour Ansari, Pavan Kumar Anasosalu Vasu, Chun-Liang Li, Ranjay Krishna, Oncel Tuzel, Marco Cuturi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 59 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03200 2025-02-28 cs.LG cs.CV 70%

Future-Proofing Class-Incremental Learning

Quentin Jodelet, Xin Liu, Yin Jun Phua, Tsuyoshi Murata

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments The version of record of this article, first published in "Machine Vision and Applications", is available online at Publisher's website: https://doi.org/10.1007/s00138-024-01635-y

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16915 2025-02-25 cs.CV 70%

Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model

Kang Fu, Huiyu Duan, Zicheng Zhang, Xiaohong Liu, Xiongkuo Min, Jia Wang, Guangtao Zhai

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03631 2025-02-21 cs.CV 70%

Robust Concept Erasure Using Task Vectors

Minh Pham, Kelly O. Marshall, Chinmay Hegde, Niv Cohen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13855 2025-02-20 cs.CV 70%

MagicGeo: Training-Free Text-Guided Geometric Diagram Generation

Junxiao Wang, Ting Zhang, Heng Yu, Jingdong Wang, Hua Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07516 2025-02-17 eess.IV cs.AI cs.CV cs.LG 70%

The Devil is in the Prompts: De-Identification Traces Enhance Memorization Risks in Synthetic Chest X-Ray Generation

Raman Dutt

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09611 2025-02-14 cs.LG cs.CV 70%

Designing a Conditional Prior Distribution for Flow-Based Generative Models

Noam Issachar, Mohammad Salama, Raanan Fattal, Sagie Benaim

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04896 2025-02-11 cs.CV 70%

Goku: Flow Based Video Generative Foundation Models

Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Demo: https://saiyan-world.github.io/goku/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02555 2025-02-06 eess.IV cs.CV 70%

AAD-DCE: An Aggregated Multimodal Attention Mechanism for Early and Late Dynamic Contrast Enhanced Prostate MRI Synthesis

Divya Bharti, Sriprabha Ramanarayanan, Sadhana S, Kishore Kumar M, Keerthi Ram, Harsh Agarwal, Ramesh Venkatesan, Mohanasankar Sivaprakasam

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17811 2025-01-30 cs.AI cs.CL cs.CV 70%

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, Chong Ruan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Research paper. arXiv admin note: text overlap with arXiv:2410.13848

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16612 2025-01-29 cs.CV 70%

CascadeV: An Implementation of Wurstchen Architecture for Video Generation

Wenfeng Lin, Jiangchuan Wei, Boyuan Liu, Yichen Zhang, Shiyue Yan, Mingyu Guo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13040 2025-01-23 cs.CV cs.LG 70%

Analysis of Classifier-Free Guidance Weight Schedulers

Xi Wang, Nicolas Dufour, Nefeli Andreou, Marie-Paule Cani, Victoria Fernandez Abrevaya, David Picard, Vicky Kalogeiton

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Journal ref Transactions on Machine Learning Research, 2835-8856, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12381 2025-01-22 cs.CV cs.LG 70%

Parallel Sequence Modeling via Generalized Spatial Propagation Network

Hongjun Wang, Wonmin Byeon, Jiarui Xu, Jinwei Gu, Ka Chun Cheung, Xiaolong Wang, Kai Han, Jan Kautz, Sifei Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: http://whj363636.github.io/GSPN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04884 2025-01-22 cs.CV cs.AI 70%

Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models

Dehong Kong, Siyuan Liang, Xiaopeng Zhu, Yuansheng Zhong, Wenqi Ren

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments accepted by Visual Intelligence

Journal ref Visual Intelligence, 2024, Vol 2, article no.17

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05184 2025-01-03 cs.CV 70%

The Unmet Promise of Synthetic Training Images: Using Retrieved Real Images Performs Better

Scott Geng, Cheng-Yu Hsieh, Vivek Ramanujan, Matthew Wallingford, Chun-Liang Li, Pang Wei Koh, Ranjay Krishna

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Correspondence to sgeng at cs dot washington dot edu. RK and PWK equally advised the project

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19978 2024-12-31 cs.CV 70%

MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation

Haoyu Zheng, Wenqiao Zhang, Zheqi Lv, Yu Zhong, Yang Dai, Jianxiang An, Yongliang Shen, Juncheng Li, Dongping Zhang, Siliang Tang, Yueting Zhuang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17251 2024-12-31 cs.CV cs.CL 70%

Altogether: Image Captioning via Re-aligning Alt-text

Hu Xu, Po-Yao Huang, Xiaoqing Ellen Tan, Ching-Feng Yeh, Jacob Kahn, Christine Jou, Gargi Ghosh, Omer Levy, Luke Zettlemoyer, Wen-tau Yih, Shang-Wen Li, Saining Xie, Christoph Feichtenhofer

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments accepted by EMNLP 2024; Meta CLIP 1.2 Data Engine

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18653 2024-12-30 cs.CV cs.AI cs.LG 70%

1.58-bit FLUX

Chenglin Yang, Celong Liu, Xueqing Deng, Dongwon Kim, Xing Mei, Xiaohui Shen, Liang-Chieh Chen

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18404 2024-12-25 cs.CV cs.LG 70%

Extract Free Dense Misalignment from CLIP

JeongYeon Nam, Jinbae Im, Wonjae Kim, Taeho Kil

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 16 pages, 14 figures, AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16207 2024-12-24 cs.CV cs.CY 70%

Skull-to-Face: Anatomy-Guided 3D Facial Reconstruction and Editing

Yongqing Liang, Congyi Zhang, Junli Zhao, Wenping Wang, Xin Li

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments This paper was accepted by IEEE Transactions on Visualization and Computer Graphics. Project page: https://xmlyqing00.github.io/skull-to-face-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04363 2024-12-19 cs.CV 70%

Idea23D: Collaborative LMM Agents Enable 3D Model Generation from Interleaved Multimodal Inputs

Junhao Chen, Xiang Li, Xiaojun Ye, Chao Li, Zhaoxin Fan, Hao Zhao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by COLING 2025 (The 31st International Conference on Computational Linguistics) Project Page: https://idea23d.github.io/ Code: https://github.com/yisuanwang/Idea23D

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08580 2024-12-16 cs.CV 70%

LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations

Zejian Li, Chenye Meng, Yize Li, Ling Yang, Shengyuan Zhang, Jiarui Ma, Jiayi Li, Guang Yang, Changyuan Yang, Zhiyuan Yang, Jinxiong Chang, Lingyun Sun

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08859 2024-12-13 cs.CV 70%

ViUniT: Visual Unit Tests for More Robust Visual Programming

Artemis Panagopoulou, Honglu Zhou, Silvio Savarese, Caiming Xiong, Chris Callison-Burch, Mark Yatskar, Juan Carlos Niebles

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08111 2024-12-12 cs.CV cs.CL cs.LG 70%

Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models

Sri Harsha Dumpala, David Arps, Sageev Oore, Laura Kallmeyer, Hassan Sajjad

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17189 2024-12-02 cs.CV 70%

PhysMotion: Physics-Grounded Dynamics From a Single Image

Xiyang Tan, Ying Jiang, Xuan Li, Zeshun Zong, Tianyi Xie, Yin Yang, Chenfanfu Jiang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://supertan0204.github.io/physmotion_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11643 2024-11-26 cs.CV 70%

CustAny: Customizing Anything from A Single Example

Lingjie Kong, Kai Wu, Xiaobin Hu, Wenhui Han, Jinlong Peng, Chengming Xu, Donghao Luo, Mengtian Li, Jiangning Zhang, Chengjie Wang, Yanwei Fu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15245 2024-11-26 cs.CV 70%

AnyText2: Visual Text Generation and Editing With Customizable Attributes

Yuxiang Tuo, Yifeng Geng, Liefeng Bo

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏