arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2507.12698 2025-08-26 eess.IV cs.CV 70%

Pixel Perfect MegaMed: A Megapixel-Scale Vision-Language Foundation Model for Generating High Resolution Medical Images

Zahra TehraniNasab, Hujun Ni, Amar Kumar, Tal Arbel

机构 * McGill University(麦吉尔大学) MILA-Quebec AI Institute(魁北克AI研究所)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15774 2025-08-22 cs.CV 70%

CineScale: Free Lunch in High-Resolution Cinematic Visual Generation

Haonan Qiu, Ning Yu, Ziqi Huang, Paul Debevec, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Netflix Eyeline Studios

专题命中 文生图 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments CineScale is an extended work of FreeScale (ICCV 2025). Project Page: https://eyeline-labs.github.io/CineScale/, Code Repo: https://github.com/Eyeline-Labs/CineScale

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21839 2025-08-12 cs.CV cs.CL 70%

GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles

Mengyi Shan, Brian Curless, Ira Kemelmacher-Shlizerman, Steve Seitz

机构 * University of Washington(华盛顿大学)

专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03535 2025-08-06 cs.CV 70%

CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation

Kaishen Yuan, Yuting Zhang, Shang Gao, Yijie Zhu, Wenshuo Chen, Yutao Yue

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23010 2025-08-01 cs.LG cs.AI cs.CV cs.SD eess.AS 70%

Investigating the Invertibility of Multimodal Latent Spaces: Limitations of Optimization-Based Methods

Siwoo Park

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22617 2025-07-31 cs.CR cs.CV 70%

Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions

Yiting Qu, Ziqing Yang, Yihan Ma, Michael Backes, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心) TU Delft(代尔夫特理工大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20782 2025-07-29 cs.CV cs.AI 70%

Investigation of Accuracy and Bias in Face Recognition Trained with Synthetic Data

Pavel Korshunov, Ketan Kotwal, Christophe Ecabert, Vidit Vidit, Amir Mohammadi, Sebastien Marcel

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08789 2025-07-29 cs.CV 70%

Generative AI in Agriculture: Creating Image Datasets Using DALL.E's Advanced Large Language Model Capabilities

Ranjan Sapkota, Manoj Karkee

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08629 2025-07-23 cs.CV cs.LG 70%

FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models

Vladimir Kulikov, Matan Kleiner, Inbar Huberman-Spiegelglas, Tomer Michaeli

机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICCV 2025. Project's webpage at https://matankleiner.github.io/flowedit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08622 2025-07-22 cs.AI cs.CL cs.CV 70%

Visually Guided Decoding: Gradient-Free Hard Prompt Inversion with Language Models

Donghoon Kim, Minji Bae, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔国立大学) Sungkyunkwan University(庆熙大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICLR 2025 (Official Code: https://github.com/DonghoonKim-1938/VGD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12431 2025-07-22 cs.CV cs.AI 70%

FlexiTex: Enhancing Texture Generation via Visual Guidance

DaDong Jiang, Xianghui Yang, Zibo Zhao, Sheng Zhang, Jiaao Yu, Zeqiang Lai, Shaoxiong Yang, Chunchao Guo, Xiaobo Zhou, Zhihui Ke

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2025, Project Page: https://patrickddj.github.io/FlexiTex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13739 2025-07-21 cs.CV cs.AI 70%

Can Synthetic Images Conquer Forgetting? Beyond Unexplored Doubts in Few-Shot Class-Incremental Learning

Junsu Kim, Yunhoe Ku, Seungryul Baek

机构 * UNIST(全南国立科学技术大学) DeepBrain AI NVIDIA Foundation Models LAB, MODULABS(NVIDIA基础模型实验室,MODULABS)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 6th CLVISION ICCV Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04106 2025-07-18 cs.CV cs.AI 70%

MRGen: Segmentation Data Engine for Underrepresented MRI Modalities

Haoning Wu, Ziheng Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by ICCV 2025; Project Page: https://haoningwu3639.github.io/MRGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12236 2025-07-17 cs.CV 70%

Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models

Felix Nützel, Mischa Dombrowski, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗赖堡-亚历山大大学埃尔兰根-纽伦堡) Imperial College London(伦敦帝国理工学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 20 pages, 6 figures. To appear in Proc. MIDL 2025 (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10855 2025-07-16 cs.CV 70%

Sparse Fine-Tuning of Transformers for Generative Tasks

Wei Chen, Jingxi Yu, Zichen Miao, Qiang Qiu

专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments Accepted by International Conference on Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08039 2025-07-14 cs.CV cs.AI cs.LG 70%

Towards Evaluating Robustness of Prompt Adherence in Text to Image Models

Sujith Vemishetty, Advitiya Arora, Anupama Sharma

机构 * Synechron

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04218 2025-07-08 cs.CV 70%

DreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design

Xiwei Hu, Haokun Chen, Zhongqi Qi, Hui Zhang, Dexiang Hong, Jie Shao, Xinglong Wu

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室) Fudan University(复旦大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09721 2025-07-08 cs.LG cs.CV 70%

Finetuning CLIP to Reason about Pairwise Differences

Dylan Sam, Devin Willmott, Joao D. Semedo, J. Zico Kolter

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20672 2025-07-03 cs.CV 70%

BizGen: Advancing Article-level Visual Text Rendering for Infographics Generation

Yuyang Peng, Shishi Xiao, Keming Wu, Qisheng Liao, Bohan Chen, Kevin Lin, Danqing Huang, Ji Li, Yuhui Yuan

机构 * Tsinghua University(清华大学) Brown University(布朗大学) University of Liverpool(利物浦大学) Microsoft Research Asia(微软亚洲研究院) Microsoft(微软公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by CVPR 2025. Project Page: https://bizgen-msra.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17726 2025-06-26 cs.CV cs.CL 70%

VICCA: Visual Interpretation and Comprehension of Chest X-ray Anomalies in Generated Report Without Human Feedback

Sayeh Gholipour Picha, Dawood Al Chanti, Alice Caplier

机构 * Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔研究所) GIPSA-lab(GIPSA实验室)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Journal ref Machine Learning with Applications, Volume 21, 2025, 100684, ISSN 2666-8270

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10575 2025-06-13 cs.CV 70%

Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning

Chun-Mei Feng, Kai Yu, Xinxing Xu, Salman Khan, Rick Siow Mong Goh, Wangmeng Zuo, Yong Liu

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局) University of Minnesota(明尼苏达大学) Microsoft Research Asia Singapore(微软亚洲研究院新加坡分部) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Australian National University(澳大利亚国立大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Journal ref TPAMI-2024-04-1021

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04606 2025-06-12 cs.CV 70%

Enhancing Low-Cost Video Editing with Lightweight Adaptors and Temporal-Aware Inversion

Yangfan He, Sida Li, Jianhui Wang, Kun Li, Xinyuan Song, Xinhang Yuan, Keqin Li, Kuan Lu, Menghao Huo, Jingqun Tang, Yi Xin, Jiaqi Chen, Miao Zhang, Xueqian Wang

机构 * University of Minnesota—Twin Cities(明尼苏达大学-双城分校) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) Xiamen University(厦门大学) Emory University(埃默里大学) Washington University, Saint Louis(圣路易斯华盛顿大学) Cornell University(康奈尔大学) Nanjing University(南京大学) Santa Clara University(圣克拉拉大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05843 2025-06-09 cs.CV 70%

FontAdapter: Instant Font Adaptation in Visual Text Generation

Myungkyu Koo, Subin Kim, Sangkyung Kwak, Jaehyun Nam, Seojin Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) General Robotics(通用机器人) Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://fontadapter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07089 2025-06-03 cs.CV cs.CL 70%

OmniCaptioner: One Captioner to Rule Them All

Yiting Lu, Jiakang Yuan, Zhen Li, Shitian Zhao, Qi Qin, Xinyue Li, Le Zhuo, Licheng Wen, Dongyang Liu, Yuewen Cao, Xiangchao Yan, Xin Li, Tianshuo Peng, Shufei Zhang, Botian Shi, Tao Chen, Zhibo Chen, Lei Bai, Peng Gao, Bo Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments More visualizations on Homepage: https://alpha-innovator.github.io/OmniCaptioner-project-page and Official code: https://github.com/Alpha-Innovator/OmniCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19398 2025-05-30 cs.CV 70%

Erasing Concepts, Steering Generations: A Comprehensive Survey of Concept Suppression

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * Huazhong University of Science and Technology, China(华中科技大学) University of Nevada, Reno(内华达大学拉斯维加斯分校)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14135 2025-05-29 cs.CV 70%

Hunyuan-Game: Industrial-grade Intelligent Game Creation Model

Ruihuang Li, Caijin Zhou, Shoujian Zheng, Jianxiang Lu, Jiabin Huang, Comi Chen, Junshu Tang, Guangzheng Xu, Jiale Tao, Hongmei Wang, Donghao Li, Wenqing Yu, Senbo Wang, Zhimin Li, Yetshuan Shi, Haoyu Yang, Yukun Wang, Wenxun Dai, Jiaqi Li, Linqing Wang, Qixun Wang, Zhiyong Xu, Yingfang Zhang, Jiangfeng Xiong, Weijie Kong, Chao Zhang, Hongxin Zhang, Qiaoling Zheng, Weiting Guo, Xinchi Deng, Yixuan Li, Renjia Wei, Yulin Jian, Duojun Huang, Xuhua Ren, Junkun Yuan, Zhengguang Zhou, Jiaxiang Cheng, Bing Ma, Shirui Huang, Jiawang Bai, Chao Li, Sihuan Lin, Yifu Sun, Yuan Zhou, Joey Wang, Qin Lin, Tianxiang Zheng, Jingmiao Yu, Jihong Zhang, Caesar Zhong, Di Wang, Yuhong Liu, Linus, Jie Jiang, Longhuang Wu, Shuai Shao, Qinglin Lu

机构 * Tencent(腾讯)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18434 2025-05-27 cs.CV cs.AI 70%

TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP

Yuliang Cai, Jesse Thomason, Mohammad Rostami

机构 * University of Southern California(南加州大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19722 2025-05-20 cs.LG cs.AI cs.CV 70%

JetFormer: An Autoregressive Generative Model of Raw Images and Text

Michael Tschannen, André Susano Pinto, Alexander Kolesnikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICLR 2025. Code available at https://github.com/google-research/big_vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12322 2025-05-20 cs.LG cs.CV 70%

Model alignment using inter-modal bridges

Ali Gholamzadeh, Noor Sajid

机构 * MPI for Biological Cybernetics & University of Tübingen(生物感知研究所及图宾根大学) Kempner Institute, Harvard University(凯普纳研究所及哈佛大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03859 2025-05-08 cs.CY cs.AI cs.CV 70%

Deepfakes on Demand: the rise of accessible non-consensual deepfake image generators

Will Hawkins, Chris Russell, Brent Mittelstadt

机构 * Oxford Internet Institute(牛津互联网研究所) University of Oxford(牛津大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 13 pages

Journal ref FAccT '25: Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏