arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2408.08189 2025-08-18 cs.CV 57%

FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance

Jiasong Feng, Ao Ma, Jing Wang, Ke Cao, Zhanjie Zhang

机构 * AI Research(360人工智能研究院) Beijing University of Technology(北京理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09919 2025-08-14 eess.IV cs.AI cs.CV 57%

T-CACE: A Time-Conditioned Autoregressive Contrast Enhancement Multi-Task Framework for Contrast-Free Liver MRI Synthesis, Segmentation, and Diagnosis

Xiaojiao Xiao, Jianfeng Zhao, Qinmin Vivian Hu, Guanghui Wang

机构 * Department of Computer Science, Toronto Metropolitan University(计算机科学系,多伦多 Metropolitan 大学) School of Biomedical Engineering, Western University(生物医学工程学院,西部大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments IEEE Journal of Biomedical and Health Informatics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12341 2025-08-14 cs.MM 57%

Multimodal LLM-based Query Paraphrasing for Video Search

Jiaxin Wu, Chong-Wah Ngo, Wing-Kwong Chan, Sheng-Hua Zhong, Xiong-Yong Wei, Qing Li

专题命中 文生图 :text-to-image(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08123 2025-08-12 eess.IV cs.CV 57%

A Physics-Driven Neural Network with Parameter Embedding for Generating Quantitative MR Maps from Weighted Images

Lingjing Chen, Chengxiu Zhang, Yinqiao Yi, Yida Wang, Yang Song, Xu Yan, Shengfang Xu, Dalin Zhu, Mengqiu Cao, Yan Zhou, Chenglong Wang, Guang Yang

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06715 2025-08-12 cs.CV 57%

Restage4D: Reanimating Deformable 3D Reconstruction from a Single Video

Jixuan He, Chieh Hubert Lin, Lu Qi, Ming-Hsuan Yang

机构 * Cornell Tech(康奈尔科技) University of California, Merced(加州大学默塞德分校) Wuhan University(武汉大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04801 2025-08-08 cs.CV 57%

ACM Multimedia Grand Challenge on ENT Endoscopy Analysis

Trong-Thuan Nguyen, Viet-Tham Huynh, Thao Thi Phuong Dao, Ha Nguyen Thi, Tien To Vu Thuy, Uyen Hanh Tran, Tam V. Nguyen, Thanh Dinh Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) Thong Nhat Hospital(通那医院) Faculty of Medicine, Pham Ngoc Thach University of Medicine(范 Ngoc Thach 医学院) Cho Ray Hospital(Cho Ray 医院) University of Dayton(Dayton 大学) University of Health Sciences, VNU-HCM(越南胡志明市健康科学大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09908 2025-08-07 cs.LG cs.AI cs.CL cs.CV 57%

Beyond Adapter Retrieval: Latent Geometry-Preserving Composition via Sparse Task Projection

Pengfei Jin, Peng Shu, Sifan Song, Sekeun Kim, Qing Xiao, Cheng Chen, Tianming Liu, Xiang Li, Quanzheng Li

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03091 2025-08-06 cs.AI cs.CR cs.CV 57%

T2UE: Generating Unlearnable Examples from Text Descriptions

Xingjun Ma, Hanxun Huang, Tianwei Song, Ye Sun, Yifeng Gao, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments To appear in ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23343 2025-08-01 cs.CV eess.IV 57%

Who is a Better Talker: Subjective and Objective Quality Assessment for AI-Generated Talking Heads

Yingjie Zhou, Jiezhang Cao, Zicheng Zhang, Farong Wen, Yanwei Jiang, Jun Jia, Xiaohong Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) PengCheng Laboratory(鹏城实验室) Harvard Medical School(哈佛医学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21820 2025-07-30 cs.CV 57%

Anyone Can Jailbreak: Prompt-Based Attacks on LLMs and T2Is

Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Intelligent Science, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学智能科学系) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18633 2025-07-25 cs.CV 57%

Identifying Prompted Artist Names from Generated Images

Grace Su, Sheng-Yu Wang, Aaron Hertzmann, Eli Shechtman, Jun-Yan Zhu, Richard Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page: https://graceduansu.github.io/IdentifyingPromptedArtists

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18616 2025-07-25 cs.CV cs.AI cs.CL cs.LG 57%

SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning

Si-Woo Kim, MinJu Jeon, Ye-Chan Kim, Soeun Lee, Taewhan Kim, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17182 2025-07-24 cs.CV 57%

Hierarchical Fusion and Joint Aggregation: A Multi-Level Feature Representation Method for AIGC Image Quality Assessment

Linghe Meng, Jiarun Song

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10921 2025-07-22 cs.CV 57%

Towards Cross-modal Retrieval in Chinese Cultural Heritage Documents: Dataset and Solution

Junyi Yuan, Jian Zhang, Fangyu Wu, Dongming Lu, Huanda Lu, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) NingboTech University(宁波科技大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13221 2025-07-18 cs.CV cs.AI 57%

Synthesizing Reality: Leveraging the Generative AI-Powered Platform Midjourney for Construction Worker Detection

Hongyang Zhao, Tianyu Liang, Sina Davari, Daeho Kim

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments This work was presented at ASCE International Conference on Computing in Civil Engineering (i3CE) 2024 and is currently under consideration for publication in ASCE proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06210 2025-07-17 cs.CV cs.CL 57%

CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions

Yuchen Huang, Zhiyuan Fan, Zhitao He, Sandeep Polisetty, Wenyan Li, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Copenhagen(哥本哈根大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 25 pages, COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24085 2025-07-15 cs.CV cs.AI 57%

Imagine for Me: Creative Conceptual Blending of Real Images and Text via Blended Attention

Wonwoong Cho, Yanxia Zhang, Yan-Ying Chen, David I. Inouye

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(埃尔摩家庭电气与计算机工程学院,普渡大学) Toyota Research Institute(丰田研究院)

专题命中 文生图 :diffusion(abstract);分类 cs.CV

Comments Project website is available at https://imagineforme.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07333 2025-07-11 cs.CV 57%

Scalable and Realistic Virtual Try-on Application for Foundation Makeup with Kubelka-Munk Theory

Hui Pang, Sunil Hadap, Violetta Shevchenko, Rahul Suresh, Amin Banitalebi-Dehkordi

机构 * Amazon(亚马逊)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Presented at the workshop Three questions about virtual try-on at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06654 2025-07-10 cs.CV cs.AI cs.IR 57%

MS-DPPs: Multi-Source Determinantal Point Processes for Contextual Diversity Refinement of Composite Attributes in Text to Image Retrieval

Naoya Sogi, Takashi Shibata, Makoto Terao, Masanori Suganuma, Takayuki Okatani

机构 * Visual Intelligence Research Laboratories, NEC Corporation(NEC公司视觉智能研究实验室) Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) RIKEN Center for AIP(理化学研究所AIP研究中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments IJCAI 2025. Code: https://github.com/NEC-N-SOGI/msdpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04709 2025-07-10 cs.CV 57%

TIP-I2V: A Million-Scale Real Text and Image Prompt Dataset for Image-to-Video Generation

Wenhao Wang, Yi Yang

机构 * University of Technology Sydney(悉尼技术大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04735 2025-07-08 cs.CV 57%

An analysis of vision-language models for fabric retrieval

Francesco Giuliari, Asif Khan Pattan, Mohamed Lamine Mekhalfi, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布雷诺-科塞勒基金会)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted at Ital-IA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00392 2025-07-08 cs.CV 57%

Learning Dense Feature Matching via Lifting Single 2D Image to 3D Space

Yingping Liang, Yutao Hu, Wenqi Shao, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Shanghai Al Laboratory(上海阿尔实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Official Code: https://github.com/Sharpiless/L2M

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03977 2025-07-04 eess.IV cs.CV cs.LG 57%

Bi-modality medical images synthesis by a bi-directional discrete process matching method

Zhe Xiong, Qiaoqiao Ding, Xiaoqun Zhang

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01387 2025-07-03 eess.IV cs.CV 57%

BronchoGAN: Anatomically consistent and domain-agnostic image-to-image translation for video bronchoscopy

Ahmad Soliman, Ron Keuth, Marian Himstedt

机构 * Medical Informatics(医学信息学) University of Lübeck(吕贝克大学) Faculty of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Journal ref International Journal of Computer Assisted Radiology and Surgery, 1-8 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21780 2025-06-25 cs.CV 57%

Compositional Scene Understanding through Inverse Generative Modeling

Yanbo Wang, Justin Dauwels, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments ICML 2025, Webpage: https://energy-based-model.github.io/compositional-inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12273 2025-06-25 cs.CV 57%

Beyond Reconstruction: A Physics Based Neural Deferred Shader for Photo-realistic Rendering

Zhuo He, Paul Henderson, Nicolas Pugeault

机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11748 2025-06-24 cs.CV 57%

ILIAS: Instance-Level Image retrieval At Scale

Giorgos Kordopatis-Zilos, Vladan Stojnić, Anna Manko, Pavel Šuma, Nikolaos-Antonios Ypsilantis, Nikos Efthymiadis, Zakaria Laskar, Jiří Matas, Ondřej Chum, Giorgos Tolias

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19637 2025-06-24 cs.CV 57%

ReNeg: Learning Negative Embedding with Reward Guidance

Xiaomin Li, Yixuan Liu, Takashi Isobe, Xu Jia, Qinpeng Cui, Dong Zhou, Dong Li, You He, Huchuan Lu, Zhongdao Wang, Emad Barsoum

机构 * Advanced Micro Devices Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) Tsinghua University(清华大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Code: https://github.com/AMD-AIG-AIMA/ReNeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02357 2025-06-17 cs.CV 57%

Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content

Zicheng Zhang, Tengchuan Kou, Shushi Wang, Chunyi Li, Wei Sun, Wei Wang, Xiaoyu Li, Zongyu Wang, Xuezhi Cao, Xiongkuo Min, Xiaohong Liu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments CVPR 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10365 2025-06-17 cs.CV cs.AI 57%

Robust image representations with counterfactual contrastive learning

Mélanie Roschewitz, Fabio De Sousa Ribeiro, Tian Xia, Galvin Khara, Ben Glocker

机构 * Imperial College London(伦敦帝国理工学院) Kheiron Medical Technologies(Kheiron医疗技术公司)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Code available at https://github.com/biomedia-mira/counterfactual-contrastive/

Journal ref Medical Image Analysis, Volume 105, October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏