arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2506.03988 2025-06-10 cs.CV cs.LG 57%

RAID: A Dataset for Testing the Adversarial Robustness of AI-Generated Image Detectors

Hicham Eddoubi, Jonas Ricker, Federico Cocchi, Lorenzo Baraldi, Angelo Sotgiu, Maura Pintor, Marcella Cornia, Lorenzo Baraldi, Asja Fischer, Rita Cucchiara, Battista Biggio

机构 * University of Cagliari(卡利里大学) Ruhr University Bochum(波恩鲁尔大学) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) Sapienza University of Rome(罗马萨皮恩扎大学) CINI(CINI研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19285 2025-06-09 cs.CV 57%

On the Importance of Text Preprocessing for Multimodal Representation Learning and Pathology Report Generation

Ruben T. Lucassen, Tijn van de Luijtgaarden, Sander P. J. Moonemans, Gerben E. Breimer, Willeke A. M. Blokx, Mitko Veta

机构 * Dept. of Pathology, University Medical Center Utrecht(病理学系,乌得勒支大学医学中心) Dept. of Biomedical Engineering, Eindhoven University of Technology(生物医学工程系,埃因霍温理工大学) Dept. of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05113 2025-06-09 cs.CV cs.AI cs.LG 57%

LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models

Lukas Helff, Felix Friedrich, Manuel Brack, Kristian Kersting, Patrick Schramowski

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments In Proceedings of the 42st International Conference on Machine Learning (ICML 2025), Project page at https://ml-research.github.io/human-centered-genai/projects/llavaguard/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05313 2025-06-06 cs.CV 57%

MARBLE: Material Recomposition and Blending in CLIP-Space

Ta-Ying Cheng, Prafull Sharma, Mark Boss, Varun Jampani

机构 * University of Oxford(牛津大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stability AI

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03998 2025-06-04 cs.CV eess.IV 57%

PHISWID: Physics-Inspired Underwater Image Dataset Synthesized from RGB-D Images

Reina Kaneko, Takumi Ueda, Hiroshi Higashi, Yuichi Tanaka

机构 * Graduate School of Engineering, The University of Osaka(大阪大学工学研究科) Graduate School of BASE, Tokyo University of Agriculture and Technology(东京大学农业技术大学院大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01853 2025-06-03 cs.CV 57%

ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding

Junliang Ye, Zhengyi Wang, Ruowen Zhao, Shenghao Xie, Jun Zhu

机构 * Tsinghua University(清华大学) Peking University(北京大学) ShengShu(盛舒)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page: https://github.com/JAMESYJL/ShapeLLM-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01379 2025-06-03 cs.CV 57%

RadarSplat: Radar Gaussian Splatting for High-Fidelity Data Synthesis and 3D Reconstruction of Autonomous Driving Scenes

Pou-Chun Kung, Skanda Harisha, Ram Vasudevan, Aline Eid, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24441 2025-06-02 cs.CV 57%

SORCE: Small Object Retrieval in Complex Environments

Chunxu Liu, Chi Xie, Xiaxu Chen, Wei Li, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Tongji University(同济大学) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project Page: https://github.com/MCG-NJU/SORCE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23977 2025-06-02 cs.CV cs.AI cs.LG 57%

VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL

Yichen Feng, Zhangchen Xu, Fengqing Jiang, Yuetai Li, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Radha Poovendran

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Project page at https://visualsphinx.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22613 2025-05-29 cs.CV cs.AI cs.CL 57%

RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction

Yuchi Wang, Yishuo Cai, Shuhuai Ren, Sihan Yang, Linli Yao, Yuanxin Liu, Yuanxing Zhang, Pengfei Wan, Xu Sun

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments code: https://github.com/wangyuchi369/RICO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21647 2025-05-29 cs.CV cs.LG 57%

QuARI: Query Adaptive Retrieval Improvement

Eric Xing, Abby Stylianou, Robert Pless, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Saint Louis University(圣路易斯大学) The George Washington University(乔治华盛顿大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14664 2025-05-29 cs.CV cs.AI cs.HC cs.LG 57%

AKRMap: Adaptive Kernel Regression for Trustworthy Visualization of Cross-Modal Embeddings

Yilin Ye, Junchao Huang, Xingchen Zeng, Jiazhi Xia, Wei Zeng

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19952 2025-05-27 cs.CV cs.IR 57%

Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval

Rong-Cheng Tu, Wenhao Sun, Hanzhe You, Yingjie Wang, Jiaxing Huang, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) School of Information Science and Technology, University of Science and Technology of China, Hefei, China(中国科学技术大学信息科学与技术学院) Sun Yat-sen University Shenzhen Campus, School of Cyber Science and Technology, Shenzhen, China(中山大学深圳校区计算机科学与技术学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19707 2025-05-27 cs.CV cs.IR 57%

MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval

Rong-Cheng Tu, Zhao Jin, Jingyi Liao, Xiao Luo, Yingjie Wang, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Department of Computer Science, University of California, Los Angeles, USA(加州大学洛杉矶分校计算机科学系) Sun Yat-sen University Shenzhen Campus, School of Cyber Science and Technology, Shenzhen, China(中山大学深圳校区信息科学与技术学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00176 2025-05-22 cs.CV 57%

Opt-In Art: Learning Art Styles Only from Few Examples

Hui Ren, Joanna Materzynska, Rohit Gandikota, David Bau, Antonio Torralba

机构 * ShanghaiTech University(上海科技大学) MIT(麻省理工学院) Northeastern University(东北大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16515 2025-05-21 cs.CV cs.AI cs.IR 57%

Automatic Synthetic Data and Fine-grained Adaptive Feature Alignment for Composed Person Retrieval

Delong Liu, Haiwen Li, Zhaohui Hou, Zhicheng Zhao, Fei Su, Yuan Dong

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) SenseTime(商汤科技) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Intereactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05505 2025-05-21 cs.LG cs.CR cs.CV stat.ML 57%

Differentially Private Synthetic Data via APIs 3: Using Simulators Instead of Foundation Model

Zinan Lin, Tadas Baltrusaitis, Wenyu Wang, Sergey Yekhanin

机构 * Microsoft Research Redmond(微软研究院红mond分部) Microsoft Cambridge(微软剑桥分部)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Published in: (1) ICLR 2025 Workshop on Data Problems, (2) ICLR 2025 Workshop on Synthetic Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16401 2025-05-20 cs.CV cs.LG 57%

Understanding the Effect of using Semantically Meaningful Tokens for Visual Representation Learning

Neha Kalibhat, Priyatham Kattakinda, Sumit Nawathe, Arman Zarei, Nikita Seleznev, Samuel Sharpe, Senthil Kumar, Soheil Feizi

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Published at CVPR Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13123 2025-05-20 cs.CV cs.AI 57%

Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training

Xinsong Zhang, Yarong Zeng, Xinting Huang, Hu Hu, Runquan Xie, Han Hu, Zhanhui Kang

机构 * Tencent(腾讯)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11121 2025-05-19 cs.CV 57%

Redundancy-Aware Pretraining of Vision-Language Foundation Models in Remote Sensing

Mathis Jürgen Adler, Leonard Hackel, Gencer Sumbul, Begüm Demir

机构 * TU Berlin(柏林技术大学) BIFOLD(BIFOLD机构) EPFL(苏黎世联邦理工学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025. Our code is available at https://git.tu-berlin.de/rsim/redundacy-aware-rs-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06467 2025-05-13 cs.CV cs.HC 57%

PromptIQ: Who Cares About Prompts? Let System Handle It -- A Component-Aware Framework for T2I Generation

Nisan Chhetri, Arpan Sainju

机构 * North Carolina State University(北卡罗来纳州立大学) Middle Tennessee State University(中田纳西州立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05505 2025-05-12 cs.CV eess.IV 57%

Apply Hierarchical-Chain-of-Generation to Complex Attributes Text-to-3D Generation

Yiming Qin, Zhu Xu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page here: https://hierarchical-chain-of-generation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03242 2025-05-07 cs.CV cs.AI 57%

Seeing the Abstract: Translating the Abstract Language for Vision Language Models

Davide Talon, Federico Girella, Ziyue Liu, Marco Cristani, Yiming Wang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted to CVPR25. Project page: https://davidetalon.github.io/fashionact-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01838 2025-05-06 cs.CV 57%

MVHumanNet++: A Large-scale Dataset of Multi-view Daily Dressing Human Captures with Richer Annotations for 3D Human Digitization

Chenghong Li, Hongjie Liao, Yihao Zhi, Xihe Yang, Zhengwentai Sun, Jiahao Chang, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Future Network of Intelligence Institute, CUHK-Shenzhen(智能网络研究院,CUHK-深圳)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments project page: https://kevinlee09.github.io/research/MVHumanNet++/. arXiv admin note: substantial text overlap with arXiv:2312.02963

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20996 2025-04-30 cs.CV 57%

X-Fusion: Introducing New Modality to Frozen Large Language Models

Sicheng Mo, Thao Nguyen, Xun Huang, Siddharth Srinivasan Iyer, Yijun Li, Yuchen Liu, Abhishek Tandon, Eli Shechtman, Krishna Kumar Singh, Yong Jae Lee, Bolei Zhou, Yuheng Li

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project Page: https://sichengmo.github.io/XFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10240 2025-04-30 cs.HC cs.AI cs.CV 57%

AltCanvas: A Tile-Based Image Editor with Generative AI for Blind or Visually Impaired People

Seonghee Lee, Maho Kohga, Steve Landau, Sile O'Modhrain, Hari Subramonyam

机构 * Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07520 2025-04-30 cs.CV 57%

Instruct-ReID: A Multi-purpose Person Re-identification Task with Instructions

Weizhen He, Yiheng Deng, Shixiang Tang, Qihao Chen, Qingsong Xie, Yizhou Wang, Lei Bai, Feng Zhu, Rui Zhao, Wanli Ouyang, Donglian Qi, Yunfeng Yan

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院) Liaoning Technical University(辽宁工程技术大学) Shanghai Jiao Tong University(上海交通大学) Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学清元研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14684 2025-04-29 eess.IV cs.AI cs.CV 57%

Learning Modality-Aware Representations: Adaptive Group-wise Interaction Network for Multimodal MRI Synthesis

Tao Song, Yicheng Wu, Minhao Hu, Xiangde Luo, Linda Wei, Guotai Wang, Yi Guo, Feng Xu, Shaoting Zhang

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00238 2025-04-18 cs.AI cs.CV cs.LG q-bio.NC 57%

Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem

Declan Campbell, Sunayana Rane, Tyler Giallanza, Nicolò De Sabbata, Kia Ghods, Amogh Joshi, Alexander Ku, Steven M. Frankland, Thomas L. Griffiths, Jonathan D. Cohen, Taylor W. Webb

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11858 2025-04-17 cs.CV 57%

Synthetic Data for Blood Vessel Network Extraction

Joël Mathys, Andreas Plesner, Jorel Elmiger, Roger Wattenhofer

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Presented at SynthData Workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏