arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2601.08790 2026-01-14 cs.CV 57%

Aggregating Diverse Cue Experts for AI-Generated Image Detection

聚合多样化线索专家用于AI生成图像检测

Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出MCAN框架,通过整合多种互补线索提升AI生成图像检测的泛化能力,实验显示在GenImage数据集上性能优于现有方法。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06642 2026-01-13 cs.CV cs.AI 57%

Boosting Overlapping Organoid Instance Segmentation Using Pseudo-Label Unmixing and Synthesis-Assisted Learning

通过伪标签解混和合成辅助学习提升重叠类器官实例分割

Gui Huang, Kangyuan Zheng, Xuan Cai, Jiaqi Wang, Jianjia Zhang, Kaida Ning, Wenbo Wei, Yujuan Zhu, Jiong Zhang, Mengting Liu

机构 * School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Peng Cheng Laboratory(鹏城实验室) The First Affiliated Hospital of Shenzhen University, Shenzhen Second People's Hospital(深圳大学第一附属医院、深圳第二人民医院) The Research Center of Clinical Medicine, Affiliated Hospital of Nantong University, Medical School of Nantong University(临床医学研究中心、南通大学附属医院、南通大学医学院) Cixi Institute of Biomedical Engineering, Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences(慈溪生物医学工程研究所、宁波材料技术与工程研究所、中国科学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出通过伪标签解混和合成辅助学习提升类器官实例分割,解决重叠问题,实现高效率的标注数据利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05399 2026-01-12 cs.CV cs.AI cs.IR 57%

Multi-task Cross-modal Learning for Chest X-ray Image Retrieval

多任务跨模态学习用于胸部X射线图像检索

Zhaohui Liang, Sivaramakrishnan Rajaraman, Niccolo Marini, Zhiyun Xue, Sameer Antani

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出多任务学习框架,通过改进BiomedCLIP模型,提升胸部X射线图像与文本的跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03193 2026-01-09 cs.CV cs.AI 57%

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

专题命中 文生图 :image generation(abstract);分类 cs.CV

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23453 2025-12-30 cs.CV cs.AI 57%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04809 2025-12-30 cs.CV cs.LG 57%

Investigation of the Impact of Synthetic Training Data in the Industrial Application of Terminal Strip Object Detection

终端条目目标检测在工业应用中的合成训练数据影响研究

Nico Baumgart, Markus Lange-Hegermann, Mike Mücke

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究了终端条目目标检测中合成训练数据的影响,通过合成图像与真实数据结合,验证了DINO模型在复杂工业环境中的高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19680 2025-12-23 cs.CV 57%

VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

VA-$π$: 变分策略对齐用于像素感知自回归生成

Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao

机构 * Huazhong University of Science & Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。

Comments 21 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19300 2025-12-23 cs.CV 57%

RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning

RMLer: 通过强化混合学习跨多样类别合成新物体

Jun Li, Zikun Chen, Haibo Chen, Shuo Chen, Jian Yang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 RMLer通过强化混合学习框架,有效解决跨类别文本到图像生成中的概念混合问题,提升合成物体的连贯性和保真度。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25387 2025-12-16 cs.CV 57%

Instance-Level Composed Image Retrieval

实例级组合图像检索

Bill Psomas, George Retsinas, Nikos Efthymiadis, Panagiotis Filntisis, Yannis Avrithis, Petros Maragos, Ondrej Chum, Giorgos Tolias

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 BASIC通过无训练方法利用预训练视觉-语言模型,在实例级组合图像检索中实现了新的状态。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18331 2025-12-10 cs.CV 57%

End-to-End Fine-Tuning of 3D Texture Generation using Differentiable Rewards

使用可微奖励对3D纹理生成进行端到端微调

AmirHossein Zamani, Tianhao Xie, Amir G. Aghdam, Tiberiu Popa, Eugene Belilovsky

机构 * Mila – Quebec AI Institute(魁北克AI研究所) Concordia University(康科迪亚大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的可微框架,通过可微奖励函数优化3D纹理生成,提升对3D结构的理解和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24387 2025-12-05 cs.CV 57%

CoCoIns: Consistent Subject Generation via Contrastive Instantiated Concepts

CoCoIns: 通过对比实例概念实现一致主体生成

Lee Hsin-Ying, Kelvin C. K. Chan, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CoCoIns通过对比学习实现一致主体生成,提升多生成内容的一致性与灵活性。

Comments TMLR 2025. Project page: https://contrastive-concept-instantiation.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17793 2025-12-05 cs.CV cs.AI 57%

SYNTHIA: Novel Concept Design with Affordance Composition

SYNTHIA:基于功能连贯性的新型概念设计

Hyeonjeong Ha, Xiaomeng Jin, Jeonghwan Kim, Jiateng Liu, Zhenhailong Wang, Khanh Duy Nguyen, Ansel Blume, Nanyun Peng, Kai-Wei Chang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 SYNTHIA通过分层概念本体和课程学习方案,实现基于功能连贯性的新颖设计生成。

Comments ACL 2025 Main, Code is available https://github.com/HyeonjeongHa/SYNTHIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03534 2025-12-04 cs.CV cs.AI 57%

Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation

重新思考推理时的提示设计以实现文本到视觉生成的扩展

Subin Kim, Sangwoo Mo, Mamshad Nayeem Rizve, Yiran Xu, Difan Liu, Jinwoo Shin, Tobias Hinz

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 PRIS通过自适应修改提示以实现文本到视觉生成的推理时扩展,提高生成质量并解决提示固定导致的质量停滞问题。

Comments Visualizations are available at the website: https://subin-kim-cv.github.io/PRIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 57%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01008 2025-12-01 cs.CV cs.AI 57%

IntrinsiX: High-Quality PBR Generation using Image Priors

IntrinsiX: 基于图像先验的高质量PBR生成

Peter Kocsis, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 IntrinsiX通过图像先验生成高质量PBR图像,提升内容创作中的重新照明和纹理生成能力。

Comments Project page: https://peter-kocsis.github.io/IntrinsiX/ Video: https://youtu.be/b0wVA44R93Y

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13575 2025-11-18 cs.CV cs.AI 57%

Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification

Linhan Zhou, Shuang Li, Neng Dong, Yonghang Tai, Yafei Zhang, Huafeng Li

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 9 pages, 4 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12331 2025-11-18 cs.CV 57%

SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models

Sepehr Kazemi Ranjbar, Kumail Alhamoud, Marzyeh Ghassemi

机构 * MIT(麻省理工学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17482 2025-11-13 cs.LG cs.AI cs.CV cs.HC 57%

What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models

Keyon Vafa, Sarah Bentley, Jon Kleinberg, Sendhil Mullainathan

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) Cornell University(康奈尔大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01184 2025-11-07 cs.CV cs.LG 57%

Bridging Generative and Discriminative Noisy-Label Learning via Direction-Agnostic EM Formulation

Fengbei Liu, Chong Wang, Yuanhong Chen, Yuyuan Liu, Gustavo Carneiro

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) Department of Radiology, Stanford University(斯坦福大学放射科) Oxford University(牛津大学) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(视觉、语音和信号处理中心(CVSSP)、塞维利亚大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00159 2025-11-04 cs.CV 57%

SonarSplat: Novel View Synthesis of Imaging Sonar via Gaussian Splatting

Advaith V. Sethuraman, Max Rucker, Onur Bagoren, Pou-Chun Kung, Nibarkavi N. B. Amutha, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01163 2025-11-04 cs.CV 57%

ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation

Yongyuan Liang, Wei Chow, Feng Li, Ziqiao Ma, Xiyao Wang, Jiageng Mao, Jiuhai Chen, Jiatao Gu, Yue Wang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Michigan(密歇根大学) University of Southern California(南加州大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Project Page: https://roverbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24278 2025-10-29 cs.CV cs.AI 57%

Training-free Source Attribution of AI-generated Images via Resynthesis

Pietro Bongini, Valentina Molinari, Andrea Costanzo, Benedetta Tondi, Mauro Barni

机构 * University of Siena, Department of Information Engineering and Mathematics(锡耶纳大学信息工程与数学系) IMT School(IMT学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 14 pages, 4 figures, 1 table, accepted at "The 17th IEEE INTERNATIONAL WORKSHOP ON INFORMATION FORENSICS AND SECURITY (WIFS2025)", Perth, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07555 2025-10-28 cs.CV cs.AI 57%

Synthesize Privacy-Preserving High-Resolution Images via Private Textual Intermediaries

Haoxiang Wang, Zinan Lin, Da Yu, Huishuai Zhang

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Google Research(谷歌研究院) Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09744 2025-10-28 cs.CV 57%

RealCustom++: Representing Images as Real Textual Word for Real-Time Customization

Zhendong Mao, Mengqi Huang, Fei Ding, Mingcong Liu, Qian He, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance Inc(字节跳动公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 18 pages

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08010 2025-10-28 cs.CV cs.AI 57%

Vision Transformers Don't Need Trained Registers

Nick Jiang, Amil Dravid, Alexei Efros, Yossi Gandelsman

机构 * UC Berkeley(伯克利大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page and code: https://avdravid.github.io/test-time-registers. Accepted to NeurIPS '25 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20639 2025-10-24 cs.CV 57%

Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging

Ibrahim Ethem Hamamci, Sezgin Er, Suprosanna Shit, Hadrien Reynaud, Dong Yang, Pengfei Guo, Marc Edgar, Daguang Xu, Bernhard Kainz, Bjoern Menze

机构 * University of Zurich(苏黎世大学) NVIDIA Imperial College London(伦敦帝国理工学院) FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15682 2025-10-21 cs.CV 57%

ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval

Guanqi Zhan, Yuanpei Liu, Kai Han, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学视觉几何组) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted by CBMI 2025 (IEEE International Conference on Content-Based Multimedia Indexing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15240 2025-10-20 cs.CV 57%

The Face of Persuasion: Analyzing Bias and Generating Culture-Aware Ads

Aysan Aghazadeh, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09823 2025-10-15 cs.CV 57%

KonfAI: A Modular and Fully Configurable Framework for Deep Learning in Medical Imaging

Valentin Boussot, Jean-Louis Dillenseger

机构 * INSERM, LTSI - UMR 1099 University of Rennes(法国里昂大学INSERM LTSI - UMR 1099)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments https://github.com/vboussot/KonfAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12260 2025-10-15 cs.CV cs.LG eess.IV 57%

AngularFuse: A Closer Look at Angle-based Perception for Spatial-Sensitive Multi-Modality Image Fusion

Xiaopeng Liu, Yupei Lin, Sen Zhang, Xiao Wang, Yukai Shi, Liang Lin

机构 * School of Information Engineering, Guangdong University of Technology(广东技术大学信息工程学院) TikTok, ByteDance Inc(字节跳动) School of Computer Science, Anhui University(安徽大学计算机科学学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments For the first time, angle-based perception was introduced into the multi-modality image fusion task

详情

展开后加载摘要…

URL PDF HTML 收藏