Aggregating Diverse Cue Experts for AI-Generated Image Detection
聚合多样化线索专家用于AI生成图像检测
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文提出MCAN框架,通过整合多种互补线索提升AI生成图像检测的泛化能力,实验显示在GenImage数据集上性能优于现有方法。
Comments Accepted by AAAI 2026
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
聚合多样化线索专家用于AI生成图像检测
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文提出MCAN框架,通过整合多种互补线索提升AI生成图像检测的泛化能力,实验显示在GenImage数据集上性能优于现有方法。
Comments Accepted by AAAI 2026
通过伪标签解混和合成辅助学习提升重叠类器官实例分割
机构 * School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) ; Peng Cheng Laboratory(鹏城实验室) ; The First Affiliated Hospital of Shenzhen University, Shenzhen Second People's Hospital(深圳大学第一附属医院、深圳第二人民医院) ; The Research Center of Clinical Medicine, Affiliated Hospital of Nantong University, Medical School of Nantong University(临床医学研究中心、南通大学附属医院、南通大学医学院) ; Cixi Institute of Biomedical Engineering, Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences(慈溪生物医学工程研究所、宁波材料技术与工程研究所、中国科学院)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文提出通过伪标签解混和合成辅助学习提升类器官实例分割,解决重叠问题,实现高效率的标注数据利用。
多任务跨模态学习用于胸部X射线图像检索
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出多任务学习框架,通过改进BiomedCLIP模型,提升胸部X射线图像与文本的跨模态检索性能。
UniCorn:通过自生成监督实现自我改进的统一多模态模型
机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) ; FDU(复旦大学) ; ECNU(华东师范大学) ; CUHK(香港中文大学) ; NJU(南京大学) ; SUDA(上海大学)
专题命中 文生图 :image generation(abstract);分类 cs.CV
AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。
CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码
机构 * Researcher(研究者)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。
终端条目目标检测在工业应用中的合成训练数据影响研究
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
AI总结 本文研究了终端条目目标检测中合成训练数据的影响,通过合成图像与真实数据结合,验证了DINO模型在复杂工业环境中的高效检测性能。
VA-$π$: 变分策略对齐用于像素感知自回归生成
机构 * Huazhong University of Science & Technology(华中科技大学) ; National University of Singapore(新加坡国立大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。
Comments 21 pages, 24 figures
RMLer: 通过强化混合学习跨多样类别合成新物体
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 RMLer通过强化混合学习框架,有效解决跨类别文本到图像生成中的概念混合问题,提升合成物体的连贯性和保真度。
Comments accepted by AAAI2026
实例级组合图像检索
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 BASIC通过无训练方法利用预训练视觉-语言模型,在实例级组合图像检索中实现了新的状态。
Comments NeurIPS 2025
使用可微奖励对3D纹理生成进行端到端微调
机构 * Mila – Quebec AI Institute(魁北克AI研究所) ; Concordia University(康科迪亚大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出了一种端到端的可微框架,通过可微奖励函数优化3D纹理生成,提升对3D结构的理解和生成质量。
CoCoIns: 通过对比实例概念实现一致主体生成
机构 * University of California, Merced(加州大学默塞德分校) ; Google DeepMind(谷歌DeepMind)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 CoCoIns通过对比学习实现一致主体生成,提升多生成内容的一致性与灵活性。
Comments TMLR 2025. Project page: https://contrastive-concept-instantiation.github.io
SYNTHIA:基于功能连贯性的新型概念设计
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 SYNTHIA通过分层概念本体和课程学习方案,实现基于功能连贯性的新颖设计生成。
Comments ACL 2025 Main, Code is available https://github.com/HyeonjeongHa/SYNTHIA
重新思考推理时的提示设计以实现文本到视觉生成的扩展
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 PRIS通过自适应修改提示以实现文本到视觉生成的推理时扩展,提高生成质量并解决提示固定导致的质量停滞问题。
Comments Visualizations are available at the website: https://subin-kim-cv.github.io/PRIS
基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架
机构 * Dalian University of Technology(大连理工大学) ; Xinjiang Normal University(新疆师范大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。
Comments Submitted to ICASSP 2026 (under review)
IntrinsiX: 基于图像先验的高质量PBR生成
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 IntrinsiX通过图像先验生成高质量PBR图像,提升内容创作中的重新照明和纹理生成能力。
Comments Project page: https://peter-kocsis.github.io/IntrinsiX/ Video: https://youtu.be/b0wVA44R93Y
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
Comments 9 pages, 4 figures, accepted by AAAI 2026
机构 * MIT(麻省理工学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
机构 * Harvard University(哈佛大学) ; MIT(麻省理工学院) ; Cornell University(康奈尔大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
机构 * Cornell Tech(康奈尔科技) ; Cornell University(康奈尔大学) ; Department of Radiology, Stanford University(斯坦福大学放射科) ; Oxford University(牛津大学) ; Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(视觉、语音和信号处理中心(CVSSP)、塞维利亚大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Pennsylvania(宾夕法尼亚大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Michigan(密歇根大学) ; University of Southern California(南加州大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
Comments Project Page: https://roverbench.github.io/
机构 * University of Siena, Department of Information Engineering and Mathematics(锡耶纳大学信息工程与数学系) ; IMT School(IMT学院)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
Comments 14 pages, 4 figures, 1 table, accepted at "The 17th IEEE INTERNATIONAL WORKSHOP ON INFORMATION FORENSICS AND SECURITY (WIFS2025)", Perth, Australia
机构 * Peking University(北京大学) ; Microsoft Research(微软研究院) ; Google Research(谷歌研究院) ; Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; ByteDance Inc(字节跳动公司)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
Comments 18 pages
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)
机构 * UC Berkeley(伯克利大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
Comments Project page and code: https://avdravid.github.io/test-time-registers. Accepted to NeurIPS '25 (spotlight)
机构 * University of Zurich(苏黎世大学) ; NVIDIA ; Imperial College London(伦敦帝国理工学院) ; FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * VGG, University of Oxford(牛津大学视觉几何组) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
Comments Accepted by CBMI 2025 (IEEE International Conference on Content-Based Multimedia Indexing)
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
机构 * INSERM, LTSI - UMR 1099 University of Rennes(法国里昂大学INSERM LTSI - UMR 1099)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
Comments https://github.com/vboussot/KonfAI
机构 * School of Information Engineering, Guangdong University of Technology(广东技术大学信息工程学院) ; TikTok, ByteDance Inc(字节跳动) ; School of Computer Science, Anhui University(安徽大学计算机科学学院) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 文生图 :image synthesis(abstract);分类 cs.CV
Comments For the first time, angle-based perception was introduced into the multi-modality image fusion task