MC$^2$: Multi-concept Guidance for Customized Multi-concept Generation
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments 14 pages, 14 figures
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments 14 pages, 14 figures
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV
Comments Short version accepted at DPFM, ICLR'24; Full paper at NeurIPS'24
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments Project page at https://viper.epfl.ch/
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments ECCV 2024
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments 9 pages, 4 figures
专题命中 图像生成评测 :image generation(abstract);image synthesis(abstract);分类 cs.CV
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2023. Website: https://wysiwyr-itm.github.io/
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Journal ref Proceedings of the 31st ACM International Conference on Multimedia (ACM MM), 2023, Pages 4219-4227
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments Project page at https://design-bench.github.io/
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
专题命中 图像生成评测 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV
Comments 8 pages, accepted at the 6th International Workshop on Metamorphic Testing (MET'21)
数学视觉图表:评估大型语言模型数学图表生成能力的综合基准
机构 * Pandita AI Inc.(潘迪塔人工智能公司)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)
AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。
Comments Accepted at ICANN 2026
基于相关性的多奖励优化用于组合生成
机构 * Korea University(韩国大学) ; Korea Institute of Science and Technology(韩国科学技术院)
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract)
AI总结 本文提出相关性加权多奖励优化方法,通过调整概念奖励权重提升多概念生成效果,改进了SD3.5和FLUX.1-dev模型在多概念基准测试中的表现。
Comments Published at ECCV 2026
ContextBench: 为定向激活潜在特征修改上下文
机构 * Imperial College London(帝国理工学院伦敦校区) ; University College London(伦敦大学学院) ; University of Oxford(牛津大学) ; UK AI Security Institute(英国人工智能安全研究所)
专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract)
AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。
Comments Published at ICLR 2026
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
推进说话头生成:多模态方法、数据集、评估指标和损失函数的全面综述
机构 * Engineering Sciences, Homi Bhabha National Institute Training School Complex(工程科学,霍米·巴赫瓦全国研究所培训学校) ; Computer and Informatics Group, VECC 1/AF(计算机与信息组,VECC 1/AF)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 本文全面综述了说话头生成的多模态方法、数据集、评估指标和损失函数,探讨了技术挑战与未来发展方向。
FoREST: 空间推理任务中的参考框架评估
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Michigan State University(密歇根州立大学)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)
AI总结 FoREST基准通过空间引导提示法提升LLMs在空间推理任务中的参考框架理解能力。
Comments 10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; LG AI Research(LG人工智能研究) ; Seoul National University of Science and Technology(首尔科学技术大学) ; New York University(纽约大学) ; Genentech(基因泰克)
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract)
Comments 20 pages, 11 figures
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiaotong University(上海交通大学) ; Columbia University(哥伦比亚大学)
专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract)
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract)
Comments 8 pages, 8 figures
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)
专题命中 图像生成评测 :image generation(abstract);diffusion(abstract)
专题命中 图像生成评测 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM
Comments Project page: https://facebookresearch.github.io/MoCA
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。
Comments Accepted by ECCV 2026