arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2404.05268 2024-12-03 cs.CV 70%

MC$^2$: Multi-concept Guidance for Customized Multi-concept Generation

Jiaxiu Jiang, Yabo Zhang, Kailai Feng, Xiaohe Wu, Wenbo Li, Renjing Pei, Fan Li, Wangmeng Zuo

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10708 2024-11-28 cs.CV cs.LG 70%

SelfEval: Leveraging the discriminative nature of generative models for evaluation

Sai Saketh Rambhatla, Ishan Misra

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04125 2024-10-30 cs.CV cs.CL cs.LG 70%

No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance

Vishaal Udandarao, Ameya Prabhu, Adhiraj Ghosh, Yash Sharma, Philip H. S. Torr, Adel Bibi, Samuel Albanie, Matthias Bethge

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Short version accepted at DPFM, ICLR'24; Full paper at NeurIPS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11874 2024-09-19 cs.CV eess.IV 70%

ABHINAW: A method for Automatic Evaluation of Typography within AI-Generated Images

Abhinaw Jagtap, Nachiket Tapas, R. G. Brajesh

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17365 2024-07-25 cs.CV 70%

ViPer: Visual Personalization of Generative Models via Individual Preference Learning

Sogand Salehi, Mahdi Shafiei, Teresa Yeo, Roman Bachmann, Amir Zamir

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page at https://viper.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14715 2024-07-23 cs.CV cs.CL 70%

FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction

Hang Hua, Jing Shi, Kushal Kafle, Simon Jenni, Daoan Zhang, John Collomosse, Scott Cohen, Jiebo Luo

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00600 2024-07-02 cs.CV cs.AI 70%

GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing

Yisong Xiao, Aishan Liu, QianJia Cheng, Zhenfei Yin, Siyuan Liang, Jiapeng Li, Jing Shao, Xianglong Liu, Dacheng Tao

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19107 2024-03-29 cs.CV cs.LG 70%

Synthetic Medical Imaging Generation with Generative Adversarial Networks For Plain Radiographs

John R. McNulty, Lee Kho, Alexandria L. Case, Charlie Fornaca, Drew Johnston, David Slater, Joshua M. Abzug, Sybil A. Russell

专题命中 图像生成评测 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03054 2024-02-22 cs.CV 70%

AnyText: Multilingual Visual Text Generation And Editing

Yuxiang Tuo, Wangmeng Xiang, Jun-Yan He, Yifeng Geng, Xuansong Xie

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04468 2024-01-10 cs.CV cs.AI 70%

MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation

Weimin Wang, Jiawei Liu, Zhijie Lin, Jiangqiao Yan, Shuo Chen, Chetwin Low, Tuyen Hoang, Jie Wu, Jun Hao Liew, Hanshu Yan, Daquan Zhou, Jiashi Feng

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10400 2023-12-27 cs.CL cs.CV 70%

What You See is What You Read? Improving Text-Image Alignment Evaluation

Michal Yarom, Yonatan Bitton, Soravit Changpinyo, Roee Aharoni, Jonathan Herzig, Oran Lang, Eran Ofek, Idan Szpektor

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2023. Website: https://wysiwyr-itm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06772 2023-11-14 cs.CV cs.AI 70%

ChatAnything: Facetime Chat with LLM-Enhanced Personas

Yilin Zhao, Xinbin Yuan, Shanghua Gao, Zhijie Lin, Qibin Hou, Jiashi Feng, Daquan Zhou

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03860 2023-11-09 cs.CV cs.AI 70%

CCMB: A Large-scale Chinese Cross-modal Benchmark

Chunyu Xie, Heng Cai, Jincheng Li, Fanjing Kong, Xiaoyu Wu, Jianfei Song, Henrique Morimitsu, Lin Yao, Dexin Wang, Xiangzheng Zhang, Dawei Leng, Baochang Zhang, Xiangyang Ji, Yafeng Deng

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Journal ref Proceedings of the 31st ACM International Conference on Multimedia (ACM MM), 2023, Pages 4219-4227

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15144 2023-10-24 cs.CV 70%

DEsignBench: Exploring and Benchmarking DALL-E 3 for Imagining Visual Design

Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Lijuan Wang

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page at https://design-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17806 2023-07-03 cs.CL cs.CV cs.LG 70%

Stay on topic with Classifier-Free Guidance

Guillaume Sanchez, Honglu Fan, Alexander Spangher, Elad Levi, Pawan Sasanka Ammanamanchi, Stella Biderman

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13445 2022-05-27 cs.CV cs.AI cs.CL cs.IT cs.LG math.IT 70%

Mutual Information Divergence: A Unified Metric for Multimodal Generative Models

Jin-Hwa Kim, Yunji Kim, Jiyoung Lee, Kang Min Yoo, Sang-Woo Lee

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.02870 2021-10-05 cs.SE cs.CV 70%

Robustness Evaluation of Stacked Generative Adversarial Networks using Metamorphic Testing

Hyejin Park, Taaha Waseem, Wen Qi Teo, Ying Hwei Low, Mei Kuan Lim, Chun Yong Chong

专题命中 图像生成评测 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments 8 pages, accepted at the 6th International Workshop on Metamorphic Testing (MET'21)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08964 2026-08-11 cs.LG 新提交 67%

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

数学视觉图表:评估大型语言模型数学图表生成能力的综合基准

Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

机构 * Pandita AI Inc.(潘迪塔人工智能公司)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18528 2026-07-07 cs.AI 版本更新 67%

Correlation-Weighted Multi-Reward Optimization for Compositional Generation

基于相关性的多奖励优化用于组合生成

Jungmyung Wi, Hyunsoo Kim, Donghyun Kim

机构 * Korea University(韩国大学) Korea Institute of Science and Technology(韩国科学技术院)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract)

AI总结 本文提出相关性加权多奖励优化方法,通过调整概念奖励权重提升多概念生成效果,改进了SD3.5和FLUX.1-dev模型在多概念基准测试中的表现。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15735 2026-03-09 cs.AI cs.LG stat.ML 67%

ContextBench: Modifying Contexts for Targeted Latent Activation

ContextBench: 为定向激活潜在特征修改上下文

Robert Graham, Edward Stevinson, Leo Richter, Alexander Chia, Joseph Miller, Joseph Isaac Bloom

机构 * Imperial College London(帝国理工学院伦敦校区) University College London(伦敦大学学院) University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract)

AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02900 2026-01-22 cs.CV cs.AI cs.GR cs.HC cs.MM 67%

Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions

推进说话头生成:多模态方法、数据集、评估指标和损失函数的全面综述

Vineet Kumar Rakesh, Soumya Mazumdar, Research Pratim Maity, Sarbajit Pal, Amitabha Das, Tapas Samanta

机构 * Engineering Sciences, Homi Bhabha National Institute Training School Complex(工程科学,霍米·巴赫瓦全国研究所培训学校) Computer and Informatics Group, VECC 1/AF(计算机与信息组,VECC 1/AF)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文全面综述了说话头生成的多模态方法、数据集、评估指标和损失函数,探讨了技术挑战与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17775 2025-11-25 cs.CL 67%

FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks

FoREST: 空间推理任务中的参考框架评估

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

AI总结 FoREST基准通过空间引导提示法提升LLMs在空间推理任务中的参考框架理解能力。

Comments 10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12981 2025-10-16 cs.LG 67%

Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check

Sungjun Cho, Dasol Hwang, Frederic Sala, Sangheum Hwang, Kyunghyun Cho, Sungmin Cha

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LG AI Research(LG人工智能研究) Seoul National University of Science and Technology(首尔科学技术大学) New York University(纽约大学) Genentech(基因泰克)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract)

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22008 2025-05-29 physics.ao-ph cs.LG 67%

Align-DA: Align Score-based Atmospheric Data Assimilation with Multiple Preferences

Jing-An Sun, Hang Fan, Junchao Gong, Ben Fei, Kun Chen, Fenghua Ling, Wenlong Zhang, Wanghan Xu, Li Yan, Pierre Gentine, Lei Bai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiaotong University(上海交通大学) Columbia University(哥伦比亚大学)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17194 2024-11-27 cs.HC 67%

The Role of Urban Designers in the Era of AIGC: An Experimental Study Based on Public Participation

Di Mo, Keyi Liu, Qi Tian, Dengyun Li, Liyan Xu, Junyan Ye

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract)

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17543 2024-02-20 cs.IR 67%

Fréchet Distance for Offline Evaluation of Information Retrieval Systems with Sparse Labels

Negar Arabzadeh, Charles L. A. Clarke

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09052 2024-02-15 cs.AI 67%

L3GO: Language Agents with Chain-of-3D-Thoughts for Generating Unconventional Objects

Yutaro Yamada, Khyathi Chandu, Yuchen Lin, Jack Hessel, Ilker Yildirim, Yejin Choi

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18827 2023-12-01 cs.GR cs.AI cs.CV cs.LG cs.MM 67%

Motion-Conditioned Image Animation for Video Editing

Wilson Yan, Andrew Brown, Pieter Abbeel, Rohit Girdhar, Samaneh Azadi

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Project page: https://facebookresearch.github.io/MoCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01144 2023-06-05 cs.LG cs.CL 67%

Evaluating the Capabilities of Multi-modal Reasoning Models with Synthetic Task Data

Nathan Vaska, Victoria Helus

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 62%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏