arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-08 至 2026-04-08 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 4 篇

2604.04192 2026-04-08 cs.CV cs.AI cs.LG 70%

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta

专题命中 图像生成评测 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 57%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-04-08 cs.CL cs.CV 57%

From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14949 2026-04-08 cs.CL cs.CV cs.LG 57%

DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation

DialectGen:多模态生成中方言鲁棒性评估与改进

Yu Zhou, Sohyun An, Haikang Deng, Da Yin, Clark Peng, Cho-Jui Hsieh, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文通过构建涵盖六种英语方言的大型基准,评估多模态生成模型在方言输入下的表现,提出一种通用编码器策略提升方言鲁棒性,同时保持标准美式英语性能。

详情

展开后加载摘要…

URL PDF HTML 收藏