arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-18 至 2026-08-18 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2608.15404 2026-08-18 cs.CV 新提交 89%

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

专题命中 其他VLM :MLLM(title,summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00971 2026-08-18 cs.CV cs.AI 版本更新 62%

MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4

MiniGPT-反向设计:利用MiniGPT-4预测图像调整

Vahid Azizi, Fatemeh Koochaki

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过扩展和微调MiniGPT-4,使其可应用于给定源图像、编辑后图像及可选文本描述来预测图像编辑操作与参数的反向设计任务,验证了现成VLMs在复杂多模态任务中的可扩展性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新 57%

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏