arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-15 至 2026-06-15 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2602.00593 2026-06-15 cs.CV cs.LG 版本更新 82%

Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes

Pix2Fact: 当视觉不够时——基于网络验证的细粒度VQA基准测试

Yifan Jiang, Cong Zhang, Bofei Zhang, Qiaofeng Zheng, Yifan Yang, Bingzhang Wang, Yew-Soon Ong

机构 * GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Cambridge University(剑桥大学) The University of Hong Kong(香港大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Pix2Fact基准测试,通过高分辨率真实场景中的网络验证,评估细粒度视觉问答中的专家级视觉感知和知识搜索能力,发现现有模型在复杂任务中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏