arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-03 至 2026-06-03 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2606.03693 2026-06-03 cs.CL cs.CV 89%

Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

语言转换会破坏医学视觉语言模型吗?印度尼西亚放射学视觉问答案例研究

Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto Yudistira

机构 * Intelligent System Laboratory, Faculty of Computer Science Brawijaya University(智能系统实验室,计算机科学学院布拉维亚大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 本研究通过构建印尼语放射学VQA数据集IndoRad-VQA,评估医学视觉语言模型在非英语临床语言下的鲁棒性,发现英语与印尼语设置间存在8-25%的性能差距,表明需要更包容的多语言评估。

Comments accepted to MMFM-BIOMED Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02809 2026-06-03 cs.CV 85%

Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

自动化报告驱动的肿瘤学VQA基准:用于评估3D医学影像上的视觉-语言模型

Bo Liu, Hanxue Gu, Xiangru Li, Zheren Zhu, Jacob Ellison, Kang Wang, Janine M. Lupo, Yang Yang, Hui Lin

机构 * UCSF–UC Berkeley Joint Graduate Program in Bioengineering(UCSF-伯克利生物工程联合研究生项目) Department of Radiology, UCSF(UCSF放射科) Department of Radiation Oncology, UCSF(UCSF放射肿瘤科)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出一个自动化管道,从私有放射学报告和3D肿瘤影像生成多选VQA数据集,构建无污染基准,评估六种视觉-语言模型,发现视觉依赖因数据集而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03410 2026-06-03 cs.CV 84%

Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams

Enginuity:工程图纸视觉语言理解的数据集与基准

Abhishek Kumar, Isha Motiyani, Tilak Kasturi, Ethan Seefried, Prahitha Movva, Tirthankar Ghosal

机构 * Predii Oak Ridge National Laboratory(橡树岭国家实验室) Independent Researcher(独立研究员)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对工程图纸领域缺乏公开基准的问题,提出首个开放数据集Enginuity,通过结构化零件表提取和自由形式视觉问答两项任务评估前沿VLM,揭示零件识别与描述保真度之间的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00096 2026-06-03 cs.CV cs.AI 73%

Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

多样性优于频率:重新思考视觉思维链智能体中的工具使用

Dong-Hee Kim, Reuben Tan, Donghyun Kim

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文研究视觉思维链智能体在复杂推理任务中的工具使用,发现工具使用崩溃现象,并提出熵正则化方法通过鼓励多样化探索提升推理性能。

Comments Presented in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03986 2026-06-03 cs.CV 57%

NewtPhys: Do Foundation Models Understand Newtonian Physics?

NewtPhys: 基础模型理解牛顿物理学吗?

Sebastian Cavada, Soumava Paul, Tuan-Hung Vu, Andrei Bursuc, Raoul de Charette

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(Valeo人工智能公司) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 视觉问答 :VLM(abstract_cn);分类 cs.CV

AI总结 本文提出NewtPhys,一个基于真实场景多视图图像和物理模拟的4D物理标注数据集,用于系统评估基础模型在低层次牛顿物理推理中的能力,揭示了现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏