arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-25 至 2026-06-25 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2606.25246 2026-06-25 cs.CV cs.CL 新提交 85%

Multilingual Hematology Visual Question Answering Dataset

多语言血液学视觉问答数据集

Hajra Malik, Hafiza Tooba Aftab, Abdul Rehman, Mohsen Ali, Waqas Sultani

机构 * Information Technology University, Lahore(拉合尔信息技术大学) King Edward Medical University, Lahore(拉合尔爱德华国王医科大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对医疗领域多语言视觉问答资源匮乏的问题,构建了双语(英语-乌尔都语)血液学VQA基准WBCMor VQA,包含11万问答对和2万细胞图像,并评估了多个开源视觉语言模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交 81%

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22497 2026-06-25 cs.CV 新提交 79%

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

用于植物显微图像理解的视觉语言模型基准测试

Tianqi Wei, Xin Yu, Zhi Chen, Scott Chapman, Zi Huang

机构 * The University of Queensland(昆士兰大学) Adelaide University(阿德莱德大学) University of Southern Queensland(南昆士兰大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出PlantMicro基准,包含5000+图像和9000+VQA对,评估视觉语言模型在植物显微图像理解上的能力,发现现有模型在细粒度识别和生物学推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04554 2026-06-25 cs.CV 版本更新 79%

Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering

伪造答案:针对无OCR文档视觉问答的对抗性伪造

Marco Pintore, Maura Pintor, Dimosthenis Karatzas, Battista Biggio

机构 * University of Cagliari, Italy(卡利亚里大学) Computer Vision Center, UAB, Spain(UAB计算机视觉中心)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 提出一种视觉上不可察觉但语义上定向的对抗攻击方法,通过伪造文档内容诱导DocVQA模型产生错误答案,在Pix2Struct和Donut模型上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25645 2026-06-25 eess.IV cs.CV cs.HC 版本更新 77%

Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

Colon-Bench:一种用于全流程结肠镜视频中可扩展密集病变标注的智能工作流

Abdullah Hamdi, Changchun Yang, Xin Gao

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科学与技术大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出Colon-Bench,通过多阶段智能工作流实现全流程结肠镜视频的密集病变标注,包含528个视频、14类病变、30万+边界框等,并评估多模态大模型在病变分类、开放词汇视频目标分割和视频视觉问答上的性能。

Comments published at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25136 2026-06-25 cs.RO 新提交 75%

Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control

视觉运动策略中的记忆检索用于长期机器人控制

Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。

Comments 16 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25084 2026-06-25 cs.CV 新提交 70%

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力

Shayon Dasgupta, Avijit Dasgupta, C. V. Jawahar

机构 * IIT BHU India(印度理工学院瓦拉纳西校区) CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25407 2026-06-25 cs.CV 新提交 57%

Teach-to-Reason: Competition-Guided Reasoning with a Self-Improving Teacher

Teach-to-Reason: 带有自我改进教师的竞争引导推理

Xiao Han, Hao Liu, Zhimin Bao, Jile Jiao, Yue Wang, Hui Guo, Xiaofeng Mou, Yi Xu

机构 * AIRC, Midea Group(美的集团人工智能研究中心)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 提出Teach-to-Reason框架,通过自我改进的教师和竞争引导的推理器,在胸部X光视觉问答中优化链式思维推理,解决奖励信号退化问题,实验表明优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏