arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-28 至 2026-04-28 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 11 篇

2603.14882 2026-04-28 cs.CV 87%

LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models

LLMind: 基于生物启发的无训练自适应视觉表示用于视觉-语言模型

Soumyaratna Debnath, Bui Duc Manh, Zinan Liu, Lin Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 LLMind通过生物启发的自适应采样策略,实现视觉-语言模型在有限像素预算下的高效自适应表示,实验显示在多个基准测试中性能显著提升。

Comments CVPR 2026, Highlight, 10 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22884 2026-04-28 cs.CV cs.AI 86%

Can Multimodal Large Language Models Truly Understand Small Objects?

多模态大语言模型真的能理解小物体吗?

Fujun Han, Junan Chen, Xintong Zhu, Jingqi Ye, Xuanjie Mao, Tao Chen, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。

Comments Under Peer Review (26 pages, 9 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14837 2026-04-28 cs.CL 85%

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn)

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10185 2026-04-28 cs.CV 83%

Detecting and Evaluating Medical Hallucinations in Large Vision Language Models

在大型视觉语言模型中检测和评估医学幻觉

Jiawei Chen, Dingkang Yang, Tong Wu, Yue Jiang, Xiaolu Hou, Mingcheng Li, Shunli Wang, Dongling Xiao, Ke Li, Lihua Zhang

机构 * Academy for Engineering and Technology, Fudan University(复旦大学工程与技术学院) Tencent Youtu Lab(腾讯优图实验室) Cognition and Intelligent Technology Laboratory(认知与智能技术实验室)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Med-HallMark基准,用于医疗多模态领域中的幻觉检测与评估,引入MediHall Score和MediHallDetector,通过多任务训练提升模型可靠性,实验表明其在医疗应用中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19482 2026-04-28 cs.CV 83%

Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following

无需指令的大型视觉语言模型在医疗指令遵循中的调优

Myeongkyun Kang, Soopil Kim, Xiaoxiao Li, Sang Hyun Park

机构 * Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Department of Robotics and Mechatronics Engineering, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院机器人与机电工程系) Division of Intelligent Robot, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院智能机器人系) Vector Institute(向量研究所) Department of Computer Science and Engineering, Pohang University of Science and Technology (POSTECH)(釜山科学技术大学计算机科学与工程系)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出无需指令的调优方法,利用图像描述对训练模型,提升医疗领域视觉语言模型的指令遵循能力,实现多选视觉问答任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05318 2026-04-28 cs.CV cs.AI 82%

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

mKG-RAG:利用多模态知识图谱在检索增强生成中进行知识密集型视觉问答

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出mKG-RAG框架,通过整合多模态知识图谱提升检索增强生成在知识密集型视觉问答中的性能,采用双阶段检索策略和图提取方法构建高质量知识图谱,实验表明优于现有方法。

Comments In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR'26), July 20-24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05970 2026-04-28 cs.CV cs.AI cs.CL 79%

PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling

PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样

Xudong Xie, Hao Yan, Liang Yin, Yang Liu, Jing Ding, Minghui Liao, Yuliang Liu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。

Comments Accepted by International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23276 2026-04-28 cs.CV cs.AI cs.CL 62%

Lightweight and Production-Ready PDF Visual Element Parsing

轻量且适用于生产的PDF视觉元素解析

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li

机构 * Oracle AI

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级PDF解析框架,通过空间启发式、布局分析和语义相似性结合,实现高准确率的视觉元素检测与标题关联,提升多模态RAG检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23665 2026-04-28 cs.CV 57%

HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA

HAC: CLIP在零样本视觉问答中的高效超几何适应

Francesco Dibitonto, Cigdem Beyan, Vittorio Murino

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) EVS - Embedded Vision Systems Srl(嵌入式视觉系统公司) AI for Good (AIGO), Istituto Italiano di Tecnologia(AI for Good(AIGO),意大利技术研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 HAC通过轻量级微调使预训练CLIP模型迁移到超几何空间,用于视觉问答任务,展现出任务无关的适应能力,在多个基准上超越欧几里得基线和先前超几何方法。

Comments This is the preprint version of the paper. The final version has been accepted for publication in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 50%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13312 2026-04-28 cs.CL cs.IR 50%

ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering

ChatR1: 基于强化学习的对话推理与检索增强问答

Simon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 ChatR1通过强化学习实现对话问答中的推理与检索增强,通过意图感知奖励提升多轮对话性能,优于多个基准数据集。

Comments 18 pages, 9 figures, Main ACL 2026 Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, July 2--7, 2026, San Diego, California

详情

展开后加载摘要…

URL PDF HTML 收藏