arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-18 至 2026-03-18 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2603.16372 2026-03-18 cs.CV 83%

InViC: Intent-aware Visual Cues for Medical Visual Question Answering

InViC:面向医疗视觉问答的意图感知视觉线索

Zhisong Wang, Ziyang Chen, Zanting Ye, Hongze Zhu, Yefeng Zheng, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国) Westlake University(西湖大学) Southern Medical University(南方医科大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出InViC框架,通过引入Cue Tokens Extraction模块和两阶段微调策略,提升医疗视觉问答中意图对齐的视觉证据利用,验证了瓶颈化训练在提高可信度上的有效性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16092 2026-03-18 cs.CV cs.AI cs.LG 82%

Parallel In-context Learning for Large Vision Language Models

大规模视觉语言模型的并行上下文学习

Shin'ya Yamaguchi, Daiki Chijiwa, Tamao Sakao, Taku Hasegawa

机构 * NTT(日本电信电话研究所)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出并行上下文学习方法,通过将长上下文分割为短片段并行处理,提升大视觉语言模型的推理效率,同时保持性能与传统多模态上下文学习相当。

Comments Accepted to CVPR 2026 (Findings); Code is available at https://github.com/yshinya6/parallel-icl

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21991 2026-03-18 cs.CV cs.AI cs.CL cs.LG 82%

ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models

ERGO:高效高分辨率视觉理解用于视觉-语言模型

Jewon Lee, Wooksu Shin, Seungmin Yang, Ki-Ung Song, DongUk Lim, Jaeyeon Kim, Tae-Ho Kim, Bo-Kyeong Kim

机构 * Nota Inc.(Nota公司)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ERGO提出一种两阶段'粗到细'推理流程,通过下采样图像识别任务相关区域,再以全分辨率裁剪处理,从而在降低计算成本的同时保留必要的细粒度视觉细节,提升视觉-语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01167 2026-03-18 cs.CV cs.CL cs.LG 73%

TempCore: Are Video QA Benchmarks Temporally Grounded? A Frame Selection Sensitivity Analysis and Benchmark

TempCore:视频问答基准测试是否具有时间感知性?一个帧选择敏感性分析与基准测试

Hyunjong Ok, Jaeho Lee

机构 * POSTECH(POSTECH大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文通过帧选择敏感性分析揭示视频问答基准测试中多数样本对帧选择不敏感,仅少数样本具有时间敏感性,提出TempCore用于评估时间敏感样本。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏