arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-31 至 2026-03-31 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 7 篇

2512.17396 2026-03-31 cs.CV cs.AI cs.CL 84%

RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering

RadImageNet-VQA:一个大规模的CT和MRI数据集用于放射学视觉问答

Léo Butsanets, Charles Corbière, Julien Khlaut, Pierre Manceron, Corentin Dancette

机构 * Raidium Université de Paris Cité, Hôpital Européen Georges Pompidou, AP-HP(巴黎西岱大学,乔治·蓬皮杜欧洲医院,AP-HP) Department of Vascular and Oncological Interventional Radiology, INSERM(血管与肿瘤介入放射学系,法国国家健康与医学研究院)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RadImageNet-VQA数据集,包含750万张图像和750万个问题-答案对,涵盖异常检测、解剖识别和病理识别三大任务,验证了视觉语言模型在细粒度病理识别上的局限性。

Comments Preprint, 33 pages, 15 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28363 2026-03-31 cs.CV 83%

SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering

SEA:通过元素级常识视觉问答评估草图抽象效率

Jiho Park, Sieun Choi, Jaeyoon Seo, Minho Sohn, Yeana Kim, Jihie Kim

机构 * Dongguk University(东国大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出SEA指标,通过元素级常识视觉问答评估草图抽象效率,引入CommonSketch数据集,验证了草图抽象效率的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV 79%

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28504 2026-03-31 astro-ph.SR astro-ph.IM 78%

JW-VL: A Vision-Language Model for Solar Physics

JW-VL:用于太阳物理的视觉-语言模型

Mingfu Shao, Hui Wang, Liyue Tong, Yuyang Li, Cunshi Wang, Jiaben Lin, Suo Liu, Haiqing Xu, Yin Zhang, Jing Huang

专题命中 视觉问答 :vision-language model(title,abstract)

AI总结 本文提出JW-VL模型,专为太阳物理设计,整合多波段观测数据,实现从原始观测数据到图像识别、活动分析和OCR的端到端处理,同时构建多波段图像基准数据集。

Comments 16 Pages,8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27403 2026-03-31 cs.LG cs.AI 62%

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

基于符合采样的通用化证书的条件事实性控制大语言模型

Kai Ye, Qingtao Pan, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 视觉问答 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出条件事实性控制框架CFC,通过增强分位数回归定义连续特征条件接受阈值,实现条件覆盖保证,并在理论和实验上证明其高效性与稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12533 2026-03-31 cs.CV 57%

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26670 2026-03-31 cs.IR cs.CL 50%

SRAG: RAG with Structured Data Improves Vector Retrieval

SRAG:基于结构化数据的RAG改进向量检索

Shalin Shah, Srikanth Ryali, Ramasubbu Venkatesh

机构 * Anvai AI

专题命中 视觉问答 :grounding(abstract)

AI总结 SRAG通过引入结构化信息提升向量检索性能,实验显示在问答系统中提升30%的评分,尤其在比较、分析和预测类问题上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏