arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-30 至 2026-04-30 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2508.03583 2026-04-30 cs.MM cs.IR 80%

OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset

OpenLifelogQA:一个开放式多模态生活日志问答数据集

Quang-Linh Tran, Hoang-Bao Le, Tuong-Nghiem Diep, Binh Nguyen, Gareth J. F. Jones, Cathal Gurrin

专题命中 视觉问答 :LLaVA(summary_cn,abstract)

AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。

Comments In the proceedings of the 14th International Symposium on Information and Communication Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09925 2026-04-30 cs.CV 77%

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

专题命中 视觉问答 :LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26880 2026-04-30 cs.CL cs.LG 70%

HealthNLP_Retrievers at ArchEHR-QA 2026: Cascaded LLM Pipeline for Grounded Clinical Question Answering

HealthNLP_Retrievers在ArchEHR-QA 2026中的表现:基于级联LLM管道的 grounded临床问答

Md Biplob Hosen, Md Alomgeer Hussein, Md Akmol Masud, Omar Faruque, Tera L Reynolds, Lujie Karen Chen

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校) Jahangirnagar University(贾旺吉拉大学)

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出基于Gemini 2.5 Pro的级联管道,通过多阶段模块实现患者问题理解、证据检索与回答生成,提升临床问答的准确性和专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25313 2026-04-30 cs.CL cs.AI 57%

Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

忠实性问答:一个用于训练上下文忠实RAG模型的反事实实体替换数据集

Li Ju, Junzhe Wang, Qi Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出Faithfulness-QA数据集,通过反事实实体替换生成可控的知识冲突,旨在训练上下文忠实的RAG模型并评估其上下文接地行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13606 2026-04-30 cs.CV 57%

ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch

ChartVerse: 通过从零开始可靠程序合成实现图表推理的扩展

Zheng Liu, Honglin Lin, Chonghan Qin, Xiaoyang Wang, Xin Gao, Yu Li, Mengzhang Cai, Yun Zhu, Zhanping Zhong, Qizhi Pei, Zhuoshi Pan, Xiaoran Shang, Bin Cui, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京市软件与硬件协同人工智能系统重点实验室)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 ChartVerse通过从零开始生成复杂图表和可靠推理数据,解决开放源模型开发中高质量训练数据缺乏的问题,采用RPE量化图表复杂度并生成高复杂度图表,结合truth-anchored inverse QA合成和CoT蒸馏提升推理深度。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26048 2026-04-30 cs.CL 50%

BioGraphletQA: Knowledge-Anchored Generation of Complex QA Datasets

BioGraphletQA: 基于知识图谱的复杂问答数据集生成

Richard A. A. Jonker, Bárbara Maria Ribeiro de Abreu Martins, Sérgio Matos

机构 * IEETA, DETI, LASI, University of Aveiro(IEETA、DETI、LASI、阿维罗大学) USF Atlântico Norte(大西洋北USF)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出一个系统化生成复杂问答数据的框架,通过图let锚定生成过程,利用知识图谱的小子图控制生成复杂度并确保事实准确性。BioGraphletQA数据集包含119,856对问答,基于OREGANO知识图谱的图let生成,提升问答任务的准确性和科学性。

Comments 15 pages, 7 figures, conference (ECIR)

Journal ref Advances in Information Retrieval: 48th European Conference on Information Retrieval, ECIR 2026, Delft, The Netherlands, March 29 - April 2, 2026, Proceedings, Part IV

详情

展开后加载摘要…

URL PDF HTML 收藏