arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-17 至 2026-04-17 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2604.14316 2026-04-17 cs.AI 85%

Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning

通过专家之眼:一个基于放射学家目光和推理训练的基础视觉语言模型

Kinhei Lee, Peiyuan Jing, Zhenxuan Zhang, Yue Yang, Tao Wang, Dominic C Marshall, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X(生物工程系和Imperial-X) Imperial College London(帝国理工学院伦敦分校) College of physics and information engineering, Fuzhou University(福州大学物理与信息工程学院) Department of Surgery and Cancer, Imperial College London(外科与癌症部门,帝国理工学院伦敦分校) National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里顿医院) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出GazeX模型,通过放射学家的眼动数据模拟专家推理过程,提升医学影像分析的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14866 2026-04-17 cs.CV cs.AI 84%

MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry

MetaDent: 临床图像标注用于牙科领域视觉-语言模型

Meng-Xun Li, Wen-Hui Deng, Zhi-Xing Wu, Chun-Xiao Jin, Jia-Min Wu, Yue Han, James Kit Hon Tsoi, Gui-Song Xia, Cui Huang

机构 * School of Computer Science, Wuhan University, Wuhan, Hubei, China(计算机科学学院,武汉大学,武汉,湖北,中国)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MetaDent,通过大规模牙科图像数据集、半结构化标注框架和综合基准测试,解决牙科内窥镜图像分析中缺乏细粒度标注的问题,验证了VLMs在临床图像理解中的性能局限。

Comments Project website: https://menxli.github.io/metadent

Journal ref Journal of Dental Research, p.00220345261424242 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14779 2026-04-17 cs.CV cs.CL 83%

AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

AIM:面向视觉问答持续学习的非对称信息掩码

Peifeng Zhang, Zice Qiu, Donghua Yu, Shilei Cao, Juepeng Zheng, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉问答持续学习中因模型结构不对称导致的灾难性遗忘问题,提出AIM方法,通过模态特定敏感性指导的针对性掩码平衡稳定性与可塑性,提升在VQA v2和GQA任务中的平均性能和平均遗忘度。

Comments 18 pages, 9 figures. Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03611 2026-04-17 cs.CV 57%

PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation

PortraitCraft:面向肖像构图理解与生成的基准测试

Yuyang Sha, Zijie Lou, Youyun Tang, Xiaochao Qu, Zheng Qu, Ben Xia, Haoxiang Li, Ting Liu, Luoqi Liu

机构 * MT Lab, Meitu Inc(美图实验室,美图公司) Airbrush Studio, Meitu Inc(喷雾工作室,美图公司) Meitu Design, Meitu Inc(美图设计,美图公司)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出PortraitCraft基准测试,通过结构化多级监督数据集,实现对肖像构图的理解与生成评估,包含评分预测、细粒度属性推理和生成任务,推动细粒度肖像理解与可控生成研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14751 2026-04-17 cs.CL 50%

Query pipeline optimization for cancer patient question answering systems

癌症患者问答系统中的查询管道优化

Maolin He, Rena Gao, Mike Conway, Brian E. Chapman

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Health Data Science and Biostatistics, University of Texas Southwestern Medical Center(德克萨斯西南医学中心健康数据科学与生物统计学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出了一种针对癌症患者问答系统的RAG查询管道三方面优化方法,通过改进文档检索、段落检索和语义表示,提升了回答准确性。

Comments This paper has been accepted as a Findings Paper in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏