arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-25 至 2026-03-25 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2603.23501 2026-03-25 cs.CV cs.AI cs.CL 73%

MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage

MedObvious:通过临床分诊暴露视觉语言模型中的医学莫拉维奇悖论

Ufaq Khan, Umair Nawaz, L D M S S Teja, Numaan Saeed, Muhammad Bilal, Yutong Xie, Mohammad Yaqub, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(马尔代夫布扎伊德人工智能大学,阿联酋) National Institute of Technology, Silchar(西尔CHAR国家理工学院) Birmingham City University, UK(伯明翰城市大学,英国)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 研究提出MedObvious基准测试,通过临床分诊任务验证视觉语言模型的输入验证能力,发现现有模型在处理不一致或无效输入时仍存在可靠性问题。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22815 2026-03-25 cs.CV cs.AI 62%

Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding

聚焦,而非裁剪:识别与指令相关的区域以实现信息丰富的图像理解

Mincheol Kwon, Minseung Lee, Seonga Choi, Miso Choi, Kyeong-Jin Oh, Hyunyoung Lee, Cheonyoung Park, Yongho Song, Seunghyun Park, Jinkyu Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司) Soongsil University(松山大学) Kakao Mobility(Kakao移动)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PinPoint框架,通过识别与指令相关的图像区域并提取细粒度视觉特征,提升多模态任务的推理效率与准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏