arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-07 至 2026-04-07 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2604.04133 2026-04-07 cs.CV cs.AI 62%

Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks

在计算机断层扫描中学习鲁棒的视觉特征以实现临床任务的高效迁移学习

Rubén Moreno-Aguado, Alba Magallón, Victor Moreno, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(帝国理工学院生物工程系与Imperial-X) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Oncology Data Analytics Program, Catalan Institute of Oncology(加泰罗尼亚肿瘤研究所肿瘤数据分析项目) Colorectal Cancer Group, ONCOBELL Program, Institut d’Investigació Biomèdica de Bellvitge(贝尔维特奇生物医学研究所ONCOBELL项目结直肠癌研究组) Consortium for Biomedical Research in Epidemiology and Public Health(流行病学与公共卫生生物医学研究联盟) Department of Clinical Sciences, Faculty of Medicine and Health Sciences, Universitat de Barcelona(巴塞罗那大学医学与健康科学学院临床科学系) Institute of Complex Systems, University of Barcelona(巴塞罗那大学复杂系统研究所) National Heart and Lung Institute, Imperial College London(帝国理工学院国家心肺研究所) Cardiovascular Research Centre, Royal Brompton Hospital(皇家布朗普顿医院心血管研究中心) School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VoxelFM,一种基于自蒸馏的3D CT基础模型,通过学习语义丰富的特征,实现了在多种临床任务中无需微调即可高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04359 2026-04-07 cs.CL cs.AI 57%

GROUNDEDKG-RAG: Grounded Knowledge Graph Index for Long-document Question Answering

基于源文档的知识图谱-RAG:用于长文档问答的 grounded 知识图谱

Tianyi Zhang, Andreas Marfurt

机构 * getAbstract Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出 groundedkg-rag,通过从源文档中显式提取并 grounding 知识图谱,提升长文档问答的效率和事实准确性,实验表明其在成本较低的情况下性能优于现有基线。

Comments To appear in the Proceedings of KG-LLM @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03393 2026-04-07 cs.AI 57%

TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering

TABQAWORLD: 优化多模态推理以实现多轮表格问答

Tung Sum Thomas Kwok, Xinyu Wang, Xiaofeng Lin, Peng Lu, Chunhe Wang, Changlun Li, Hanwei Wu, Nan Tang, Elisa Kreiss, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SimpleWay

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 TABQAWORLD通过联合优化表格表示与估计,提升多轮表格问答的可靠性与效率,实现4.87%的准确率提升和33.35%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09573 2026-04-07 cs.CV 57%

More than the Sum: Panorama-Language Models for Adverse Omni-Scenes

全景语言模型:超越拼接的全景场景理解

Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Shenzhen University(深圳大学) UCL(伦敦大学学院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出全景语言模型PLM,通过全景图像实现超越单目视角的综合推理,同时构建包含恶劣全景场景的PanoVQA数据集,开发可插拔的稀疏注意力模块以提升模型处理全景图像的能力。

Comments Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/PanoVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03612 2026-04-07 cs.CR 50%

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

感知缺口:ASCII艺术与重叠音频作为CAPTCHA

Choon-Hou Rafael Chong

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文探讨了利用人类高度专业化神经处理的CAPTCHA任务,提出基于ASCII艺术和重叠音频的两种CAPTCHA类型,测试结果显示现有LLM无法有效解决,表明其在当前有效但可能面临AI发展挑战。

Comments 8 pages, 3 figures. Research paper proposing novel CAPTCHA methods using ASCII art and overlapping audio

详情

展开后加载摘要…

URL PDF HTML 收藏