arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-02 至 2026-04-02 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2604.00314 2026-04-02 eess.IV cs.AI 86%

Prompt-Guided Prefiltering for VLM Image Compression

基于提示的VLM图像压缩预过滤

Bardia Azizian, Ivan V. Bajic

机构 * School of Engineering Science, Simon Fraser University(西蒙菲莎大学工程科学学院)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出一种轻量级、即插即用的提示引导预过滤模块,用于识别图像中与文本提示最相关的区域,从而提升VLM图像压缩效率,实验显示在保持任务准确性的同时实现25-50%的平均比特率降低。

Comments 7 pages, 5 figures. Accepted to IEEE ICME 2026. Code: https://github.com/bardia-az/pgp-vlm-compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01002 2026-04-02 cs.CV cs.AI cs.LG 82%

Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding

基于证据的关键帧采样用于基于MLLM的长视频理解

Yiheng Wang, Lichen Zhu, Yueqian Lin, Yudong Liu, Jingyang Zhang, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学) Independent Researcher(独立研究员)

专题命中 视觉问答 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于信息瓶颈理论的证据驱动关键帧采样框架,通过最大化选帧与查询的条件互信息,提升长视频理解性能,实验表明在严格token预算下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00601 2026-04-02 cs.CV 79%

KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering

KG-CMI: 基于知识图谱的跨Mamba交互用于医学视觉问答

Xianyao Zheng, Hong Yu, Hui Cui, Changming Sun, Xiangyu Li, Ran Su, Leyi Wei, Jia Zhou, Junbo Wang, Qiangguo Jin

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) Tianjin Central Hospital of Gynecology Obstetrics(天津市中心妇产科医院) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Software, Tianjin University(天津大学计算机软件学院) Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University(澳门理工大学应用科学学院人工智能驱动药物发现中心) Department of Cardiology, Tianjin Chest Hospital(天津市胸科医院心内科)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出KG-CMI框架,通过整合医学知识图谱提升医学视觉问答的准确性与多样性,实验表明其在三个数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-04-02 cs.CV 57%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29630 2026-04-02 cs.CV 57%

BigEarthNet.txt: A Large-Scale Multi-Sensor Image-Text Dataset and Benchmark for Earth Observation

BigEarthNet.txt: 一个大规模多传感器图像-文本数据集和地球观测基准

Johann-Ludwig Herzog, Mathis Jürgen Adler, Leonard Hackel, Yan Shu, Angelos Zavras, Ioannis Papoutsis, Paolo Rota, Begüm Demir

机构 * BIFOLD(柏林智能数据与机器学习研究所) Technische Universität Berlin(柏林工业大学) University of Trento(特伦托大学) National Technical University(雅典国家技术大学) National Observatory of Athens(雅典国家天文台)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出BigEarthNet.txt,一个大规模多传感器图像-文本数据集,用于提升地球观测中的指令驱动图像-文本学习,包含9.6M文本注释,涵盖土地利用/覆盖类、空间关系及环境背景描述,通过对比分析证明其在文本丰富性和注释类型多样性上的优势。

Comments For details, see https://txt.bigearth.net

详情

展开后加载摘要…

URL PDF HTML 收藏