arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-22 至 2026-04-22 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2604.19324 2026-04-22 cs.CV cs.AI 85%

PLaMo 2.1-VL Technical Report

PLaMo 2.1-VL 技术报告

Tommi Kerola, Yuya Masuda, Takashi Masuko, Toshiki Nakanishi, Daisuke Nishino, Kuniyuki Takahashi, Hanqin Wang, Yoshihiro Yamada

机构 * Preferred Networks, Inc.

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 PLaMo 2.1-VL 是一种轻量级视觉语言模型,适用于自主设备的本地和边缘部署,支持日语操作。该模型在视觉问答和视觉定位任务中表现优异,应用于工厂任务分析和基础设施异常检测,取得了显著的性能提升。

Comments 35 pages, 9 figreus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20816 2026-04-22 cs.CL 80%

Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective

重新思考多模态问答中的信息合成:多智能体视角

Krishna Singh Rajput, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual language model(abstract);multimodal large language model(abstract)

AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03337 2026-04-22 cs.CV 57%

Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration

少即是多:通过自适应帧剪枝和语义图集成实现高效的视频问答

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)中国) The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种结合自适应帧剪枝和轻量级语义图的框架,有效减少视频问答中输入token数量,提升效率并增强基模型性能。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏