arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-27 至 2026-02-27 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2602.22932 2026-02-27 cs.CV 83%

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解

Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongji University(同济大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19929 2026-02-27 cs.NI cs.IT math.IT 83%

BeamVLM for Low-altitude Economy: Generative Beam Prediction via Vision-language Models

BeamVLM 用于低空经济:通过视觉-语言模型进行生成式波束预测

Chenran Kou, Changsheng You, Mingjiang Wu, Dingzhu Wen, Zezhong Zhang, Chengwen Xing

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract)

AI总结 BeamVLM 通过视觉-语言模型实现生成式波束预测,提升无人机与地面基站间通信的准确性和泛化能力。

Comments We propose a novel end-to-end generative framework for beam prediction by using vision-language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22843 2026-02-27 cs.CV 79%

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

打破多模态知识驱动视觉问答中的视觉捷径

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14162 2026-02-27 cs.CL cs.CV cs.IR 70%

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

索引轻,推理深:延迟视觉摄入用于视觉密集文档问答

Tao Xu

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出延迟视觉摄入框架,通过分层图号聚类构建索引,利用BM25检索和VLM分析提升视觉密集文档问答性能。

Comments 24 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23286 2026-02-27 cs.CL cs.AI cs.DB cs.IR 57%

SPARTA: Scalable and Principled Benchmark of Tree-Structured Multi-hop QA over Text and Tables

SPARTA:可扩展且原则性的树状多跳问答基准

Sungho Park, Jueun Kim, Wook-Shin Han

机构 * POSTECH

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 SPARTA通过自动生成大规模表格-文本问答基准测试,揭示了跨模态推理的深层缺陷。

Comments 10 pages, 5 figures. Published as a conference paper at ICLR 2026. Project page: https://sparta-projectpage.github.io/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏