arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-27 至 2026-04-27 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2604.22560 2026-04-27 cs.CV cs.AI 87%

Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors

层次驾驶视觉问答中的跨阶段一致性:显式基线与学习门控上下文投影

Gautam Kumar Jain, Carsten Markgraf, Julian Stähler

机构 * Technische Hochschule Augsburg(亚琛工业大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究了驾驶场景中跨阶段上下文传递的两种方法,显式基线通过无额外训练的4B VLM减少矛盾,隐式基线通过门控投影提升规划阶段语义一致性,两者共同探讨了领域适应在全谱改进中的潜力。

Comments 16 pages, 8 figures, 8 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22678 2026-04-27 cs.CL 85%

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

BERAG:基于贝叶斯集成的检索增强生成用于基于知识的视觉问答

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne

机构 * Department of Engineering(工程系)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract,abstract_cn)

AI总结 BERAG通过将语言模型条件于单个检索文档而非单一上下文,解决检索增强生成中文档贡献不明和长上下文中的信息丢失问题,提升视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22260 2026-04-27 cs.CV cs.AI 73%

Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset

迈向安全的移动性:由开放-ended视觉-语言数据集驱动的统一运输基础模型

Wenhui Huang, Songyan Zhang, Collister Chua, Yang Liang, Zhiqi Mao, Heng Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Harvard University(哈佛大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Land Transportation Dataset数据集和UniVLT模型,通过开放-ended视觉问答和多任务学习,提升城市交通环境下的安全推理能力,实现微观自动驾驶与宏观交通分析的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01907 2026-04-27 cs.CV cs.AI 62%

Lifting Unlabeled Internet-level Data for 3D Scene Understanding

提升互联网级未标记数据用于3D场景理解

Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文通过设计数据引擎利用互联网未标记视频生成训练数据,提升3D场景理解模型性能,验证了在不同感知粒度任务中的有效性。

Comments CVPR 2026. Project page: https://sv-pp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22281 2026-04-27 cs.CV 57%

DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

DocPrune:通过背景、问题和理解感知的令牌修剪实现高效的文档问答

Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DocPrune框架,通过背景、问题和理解感知的令牌修剪提升长文档理解效率,实验显示在M3DocRAG上提升了吞吐量和F1分数。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏