arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-05 至 2026-05-05 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2605.01662 2026-05-05 cs.CV 85%

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01664 2026-05-05 cs.IR 50%

A Hybrid Retrieval and Reranking Framework for Evidence-Grounded Retrieval-Augmented Generation

一种混合检索与重排序框架用于证据导向的检索增强生成

Fariba Afrin Irany, Sampson Akwafuo

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出一种混合检索与重排序框架,用于生物医学和医疗相关文档问答中的引用感知RAG,通过亚马逊Bedrock知识库进行文档处理,并通过Cohere重排序提升相关性,最终实现高准确率的证据基础生成。

详情

展开后加载摘要…

URL PDF HTML 收藏