arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-28 至 2026-04-28 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 2 篇

2604.23145 2026-04-28 cs.CV cs.AI 70%

UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

UpstreamQA:一个用于视频问答任务显式推理的模块化框架

Jason Nguyen, Ameet Rao, Alexander Chang, Ishaan Kumar, Erin Tan

机构 * Lincoln North Star High School(林肯北星高中) The Charter School of Wilmington(威尔明顿 charter 学校) Greenwich High School(格林威治高中) Santa Susana High School(圣塔苏娜高中) UC Berkeley(伯克利大学)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出UpstreamQA框架,通过显式推理模块分离和评估视频推理核心组件,提升视频问答任务的性能和可解释性,但可能在基线性能高时导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21094 2026-04-28 cs.CV 70%

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

EMCompress: 具有端态多模态压缩的视频大语言模型

Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 视频问答 :video reasoning(abstract);video-language(abstract);分类 cs.CV

AI总结 本文提出端态多模态压缩(EMC)作为视频问答的结构约束充分统计问题,通过端态变换保持答案不变性,提升视频语言理解的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏