arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-31 至 2026-03-31 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 2 篇

2506.21742 2026-03-31 cs.CV 57%

VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues

VRR-QA:超越显性提示的视频视觉关系推理

Sirnam Swetha, Rohit Gupta, Parth Parag Kulkarni, David G Shatwell, Jeffrey A Chan Santiago, Nyle Siddiqui, Joseph Fioresi, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, USA(美国中佛罗里达大学人工智能研究所)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 VRR-QA通过精心 curated 的创意视频数据集,评估视频问答模型在隐含关系推理上的表现,揭示现有模型对显性视觉线索的依赖及隐含推理的难度。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03707 2026-03-31 cs.CL 50%

OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering

OmniRAG-Agent:面向低资源长音频视频的代理多模态推理

Yifan Zhu, Xinyu Mu, Tao Feng, Zhonghong Ou, Yuning Gong, Haoran Luo

专题命中 视频问答 :video reasoning(abstract)

AI总结 本文提出OmniRAG-Agent,通过构建图像音频检索增强生成模块和代理循环,解决低资源长音频视频问答中的高成本编码、弱细粒度检索等问题,实验表明其在低资源环境下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏