arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-15 至 2026-05-15 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2605.14733 2026-05-15 cs.CV 83%

Video-Zero: Self-Evolution Video Understanding

Video-Zero: 自主进化视频理解

Ruixu Zhang, Deyi Ji, Lanyun Zhu, Xuanyi Liu, Yuxin Meng, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent(腾讯) Tongji University(同济大学) Peking University(北京大学)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出Video-Zero框架,通过无标注的Questioner-Solver共进化机制,聚焦时间局部证据,提升视频理解的自进化能力,验证了证据中心自进化方法的有效性与迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14310 2026-05-15 cs.CV 79%

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

CoRDS:基于核心集的代表性与多样性选择用于流视频理解

Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出CoRDS方法,通过核心集选择优化流视频理解中的缓存压缩,提升代表性与多样性,优于传统启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13026 2026-05-15 cs.CV 79%

REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding

REVISOR:超越文本反思,迈向长视频理解的多模态反思推理

Jiaze Li, Hao Yin, Wenhui Tan, Jingyang Chen, Boshen Xu, Yuxun Qu, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) Renmin University of China(中国人民大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 REVISOR通过多模态反思框架提升长视频理解能力,解决纯文本反思在动态视觉输入和跨模态交互上的不足,采用Dual Attribution Decoupled Reward机制增强因果对齐,无需额外监督微调即在多个基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14607 2026-05-15 cs.CV cs.CY 57%

ViMU: Benchmarking Video Metaphorical Understanding

ViMU:视频隐喻理解基准测试

Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ViMU旨在评估视频理解模型对隐含意义的识别能力,通过多模态证据推理,解决现有模型对隐喻、讽刺和社会意义理解不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏