arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-23 至 2026-04-23 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2604.20760 2026-04-23 cs.CV 79%

Exploring High-Order Self-Similarity for Video Understanding

探索高阶自相似性用于视频理解

Manjin Kim, Heeseung Kwon, Karteek Alahari, Minsu Cho

机构 * POSTECH RLWRLD Inc.(RLWRLD公司) INRIA Grenoble Rhône-Alpes(INRIA格勒诺布尔罗纳-阿尔卑斯研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出多阶自相似模块MOSS,通过学习和整合多阶时空自相似特征,提升视频任务中的运动建模能力,实验表明在动作识别、视频VQA和机器人任务中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20473 2026-04-23 cs.CV 70%

Video-ToC: Video Tree-of-Cue Reasoning

Video-ToC: 视频树状提示推理

Qizhong Tan, Zhuotao Tian, Guangming Lu, Jun Yu, Wenjie Pei

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏