arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-30 至 2026-04-30 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2508.01875 2026-04-30 cs.CV 83%

StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding

StreamAgent:面向流视频理解的前瞻性代理

Haolin Yang, Feilong Tang, Lingxiao Zhao, Xinlin Zhuang, Yifan Lu, Xiang An, Ming Hu, Xiaofeng Zhang, Abdalla Swikir, Junjun He, Zongyuan Ge, Muhammad Haris Khan, Imran Razzak

机构 * MBZUAI Shanghai AI Laboratory(上海人工智能实验室) DeepGlint Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出StreamAgent,通过整合问题语义和历史观测,预测关键事件的时间进展,调整感知动作,提升流视频处理的响应准确性和实时效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26461 2026-04-30 cs.CV 83%

$\text{PKS}^4$:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding

PKS⁴:并行运动选择状态空间扫描器用于高效的视频理解

Lingjie Zeng, Hailun Zhang, Xiwen Wang, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出PKS⁴,通过并行扫描器保留空间结构,以线性复杂度实现高效的视频理解,显著降低训练计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26707 2026-04-30 cs.CV cs.LG 79%

CurEvo: Curriculum-Guided Self-Evolution for Video Understanding

CurEvo: 基于课程引导的视频理解自进化

Guiyi Zeng, Junqing Yu, Yi-Ping Phoebe Chen, Xu Chen, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 CurEvo通过引入课程学习提升视频理解的自进化过程,实现更结构化的模型改进,验证了课程引导自进化在视频理解中的有效性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV 70%

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 视频理解 :video understanding(abstract,abstract_cn);分类 cs.CV

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 57%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏