arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-30 至 2026-04-30 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2508.01875 2026-04-30 cs.CV 83%

StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding

StreamAgent:面向流视频理解的前瞻性代理

Haolin Yang, Feilong Tang, Lingxiao Zhao, Xinlin Zhuang, Yifan Lu, Xiang An, Ming Hu, Xiaofeng Zhang, Abdalla Swikir, Junjun He, Zongyuan Ge, Muhammad Haris Khan, Imran Razzak

机构 * MBZUAI Shanghai AI Laboratory(上海人工智能实验室) DeepGlint Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出StreamAgent,通过整合问题语义和历史观测,预测关键事件的时间进展,调整感知动作,提升流视频处理的响应准确性和实时效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26461 2026-04-30 cs.CV 83%

$\text{PKS}^4$:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding

PKS⁴:并行运动选择状态空间扫描器用于高效的视频理解

Lingjie Zeng, Hailun Zhang, Xiwen Wang, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出PKS⁴,通过并行扫描器保留空间结构,以线性复杂度实现高效的视频理解,显著降低训练计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26707 2026-04-30 cs.CV cs.LG 79%

CurEvo: Curriculum-Guided Self-Evolution for Video Understanding

CurEvo: 基于课程引导的视频理解自进化

Guiyi Zeng, Junqing Yu, Yi-Ping Phoebe Chen, Xu Chen, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 CurEvo通过引入课程学习提升视频理解的自进化过程,实现更结构化的模型改进,验证了课程引导自进化在视频理解中的有效性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV 70%

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 视频理解 :video understanding(abstract,abstract_cn);分类 cs.CV

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 57%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2604.26232 2026-04-30 cs.CV cs.AI 79%

DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation

DepthPilot:从可控性到可解释性在结肠镜视频生成中

Junhu Fu, Ke Chen, Weidong Guo, Shuyu Liang, Jie Xu, Chen Ma, Kehao Wang, Shengli Lin, Zeju Li, Yuanyuan Wang, Yi Guo, Shuo Li

机构 * College of Biomedical Engineering, Fudan University, Shanghai 200433, China(复旦大学生物医学工程学院) Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention of Shanghai, Shanghai 200032, China(上海医学影像计算与计算机辅助干预重点实验室) Endoscopy Research Institute, Zhongshan Hospital, Fudan University, Shanghai 200032, China(复旦大学中山医院内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy, Shanghai 200032, China(上海内窥镜协同创新中心) Department of Biomedical Engineering, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学生物医学工程系) Department of Computer and Data Science, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学计算机与数据科学系)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DepthPilot框架,通过几何对齐策略和自适应样条去噪模块,实现结肠镜视频生成的可控性与可解释性,取得高FID分数和临床评估领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05811 2026-04-30 cs.CV 79%

Video Compression Meets Video Generation: Latent Inter-Frame Pruning with Attention Recovery

视频压缩与视频生成的交汇:具有注意力恢复的潜在帧剪枝

Dennis Menn, Yuedong Yang, Bokun Wang, Xiwen Wei, Mustafa Munir, Feng Liang, Radu Marculescu, Chenfeng Xu, Diana Marculescu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Meta

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出LIPAR框架,通过利用视频潜在补丁中的时间冗余性,减少计算延迟,提升视频编辑效率,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06287 2026-04-30 cs.CV 77%

Perception Test 2025: Challenge Summary and a Unified VQA Extension

2025感知测试挑战:挑战总结及统一视觉问答扩展

Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) University of Bristol(布里斯托大学) University of Oxford(牛津大学)

专题命中 视频生成 :video generation(abstract);video-language(abstract);long video(abstract);分类 cs.CV

AI总结 2025年感知测试挑战旨在评估最新视频模型并衡量多模态感知的进步,通过统一任务测试揭示现有模型在统一接口下处理多样化感知任务的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2511.20714 2026-04-30 cs.CV cs.AI 77%

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

Inferix:基于块扩散的下一代世界模拟推理引擎

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiyuan Wang, Jichao Wu, Mingyang Yang, Yinghao Yu, Zeyu Zhang, Bohan Zhuang

机构 * Inferix Team(Inferix 团队)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2505.24867 2026-04-30 cs.CV cs.AI 79%

Time Blindness: Why Video-Language Models Can't See What Humans Can?

时间盲:为什么视频语言模型无法看到人类能看见的东西?

Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny

机构 * KAUST(卡士大学) VILA Lab, MBZUAI(VILA实验室,MBZUAI)

专题命中 长视频与时序推理 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05959 2026-04-30 cs.CV 57%

OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer

OVGGT:O(1)常数成本流式视觉几何变换器

Si-Yu Lu, Po-Ting Chen, Hui-Che Hsu, Sin-Ye Jhong, Wen-Huang Cheng, Yung-Yao Chen

机构 * National Taiwan University(国立台湾大学) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 OVGGT通过自选择缓存和动态锚点保护,在固定内存预算下实现长视频流式处理,取得最佳3D几何精度。

Comments Project page: https://vaisr.github.io/OVGGT/ Code: https://github.com/VAISR/OVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏