arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-23 至 2026-02-23 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.18019 2026-02-23 cs.CV cs.AI 79%

DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE

DeepSVU: 向深入的安全导向视频理解迈进:通过统一的物理世界正则化MoE

Yujie Jin, Wenxin Zhang, Jingjing Wang, Guodong Zhou

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出DeepSVU任务,通过统一物理世界正则化MoE方法,提升视频中威胁的识别、归因和评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17869 2026-02-23 cs.CV 79%

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2602.18422 2026-02-23 cs.CV 79%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: https://codeysun.github.io/generated-reality

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 2 篇

2602.18434 2026-02-23 cs.CV 57%

Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory

回溯记忆:通过动态KV缓存内存扩展令牌实现视频流理解

Vatsal Agarwal, Saksham Suri, Matthew Gwilliam, Pulkit Kumar, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 MemStream通过扩展令牌预算和自适应选择策略,提升视频流理解的准确性和细粒度信息保留能力。

Comments Project page: see https://vatsalag99.github.io/memstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16160 2026-02-23 cs.CV 57%

Uncertainty-Guided Inference-Time Depth Adaptation for Transformer-Based Visual Tracking

不确定性引导的推理时间深度适应用于基于变换器的视觉跟踪

Patrick Poggi, Divake Kumar, Theja Tulabandhula, Amit Ranjan Trivedi

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出UncL-STARK,通过动态不确定性引导的深度适应,在不修改网络的情况下,提升基于变换器的视觉跟踪效率,实现计算开销降低和能耗节省。

Comments Submitted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 2 篇

2602.17768 2026-02-23 cs.CV 74%

KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding

KPM-Bench: 一种用于细粒度运动中心视频理解的运动解析动作基准

Boda Lin, Yongjie Zhu, Xiaocheng Gong, Wenyu Qin, Meng Wang

机构 * Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 KPM-Bench通过整合运动学计算与语言解析,构建了一个用于细粒度运动中心视频理解的开源基准,提出MoPE算法以提升运动描述的准确性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17814 2026-02-23 cs.CV cs.IR cs.LG 57%

VQPP: Video Query Performance Prediction Benchmark

VQPP:视频查询性能预测基准

Adrian Catalin Lutu, Eduard Poesina, Radu Tudor Ionescu

机构 * University of Bucharest / Bitdefender(布加勒斯大学/Bitdefender) University of Bucharest(布加勒斯大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出VQPP基准,用于视频查询性能预测,包含两个数据集和两个系统,探索预检索和后检索预测器,并展示其在训练大型语言模型上的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏