arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-25 至 2026-05-25 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2605.23428 2026-05-25 cs.CV cs.MM 62%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23355 2026-05-25 cs.CV cs.LG cs.MM 62%

Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization

解耦时空适配器用于细粒度羽毛球动作定位

Tianyu Wang, Junjie Wu, Jingquan Gao, Shishuo Li

机构 * School of Economics and Management, Beihang University(北京航空航天大学经济管理学院) Key Laboratory of Data Intelligence and Management, Beihang University, Ministry of Industry and Information Technology(信息产业部北京航空航天大学数据智能与管理重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 针对细粒度羽毛球动作定位中复杂的时空动态,提出解耦时空适配器(DSTA),通过三个并行分支分别建模时间动态、垂直和水平空间变化,在Fine-Badminton数据集和ShuttleSet基准上实现最优性能且计算开销极小。

Comments 11 pages, 11figures

详情

展开后加载摘要…

URL PDF HTML 收藏