arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-24 至 2026-04-24 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2604.09000 2026-04-24 cs.CV 79%

StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding

StreamMeCo:用于高效流视频理解的长期智能体内存压缩

Junxi Wang, Te Sun, Jiayi Zhu, Junxian Li, Haowen Xu, Zichen Wen, Xuming Hu, Zhiyu Li, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 StreamMeCo通过内存图连通性引入边自由minmax采样和边感知权重剪枝,有效压缩内存并保持精度,实验表明在70%压缩下实现1.87倍检索速度提升和1.0%的准确率提升。

Comments 2026ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21444 2026-04-24 cs.AI 78%

HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration

HiCrew:通过问题感知多智能体协作实现长视频理解的层次推理

Yuehan Zhu, Jingqi Zhao, Jiawen Zhao, Xudong Mao, Baoquan Zhao

机构 * School of Artificial Intelligence, Sun Yat-sen University, China(中山大学人工智能学院)

专题命中 视频理解 :video understanding(title,abstract)

AI总结 本文提出HiCrew框架,通过混合树结构、问题感知描述生成和动态规划层,解决长视频中时空冗余和叙事依赖问题,提升时间与因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21011 2026-04-24 cs.CV q-bio.NC 57%

Micro-DualNet: Dual-Path Spatio-Temporal Network for Micro-Action Recognition

微双网:用于微动作识别的双路径时空网络

Naga VS Raviteja Chappa, Evangelos Sariyanidi, Lisa Yankowitz, Gokul Nair, Casey J. Zampella, Robert T. Schultz, Birkan Tunç

机构 * The Children’s Hospital of Philadelphia(费城儿童医院) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出双路径网络,通过并行的空间-时间(ST)和时间-空间(TS)路径处理人体部位,采用自适应路由和MAC损失提升微动作识别性能。

Comments Accepted to International Conference on Automatic Face and Gesture Recognition (FG)

详情

展开后加载摘要…

URL PDF HTML 收藏