arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-03 至 2026-03-03 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2603.00126 2026-03-03 cs.CV cs.AI cs.IR cs.MM cs.PF cs.SY eess.SY 84%

QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference

QuickGrasp: 通过加速分词和边缘增强推理实现响应式视频-语言查询服务

Miao Zhang, Ruixiao Zhang, Jianxin Shi, Hengzhi Wang, Hao Fang, Jiangchuan Liu

机构 * School of Computing Science, Simon Fraser University(计算科学学院,西蒙弗雷泽大学) Computer Science Department, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校) College of Cryptology and Cyber Science, Nankai University(密码学与网络科学学院,南开大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

AI总结 QuickGrasp通过加速分词和边缘增强推理,实现响应式视频-语言查询服务,兼顾准确性和响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00983 2026-03-03 cs.CV 79%

Event-Anchored Frame Selection for Effective Long-Video Understanding

基于事件的帧选择用于有效长视频理解

Wang Chen, Yongdong Luo, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出基于事件的帧选择方法,通过分层事件感知流程提升长视频理解的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01649 2026-03-03 cs.CV cs.AI 79%

Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning

面向贡献的视频理解强化学习token压缩

Yinchao Ma, Qiang Zhou, Zhibin Wang, Xianing Chen, Hanqing Yang, Jun Song, Bo Zheng

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 CaCoVID通过强化学习优化token选择策略,以提高视频理解任务的效率。

Comments This paper is accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01169 2026-03-03 cs.CV cs.AI cs.LG 57%

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

TripleSumm: 适应性三模态融合用于视频摘要

Sumin Kim, Hyemin Jeong, Mingu Kang, Yejin Kim, Yoori Oh, Joonseok Lee

机构 * Seoul National University(首尔国立大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 TripleSumm通过适应性三模态融合技术,在视频摘要任务中实现了最先进的性能,首次提出了多模态视频摘要的大型基准MoSu。

Comments Published as a Conference Paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏