arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-04 至 2026-08-04 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2608.00714 2026-08-04 cs.CV cs.AI 新提交 79%

Coverage-Driven Adaptive Keyframe Selection for Video Understanding

面向视频理解的覆盖驱动型自适应关键帧选择

Junyang Zhang, Puhan Luo, Chen Tang, Yuxi Shi, Xiang-Yang Li

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28312 2026-08-04 cs.CV cs.AI 版本更新 79%

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

ObjectStream:将潜在对象作为记忆锚点用于流视频理解

Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出无需训练的 ObjectStream 框架,以潜在对象为记忆锚点组织流视频证据,使 Video-LLMs 无需改动即可推理对象相关内容,在多基准上实现性能提升且内存与推理效率显著优化。

Comments https://github.com/DMK041218/ObjectStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23265 2026-08-04 cs.CV 版本更新 70%

WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

WaveZip:用于视频令牌压缩的小波驱动时空解耦

Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, jiebo Luo

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01644 2026-08-04 cs.CV cs.AI 新提交 57%

CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

CRAFT:面向视觉语言模型的基于视频令牌递归自适应融合的压缩方法

Yu Chen, Xiaohong Li, Xiaole Wang, Jianjin Zhang, Jun Sun, Yafeng Deng

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视觉语言模型视频令牌压缩效率与适应性的权衡问题,提出CRAFT方法,通过解耦令牌选择与融合实现高效压缩,在8倍压缩时保留97%主干准确率且性能优于现有方法。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01271 2026-08-04 cs.CV cs.AI 新提交 57%

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

重新思考基于全局码本的视频令牌压缩:一次学习,处处压缩

Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出即插即用框架ONCE,通过离线学习全局码本实现视频令牌的高效压缩,在保持性能的同时降低推理延迟,提升了视频大语言模型的效率与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00235 2026-08-04 cs.CV 新提交 57%

Attention-Steered Vision-Language Models for Sign Language Translation

用于手语翻译的注意力引导视觉-语言模型

Meibo Hu, Guohao Sun, Annemarie D. Ross, Sheng Li, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) University of Virginia(弗吉尼亚大学) National Technical Institute for the Deaf(国家聋人技术学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏