Coverage-Driven Adaptive Keyframe Selection for Video Understanding
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
ObjectStream:将潜在对象作为记忆锚点用于流视频理解
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 提出无需训练的 ObjectStream 框架,以潜在对象为记忆锚点组织流视频证据,使 Video-LLMs 无需改动即可推理对象相关内容,在多基准上实现性能提升且内存与推理效率显著优化。
WaveZip:用于视频令牌压缩的小波驱动时空解耦
机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) ; Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。
Comments 13 pages, 10 figures
CRAFT:面向视觉语言模型的基于视频令牌递归自适应融合的压缩方法
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉语言模型视频令牌压缩效率与适应性的权衡问题,提出CRAFT方法,通过解耦令牌选择与融合实现高效压缩,在8倍压缩时保留97%主干准确率且性能优于现有方法。
Comments 11 pages, 5 figures
重新思考基于全局码本的视频令牌压缩:一次学习,处处压缩
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究提出即插即用框架ONCE,通过离线学习全局码本实现视频令牌的高效压缩,在保持性能的同时降低推理延迟,提升了视频大语言模型的效率与通用性。
用于手语翻译的注意力引导视觉-语言模型
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; University of Virginia(弗吉尼亚大学) ; National Technical Institute for the Deaf(国家聋人技术学院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。