arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-21 至 2026-04-21 共收录 34 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 5 篇

2604.17115 2026-04-21 cs.CV 57%

Inference-Time Temporal Probability Smoothing for Stable Video Segmentation with SAM2 under Weak Prompts

推理时的时间概率平滑用于在弱提示下稳定的视频分割与SAM2

Dawar Jyoti Deka

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出一种推理时的时间概率平滑方法,提升SAM2视频分割的时序稳定性,无需重训练或修改架构。通过光流运动变形和像素不确定性估计,实现弱提示下的时序一致分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 57%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频数据与评测 1 篇

2604.17428 2026-04-21 cs.CV cs.AI 57%

Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation

Long-CODE:将纯长上下文作为视频评估中的一个正交维度

Zhijiang Tang, Jiaxin Qi, Bing Zhao, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study, UCAS(浙江大学杭州高等研究院) Computer Network Information Center, CAS(中国科学院计算机网络信息中心) Department of AI Infrastructure, Bilibili Inc.(B站人工智能基础设施部)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出Long-CODE,通过分离长上下文属性,设计专门的长视频评估框架,解决传统短视频评估指标在长视频中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他视频模型 1 篇

2604.18260 2026-04-21 cs.CV 79%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏