arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-06 至 2026-04-06 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2604.02891 2026-04-06 cs.CV 83%

Progressive Video Condensation with MLLM Agent for Long-form Video Understanding

逐步视频压缩与MLLM代理用于长视频理解

Yufei Yin, Yuchen Xing, Qianke Meng, Minghao Chen, Yan Yang, Zhou Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出ProVCA,通过逐步缩小范围从粗略片段到精细帧,利用MLLM进行高效视频理解,实现高准确率。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00683 2026-04-06 cs.CV 79%

Video Understanding: Through A Temporal Lens

视频理解:通过时间视角

Thong Thanh Nguyen

机构 * Institute of Data Science(数据科学研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文通过时间视角探讨如何利用视频元素间的时间关系提升视频理解,提出自动标注框架、参数高效微调策略、状态空间层整合、新型对比学习框架及对大视觉-语言模型的全面研究,揭示了视觉-语言接口对时间推理的瓶颈。

Comments PhD Thesis, NUS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08666 2026-04-06 cs.CV 79%

Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding

隐私超越像素:用于隐私保护视频理解的潜在匿名化

Joseph Fioresi, Ishan Rajendrakumar Dave, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) Adobe

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出了一种在潜在空间中操作的视频基础模型视觉隐私保护新方法,通过轻量级匿名化适配模块在保留任务实用性的同时去除隐私信息,显著降低隐私泄露,适用于多种下游任务。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏