arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-27 至 2026-03-27 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2603.25072 2026-03-27 cs.CV 79%

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20525 2026-03-27 cs.CV 57%

Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos

错误归因:第一性错误理解在第一人称视频中

Yayuan Li, Aadit Jain, Filippos Bellos, Jason J. Corso

机构 * University of Michigan(密歇根大学) Voxel51

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 本文提出MATT任务,通过细粒度分析第一人称视频中的人类错误,开发MisEngine数据引擎生成带有归因注释的错误样本,并提出MisFormer模型在语义、时间和空间维度上实现统一的错误归因,实验表明其在视频语言理解等任务上优于现有方法。

Comments 12 pages, 5 figures, 7 tables. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏