arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-03 至 2026-08-03 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2607.25266 2026-08-03 cs.CV cs.LG 版本更新 79%

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

FORGE:用于长视频理解的相关几何中的帧正交性

Ghazal Kaviani, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院) Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09223 2026-08-03 cs.CV 版本更新 79%

CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding

CREST: 曲率调节的事件中心采样用于高效长视频理解

Mehrajul Abadin Miraj, Abdul Mohaimen Al Radi, Shariful Islam Rayhan, Md. Tanvir Alam, Ismat Rahman, Yu Tian, Md Mosaddek Khan

机构 * Dept. of CSE, University of Dhaka(达卡大学计算机科学与工程系) Dept. of CSE, University of Central Florida(中央佛罗里达大学计算机科学与工程系)

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

AI总结 提出一种无训练帧选择方法CREST,利用查询-帧相关性的时间几何(局部曲率)来指导采样,在固定预算下实现高效长视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08342 2026-08-03 cs.LG 版本更新 78%

EgoEverything: A Benchmark for Human Behavior Inspired Long Context Egocentric Video Understanding in AR Environment

EgoEverything:一个受人类行为启发的长上下文第一人称视频理解AR环境基准

Qiance Tang, Ziqi Wang, Jieyu Lin, Ziyun Li, Barbara De Salvo, Sai Qian Zhang

机构 * New York University(纽约大学) Meta Reality Labs

专题命中 视频理解 :video understanding(title,abstract)

AI总结 本文提出EgoEverything基准,通过利用人类注意力信号生成问题,更真实地捕捉自然人类行为,用于评估AR环境中长上下文第一人称视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28678 2026-08-03 cs.AI cs.CV 新提交 74%

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE:为长视频理解构建自修正记忆

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

机构 * Zhejiang University(浙江大学) Xidian University(西安电子科技大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。

Comments Accept by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏