arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-08 至 2026-07-08 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2607.05511 2026-07-08 cs.CV 新提交 79%

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

Light-Omni:基于长期记忆的智能视频理解中的反射优于推理

Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 研究针对智能视频理解中先进智能体依赖迭代推理成本高的问题,提出Light-Omni框架,通过双重上下文状态实现反射式轻量级视频理解,经实验验证其有效性,性能优于M3-Agent且能增强现有MLLMs。

Comments Project Page: https://clare-nie.github.io/Light-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06468 2026-07-08 cs.CV 新提交 74%

EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage

EgoPolice:用于高风险警察随身摄像机视频中自我中心视频理解的基准

Max Gonzalez Saez-Diez, Jihoon Chung, Adam D. Wolsky, Gregory Lanzalotto, Dean Knox, Jonathan Mummolo, Brandon M. Stewart, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 研究旨在为高风险警察随身摄像机视频中的自我中心视频理解创建基准EgoPolice,通过精心挑选标注数据,设置分类和问答任务,对模型测试发现即使优秀模型预测高风险行动也有困难,该基准为开发相关模型及下游人工审查奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05093 2026-07-08 cs.CV 新提交 57%

Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing

通过多尺度卷积和动态路由实现下一代网络的语义视频通信

Gengtian Shi, Jinze Yu, Chenhao Wu, Shaofei Wang, Eiji Fukuzawa, Junjie Tang, Hiroshi Onoda, Jiang Liu

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院) Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心) Amazon(亚马逊)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 针对视频流量增长需求,提出语义视频通信框架,用多尺度时间卷积编码器捕捉运动模式,基于胶囊的动态路由机制优化关联,多任务学习统一组件,在实验中取得显著改进。

Comments Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)

详情

展开后加载摘要…

URL PDF HTML 收藏