arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-12 至 2026-08-12 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2608.10949 2026-08-12 cs.CV cs.CL 新提交 79%

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

StreamFlow:用于流视频理解的动态内存流

Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10764 2026-08-12 cs.CV 新提交 79%

FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding

FADE:从被动验证到反事实视频理解中的主动发现

Fufangchen Zhao, Jinhu Fu, Jiachen Lei, Jiahong Wu, Xiangxiang Chu, Danfeng Yan

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出FADE框架,解决现有反事实视频理解基准泄露目标事件的问题,通过两阶段训练实现主动发现,在三项任务上性能优于GPT-5.6,为相关研究提供坚实基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10864 2026-08-12 cs.CV 新提交 57%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏