arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-21 至 2026-08-21 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2601.07761 2026-08-21 cs.CV 版本更新 83%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04500 2026-08-21 cs.CV cs.AI 版本更新 79%

ReynoldsFlow: Physics-Inspired Spatiotemporal Flow Representation for Video Understanding

ReynoldsFlow:用于视频理解的物理启发式时空流表示

Yu-Hsi Chen, Ching-Kai Lin, PingKong Huang, Chin-Tien Wu

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对现有视频理解方法计算成本高、运动表示鲁棒性差的问题,提出基于RTT和HHD的ReynoldsFlow,分解运动为CF和DF分量,可提升下游任务性能且兼具轻量高效性。

Comments 18 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19737 2026-08-21 cs.CV cs.AI cs.CL 新提交 57%

TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling

TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击

Ling Zhou, Yihao Huang, Jingling Sun, Zhiwen Tian, Yi Zeng, Qihe Liu, Shijie Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) East China Normal University(华东师范大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。

Comments 8 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19646 2026-08-21 cs.CV 新提交 57%

PL-NBA: A Possession-level Universal Basketball Video Dataset Supporting Multiple Visual Understanding Tasks

PL-NBA:支持多种视觉理解任务的控球级通用篮球视频数据集

Yunhao Zhao, Haoying Sun, Jiarui Li, Zhuming Wang, Ya Jing, Xiangbo Shu, Lifang Wu, Changwen Chen

机构 * Beijing University of Technology(北京工业大学) Nanjing University of Science and Technology(南京理工大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文构建首个控球级篮球视频数据集PL-NBA,包含11000个进攻控球片段及31567个注释事件,在四项视觉理解任务上验证其挑战性,为体育视频理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏