arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-28 至 2026-07-28 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2607.24582 2026-07-28 cs.CV cs.AI 新提交 83%

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

CADER:用于长视频理解的置信度感知动态证据推理

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交 79%

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22726 2026-07-28 cs.CV 新提交 57%

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

PCA:用于快速视频大语言模型的持久性感知压缩与聚合

Zihan Song, Shuo Ye, Bo Zhao, Ruixin Zhang, Jiayu Zhang, Shouhong Ding, Zitong Yu

机构 * Institute for Artificial Intelligence, Great Bay University(大湾区大学人工智能研究院) Sun Yat-sen University(中山大学) Youtu Lab, Tencent(腾讯优图实验室) Shenzhen University(深圳大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究视频大语言模型长时帧冗余问题,提出PCA方法,含动态下采样和持久性感知运动增强模块,能在编码前保留视觉信息,提升效率与准确性,优于现有方法,速度有显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏