arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-17 至 2026-03-17 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 10 篇

2603.14659 2026-03-17 cs.CV cs.AI 83%

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Project website: https://visioncoach.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01804 2026-03-17 cs.CV 83%

V-CORE: Temporally Consistent Video Understanding for Video-LLM

V-CORE:面向视频大语言模型的时序一致视频理解

Zhengjian Kang, Qi Chen, Rui Liu, Kangtong Mo, Xingyu Zhang, Xiaoyu Deng, Ye Zhang

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 79%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18269 2026-03-17 cs.CV cs.AI 79%

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

StreamingTOM: 流式令牌压缩以实现高效的视频理解

Xueyi Chen, Keda Tao, Kele Shao, Huan Wang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。

Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18802 2026-03-17 cs.CV 74%

Surgical Video Understanding with Label Interpolation

手术视频理解与标签插值

Garam Kim, Tae Kyeong Jeong, Juyoun Park

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出结合光流分割标签插值与多任务学习的框架,解决手术视频中时间空间不平衡问题,提升手术场景理解的准确性和效率。

Comments Accepted to ICRA 2026. Video: https://youtu.be/24LlhqvgFBU | Dataset: https://huggingface.co/datasets/KIST-HARILAB/MISAW-Seg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 57%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10979 2026-03-17 cs.CV cs.AI 57%

PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

PAS:一种无训练的时序编码稳定器

Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视频大语言模型中时序不一致问题,提出PAS机制,通过相位聚合平滑技术减少帧间扰动,提升注意力稳定性,实验表明在不增加计算开销的情况下提升了视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 57%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 57%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏