arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-20 至 2026-07-20 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2603.12262 2026-07-20 cs.CV 版本更新 57%

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2512.22274 2026-07-20 cs.CV 版本更新 79%

GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure

GeCo:通过运动和结构评估视频生成的几何一致性

Leslie Gu, Junhwa Hur, Charles Herrmann, Fangneng Zhan, Todd Zickler, Deqing Sun, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeCo通过融合残差运动和深度先验,检测静态场景中的几何变形和遮挡不一致问题,并用于评估视频生成模型的性能与缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19356 2026-07-20 cs.CV 版本更新 57%

Rethinking Reward Signals in Video GRPO: When Scores Become Targets

重新思考视频GRPO中的奖励信号:当分数成为目标

Rui Li, Yuanzhi Liang, Ziqi Ni, Haibin Huang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出TaRoS框架,通过组件级评估和组内稀疏性解决GRPO中奖励信号失真问题,提升视频生成的视觉质量和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2603.19235 2026-07-20 cs.CV cs.RO 版本更新 70%

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 2 篇

2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 79%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13552 2026-07-20 cs.CV 版本更新 57%

A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects

视频场景解析的全面综述:进展、挑战与展望

Guohuan Xie, Syed Ariff Syed Hesham, Wenya Guo, Bing Li, Ming-Ming Cheng, Guolei Sun, Yun Liu

机构 * College of Software, Nankai University Tianjin China School of Electrical Electronic Engineering, NTU \& Institute for Infocomm Research, A STAR Singapore School of Information College of Computer Science, Nankai University Tianjin China VCIP, College of Computer Science, Nankai University Tianjin China Academy for Advanced Interdisciplinary Studies, Nankai University Tianjin China Nankai International Advanced Research Institute Shenzhen Futian China College of Software, Nankai University Electronic Engineering, NTU \& Institute for Infocomm Research, A STAR College of Computer Science, Nankai University VCIP, College of Computer Science, Nankai University Academy for Advanced Interdisciplinary Studies, Nankai University Nankai International Advanced Research Institute

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 该综述对视频场景解析在五项任务上的进展进行梳理,涵盖从手工线索到基础模型方法的文献架构,分析各方法特点,比较相关数据集等,指出设计权衡和失败模式,并给出未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏