arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2210.06031 2023-03-03 cs.CV 79%

Long-Form Video-Language Pre-Training with Multimodal Temporal Contrastive Learning

Yuchong Sun, Hongwei Xue, Ruihua Song, Bei Liu, Huan Yang, Jianlong Fu

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06881 2022-10-14 cs.CV cs.AI 79%

RaP: Redundancy-aware Video-language Pre-training for Text-Video Retrieval

Xing Wu, Chaochen Gao, Zijia Lin, Zhongyuan Wang, Jizhong Han, Songlin Hu

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01670 2022-10-14 cs.CV cs.AI 79%

Egocentric Video-Language Pretraining

Kevin Qinghong Lin, Alex Jinpeng Wang, Mattia Soldan, Michael Wray, Rui Yan, Eric Zhongcong Xu, Difei Gao, Rongcheng Tu, Wenzhe Zhao, Weijie Kong, Chengfei Cai, Hongfa Wang, Dima Damen, Bernard Ghanem, Wei Liu, Mike Zheng Shou

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2022. Double champions at Ego4D and EPIC-Kitchens, CVPR 2022 challenges. 23 pages, 13 figures, 12 tables. Code: https://github.com/showlab/EgoVLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01622 2022-08-04 cs.CV 79%

Egocentric Video-Language Pretraining @ Ego4D Challenge 2022

Kevin Qinghong Lin, Alex Jinpeng Wang, Mattia Soldan, Michael Wray, Rui Yan, Eric Zhongcong Xu, Difei Gao, Rongcheng Tu, Wenzhe Zhao, Weijie Kong, Chengfei Cai, Hongfa Wang, Dima Damen, Bernard Ghanem, Wei Liu, Mike Zheng Shou

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments Preprint. 4 pages, 2 figures, 5 tables. Code: https://github.com/showlab/EgoVLP. The Ego4D challenge technical report of EgoVLP arXiv:2206.01670. See EPIC challenge technical report arXiv:2207.01334 for overlap

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01334 2022-08-04 cs.CV 79%

Egocentric Video-Language Pretraining @ EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge 2022

Kevin Qinghong Lin, Alex Jinpeng Wang, Rui Yan, Eric Zhongcong Xu, Rongcheng Tu, Yanru Zhu, Wenzhe Zhao, Weijie Kong, Chengfei Cai, Hongfa Wang, Wei Liu, Mike Zheng Shou

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments To appeared in CVPRW22. 5 pages, 2 figures, 2 tables. Code: https://github.com/showlab/EgoVLP. The EPIC challenge technical report of EgoVLP arXiv:2206.01670. See Ego4D challenge technical report arXiv:2207.01622

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00656 2022-05-19 cs.CV cs.CL 79%

Object-aware Video-language Pre-training for Retrieval

Alex Jinpeng Wang, Yixiao Ge, Guanyu Cai, Rui Yan, Xudong Lin, Ying Shan, Xiaohu Qie, Mike Zheng Shou

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments CVPR2022; Code: https://github.com/FingerRec/OA-Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04182 2022-03-24 cs.CV 79%

FIBER: Fill-in-the-Blanks as a Challenging Video Understanding Evaluation Framework

Santiago Castro, Ruoyao Wang, Pingxuan Huang, Ian Stewart, Oana Ignat, Nan Liu, Jonathan C. Stroud, Rada Mihalcea

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments Accepted at ACL 2022 Main conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.04776 2021-12-20 cs.CV 79%

DTVNet+: A High-Resolution Scenic Dataset for Dynamic Time-lapse Video Generation

Jiangning Zhang, Chao Xu, Yong Liu, Yunliang Jiang

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments This work extends the previous DTVNet in ECCV'20, and we further present a high-quality and high-resolution Quick-Sky-Time dataset and carry out more adequate experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01689 2025-06-03 cs.AI cs.CL 78%

Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents

Shuting Wang, Yunqi Liu, Zixin Yang, Ning Hu, Zhicheng Dou, Chenyan Xiong

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Serendipity One Inc.(Serendipity One公司)

专题命中 视频数据与评测 :video generation(title);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12703 2026-06-30 cs.CV 77%

SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance

SVCBench:一种用于空间-时间状态维护的流视频计数基准

Pengyiang Liu, Zhongyue Shi, Hongye Hao, Qi Fu, Xueting Bi, Siwei Zhang, Xiaoyang Hu, Zitian Wang, Linjiang Huang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV

AI总结 SVCBench通过流式多点查询观察状态维护轨迹,设计了三个互补指标来诊断数值精度、轨迹一致性及时间意识,评估主流视频语言模型在空间-时间状态维护上的不足,尤其在周期性事件计数上表现不佳。

Comments Accepted to ECCV 2026. Project page: https://buaa-colalab.github.io/SVCBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19853 2025-11-07 cs.CV cs.AI 77%

Two Causally Related Needles in a Video Haystack

Miaoyu Li, Qin Chao, Boyang Li

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07752 2025-03-26 cs.CV 77%

Lost in Time: A New Temporal Benchmark for VideoLLMs

Daniel Cores, Michael Dorkenwald, Manuel Mucientes, Cees G. M. Snoek, Yuki M. Asano

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01174 2025-10-02 cs.CV cs.AI cs.CL cs.HC cs.MM 76%

Code2Video: A Code-centric Paradigm for Educational Video Generation

Yanzhe Chen, Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(Show实验室,新加坡国立大学)

专题命中 视频数据与评测 :video generation(title);分类 cs.CV、cs.MM

Comments Project Page: https://showlab.github.io/Code2Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23789 2026-08-12 cs.CV 版本更新 74%

MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

MuSS:一个多镜头数据集和电影叙事基准用于多镜头主体到视频生成

Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye, Nanqing Liu, Yaling Liang

机构 * South China University of Technology(华南理工大学) Fudan University(复旦大学) Yunnan Normal University(云南师范大学)

专题命中 视频数据与评测 :video generation(title);分类 cs.CV

AI总结 本文提出MuSS数据集和电影叙事基准,解决多镜头视频生成中的叙事逻辑、时空对齐和复制粘贴问题,通过改进的标注流程和反复制粘贴指标提升生成质量。

Comments 17 pages, 9 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新 74%

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 视频数据与评测 :video language model(title);分类 cs.CV

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06618 2026-07-21 cs.CV cs.AI 版本更新 74%

Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation

NLPCC 2026共享任务1概述:难度感知多语言多模态医学教学视频理解评估

Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与工程学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 NLPCC 2026的DA - MIVQA共享任务,通过区分问题难度扩展多语言多模态医学视频基准,含三个赛道。其数据集来自公共医学教学渠道,涵盖多种场景并经人工标注难度。该任务为评估医学教学视频问答系统提供实用基准。

Comments 19 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21917 2026-07-10 cs.CV cs.AI 版本更新 74%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10652 2026-07-01 cs.CV cs.AI 版本更新 74%

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18326 2026-06-02 cs.CV 74%

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

OmniHuman:面向以人为中心的视频生成的大规模数据集与基准

Lei Zhu, Xing Cai, Yingjie Chen, Yiheng Li, Binxin Yang, Hao Liu, Jie Chen, Chen Li, Jing LYu

机构 * Peking University(北京大学) WeChat Lab(微信实验室) Chinese Academy of Sciences(中国科学院)

专题命中 视频数据与评测 :video generation(title);分类 cs.CV

AI总结 为解决现有数据集在场景多样性、交互建模和属性对齐方面的结构性缺陷,提出OmniHuman大规模多场景数据集及全自动标注流程,并建立OHBench三级评估体系,实现与人类感知高度一致的诊断。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21666 2026-05-28 cs.AI cs.CV 74%

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准

Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Groningen(Groningen大学) York University(约克大学)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06943 2026-05-19 cs.CV cs.AI 74%

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning

观看、推理与搜索:一个面向开放网络的视频深度研究基准,用于代理视频推理

Chengwen Liu, Xiaomin Yu, Zhuoyue Chang, Zhe Huang, Shuo Zhang, Heng Lian, Jisheng Dang, Rui Xu, Sen Hu, Jianheng Hou, Chengwei Qin, Xiaobin Hu, Kunyi Wang, Zhi Yang, Hao Peng, Hong Peng, Ronghao Chen, Huacan Wang

机构 * LZU(兰州大学) HKUST(GZ)(香港科技大学(广州)) UBC(不列颠哥伦比亚大学) FDU(福建大学) PKU(北京大学) USC(美国南加州大学) NUS(新加坡国立大学) UCAS(中国科学院大学) HKUST(香港科技大学) QuantaAlpha(量子Alpha)

专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV

AI总结 本文提出VideoDR基准,用于研究开放网络环境下视频代理推理,通过跨帧视觉锚点提取、交互式网络检索和多跳推理验证,揭示了长检索链中维持初始视频锚点、目标漂移和长时程一致性等关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08540 2026-04-10 cs.CV cs.AI cs.CL 74%

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频数据与评测 :video generation(title);分类 cs.CV

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22756 2026-03-25 cs.CV 74%

MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding

MVPBench: 一个多视频感知评估基准用于多模态视频理解

Purui Bai, Tao Wu, Jiayang Sun, Xinyue Liu, Huaibo Huang, Ran He

机构 * MAIS \& NLPR, Institute of Automation Chinese Academy of Sciences Beijing, China SIST ShanghaiTech University Shanghai, China

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 MVPBench通过14个跨多样本域的子任务评估模型从视频序列中提取相关信息的能力,揭示当前模型在多视频处理上的局限性。

Comments 15 pages, 7 figures, accepted by IJCNN 2026, code and dataset available at https://github.com/MVPBench/MVPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19217 2026-03-20 cs.CV 74%

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17768 2026-02-23 cs.CV 74%

KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding

KPM-Bench: 一种用于细粒度运动中心视频理解的运动解析动作基准

Boda Lin, Yongjie Zhu, Xiaocheng Gong, Wenyu Qin, Meng Wang

机构 * Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 KPM-Bench通过整合运动学计算与语言解析,构建了一个用于细粒度运动中心视频理解的开源基准,提出MoPE算法以提升运动描述的准确性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11606 2025-10-14 cs.CV 74%

ExpVid: A Benchmark for Experiment Video Understanding & Reasoning

Yicheng Xu, Yue Wu, Jiashuo Yu, Ziang Yan, Tianxiang Jiang, Yinan He, Qingsong Zhao, Kai Chen, Yu Qiao, Limin Wang, Manabu Okumura, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Institute of Science Tokyo(东京科学研究所) Nanjing University(南京大学)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

Comments Data & Code: https://github.com/OpenGVLab/ExpVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20292 2025-06-04 cs.CV cs.AI 74%

OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation

Shenghai Yuan, Xianyi He, Yufan Deng, Yang Ye, Jinfa Huang, Bin Lin, Jiebo Luo, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) University of Rochester(罗切斯特大学) Rabbitpre AI

专题命中 视频数据与评测 :video generation(title);分类 cs.CV

Comments Code and Dataset: https://github.com/PKU-YuanGroup/OpenS2V-Nexus

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14526 2025-04-22 cs.CV cs.CL 74%

Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding

Tong Zeng, Longfeng Wu, Liang Shi, Dawei Zhou, Feng Guo

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) Virginia Tech Transportation Institute, Virginia Tech(弗吉尼亚理工学院交通研究所) Department of Statistics, Virginia Tech(弗吉尼亚理工学院统计学系)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05725 2025-04-09 cs.CV cs.AI 74%

Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events

Aditya Chinchure, Sahithya Ravi, Raymond Ng, Vered Shwartz, Boyang Li, Leonid Sigal

专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV

Comments CVPR 2025. For data, visit https://blackswan.cs.ubc.ca

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06187 2025-03-21 cs.CV 74%

Multi-subject Open-set Personalization in Video Generation

Tsai-Shien Chen, Aliaksandr Siarohin, Willi Menapace, Yuwei Fang, Kwot Sin Lee, Ivan Skorokhodov, Kfir Aberman, Jun-Yan Zhu, Ming-Hsuan Yang, Sergey Tulyakov

专题命中 视频数据与评测 :video generation(title);分类 cs.CV

Comments CVPR 2025. Project page: https://snap-research.github.io/open-set-video-personalization/

详情

展开后加载摘要…

URL PDF HTML 收藏