Long-Form Video-Language Pre-Training with Multimodal Temporal Contrastive Learning
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
Comments Accepted by NeurIPS 2022
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
Comments Accepted by NeurIPS 2022
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
Comments EMNLP 2022
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
Comments Accepted by NeurIPS 2022. Double champions at Ego4D and EPIC-Kitchens, CVPR 2022 challenges. 23 pages, 13 figures, 12 tables. Code: https://github.com/showlab/EgoVLP
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
Comments Preprint. 4 pages, 2 figures, 5 tables. Code: https://github.com/showlab/EgoVLP. The Ego4D challenge technical report of EgoVLP arXiv:2206.01670. See EPIC challenge technical report arXiv:2207.01334 for overlap
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
Comments To appeared in CVPRW22. 5 pages, 2 figures, 2 tables. Code: https://github.com/showlab/EgoVLP. The EPIC challenge technical report of EgoVLP arXiv:2206.01670. See Ego4D challenge technical report arXiv:2207.01622
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
Comments CVPR2022; Code: https://github.com/FingerRec/OA-Transformer
专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV
Comments Accepted at ACL 2022 Main conference. Camera-ready version
专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV
Comments This work extends the previous DTVNet in ECCV'20, and we further present a high-quality and high-resolution Quick-Sky-Time dataset and carry out more adequate experiments and analysis
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Serendipity One Inc.(Serendipity One公司)
专题命中 视频数据与评测 :video generation(title);text-to-video(abstract)
SVCBench:一种用于空间-时间状态维护的流视频计数基准
机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
AI总结 SVCBench通过流式多点查询观察状态维护轨迹,设计了三个互补指标来诊断数值精度、轨迹一致性及时间意识,评估主流视频语言模型在空间-时间状态维护上的不足,尤其在周期性事件计数上表现不佳。
Comments Accepted to ECCV 2026. Project page: https://buaa-colalab.github.io/SVCBench/
机构 * College of Computing and Data Science(计算与数据科学学院) ; Nanyang Technological University(南洋理工大学)
专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025 D&B Track
专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);video-language(abstract);分类 cs.CV
机构 * Show Lab, National University of Singapore(Show实验室,新加坡国立大学)
专题命中 视频数据与评测 :video generation(title);分类 cs.CV、cs.MM
Comments Project Page: https://showlab.github.io/Code2Video/
MuSS:一个多镜头数据集和电影叙事基准用于多镜头主体到视频生成
机构 * South China University of Technology(华南理工大学) ; Fudan University(复旦大学) ; Yunnan Normal University(云南师范大学)
专题命中 视频数据与评测 :video generation(title);分类 cs.CV
AI总结 本文提出MuSS数据集和电影叙事基准,解决多镜头视频生成中的叙事逻辑、时空对齐和复制粘贴问题,通过改进的标注流程和反复制粘贴指标提升生成质量。
Comments 17 pages, 9 figues
VideoNorms:视频语言模型文化意识基准测试
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
专题命中 视频数据与评测 :video language model(title);分类 cs.CV
AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。
Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026
NLPCC 2026共享任务1概述:难度感知多语言多模态医学教学视频理解评估
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与工程学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 视频数据与评测 :video understanding(title);分类 cs.CV
AI总结 NLPCC 2026的DA - MIVQA共享任务,通过区分问题难度扩展多语言多模态医学视频基准,含三个赛道。其数据集来自公共医学教学渠道,涵盖多种场景并经人工标注难度。该任务为评估医学教学视频问答系统提供实用基准。
Comments 19 pages, 6 figures, 6 tables
MAVEN:一种多阶段代理标注管道用于视频推理任务
机构 * NVIDIA
专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV
AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。
Comments CVPR 2026 Workshop
视频推理模型是否已准备好走向户外?
机构 * NTU Singapore(新加坡国立大学) ; Korea University(韩国大学)
专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV
AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。
Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026
OmniHuman:面向以人为中心的视频生成的大规模数据集与基准
机构 * Peking University(北京大学) ; WeChat Lab(微信实验室) ; Chinese Academy of Sciences(中国科学院)
专题命中 视频数据与评测 :video generation(title);分类 cs.CV
AI总结 为解决现有数据集在场景多样性、交互建模和属性对齐方面的结构性缺陷,提出OmniHuman大规模多场景数据集及全自动标注流程,并建立OHBench三级评估体系,实现与人类感知高度一致的诊断。
Comments 19 pages, 6 figures
SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准
机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) ; University of Groningen(Groningen大学) ; York University(约克大学)
专题命中 视频数据与评测 :video understanding(title);分类 cs.CV
AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。
观看、推理与搜索:一个面向开放网络的视频深度研究基准,用于代理视频推理
机构 * LZU(兰州大学) ; HKUST(GZ)(香港科技大学(广州)) ; UBC(不列颠哥伦比亚大学) ; FDU(福建大学) ; PKU(北京大学) ; USC(美国南加州大学) ; NUS(新加坡国立大学) ; UCAS(中国科学院大学) ; HKUST(香港科技大学) ; QuantaAlpha(量子Alpha)
专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV
AI总结 本文提出VideoDR基准,用于研究开放网络环境下视频代理推理,通过跨帧视觉锚点提取、交互式网络检索和多跳推理验证,揭示了长检索链中维持初始视频锚点、目标漂移和长时程一致性等关键挑战。
AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准
机构 * Microsoft Research Asia(微软亚洲研究院) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视频数据与评测 :video generation(title);分类 cs.CV
AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。
MVPBench: 一个多视频感知评估基准用于多模态视频理解
机构 * MAIS \& NLPR, Institute of Automation Chinese Academy of Sciences Beijing, China ; SIST ShanghaiTech University Shanghai, China
专题命中 视频数据与评测 :video understanding(title);分类 cs.CV
AI总结 MVPBench通过14个跨多样本域的子任务评估模型从视频序列中提取相关信息的能力,揭示当前模型在多视频处理上的局限性。
Comments 15 pages, 7 figures, accepted by IJCNN 2026, code and dataset available at https://github.com/MVPBench/MVPBench
LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Ant Group(蚂蚁集团) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of California Merced(加州大学默塞德分校)
专题命中 视频数据与评测 :video understanding(title);分类 cs.CV
AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。
Comments Project page: https://kd-tao.github.io/LVOmniBench/
KPM-Bench: 一种用于细粒度运动中心视频理解的运动解析动作基准
机构 * Kuaishou Technology(快手科技)
专题命中 视频数据与评测 :video understanding(title);分类 cs.CV
AI总结 KPM-Bench通过整合运动学计算与语言解析,构建了一个用于细粒度运动中心视频理解的开源基准,提出MoPE算法以提升运动描述的准确性与可靠性。
Comments 26 pages
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Institute of Science Tokyo(东京科学研究所) ; Nanjing University(南京大学)
专题命中 视频数据与评测 :video understanding(title);分类 cs.CV
Comments Data & Code: https://github.com/OpenGVLab/ExpVid
机构 * Peking University(北京大学) ; Shenzhen Graduate School(深圳研究生院) ; University of Rochester(罗切斯特大学) ; Rabbitpre AI
专题命中 视频数据与评测 :video generation(title);分类 cs.CV
Comments Code and Dataset: https://github.com/PKU-YuanGroup/OpenS2V-Nexus
机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) ; Virginia Tech Transportation Institute, Virginia Tech(弗吉尼亚理工学院交通研究所) ; Department of Statistics, Virginia Tech(弗吉尼亚理工学院统计学系)
专题命中 视频数据与评测 :video understanding(title);分类 cs.CV
专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV
Comments CVPR 2025. For data, visit https://blackswan.cs.ubc.ca
专题命中 视频数据与评测 :video generation(title);分类 cs.CV
Comments CVPR 2025. Project page: https://snap-research.github.io/open-set-video-personalization/