Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform
机构 * Xianpan Zhou
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://tinytigerpan.github.io/tiger200k/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
机构 * Xianpan Zhou
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://tinytigerpan.github.io/tiger200k/
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Accepted to NAACL 2025
专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV
Journal ref wacv(2025) 5801-5811
专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV
Comments ICLR 2025
专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
专题命中 视频数据与评测 :video generation(abstract);long video(abstract);分类 cs.CV
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
专题命中 视频数据与评测 :video-language(abstract);long video(abstract);分类 cs.CV
Comments 14 pages, 4 figures, 8 tables, Accepted at NeurIPS Dataset and Benchmark Track 2024
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Leaderboard: https://huggingface.co/spaces/Vchitect/VBench_Leaderboard Code: https://github.com/Vchitect/VBench Project page: https://vchitect.github.io/VBench-project/ extension of arXiv:2311.17982. arXiv admin note: substantial text overlap with arXiv:2311.17982
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments 9 pages,7 figures
Journal ref NeurIPS 2024
专题命中 视频数据与评测 :video generation(abstract);long video(abstract);分类 cs.CV
Comments NeurIPS 2024 Dataset and Benchmark Track. Project page: https://silentview.github.io/LVD-2M/ . Code: https://github.com/SilentView/LVD-2M
专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments NeurIPS D&B 2023
专题命中 视频数据与评测 :video-language(abstract);long video(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2023 Track on Datasets and Benchmarks; Project Webpage: https://antoyang.github.io/vidchapters.html ; 31 pages; 8 figures
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
Comments https://egoschema.github.io/
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Accepted by CVPR2023. Project Page: https://celebv-text.github.io/
专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
Comments Published at NeurIPS Track on Datasets and Benchmarks 2022
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
Comments Accepted by ECCV2020 as spotlight presentation. Project page: http://movienet.site
机构 * Independent Researcher(独立研究者)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM
Comments 10 pages, 5 figures, 5 tables
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract)
现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国国立庆北大学AI)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。
Comments Accepted to Interspeech 2026
SVHighlights: 迈向极长体育视频精彩片段检测
机构 * Ulsan National Institute of Science and Technology(釜山国立科学研究院)
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM
AI总结 针对现有方法无法处理超长视频精彩片段检测的问题,提出首个基准SVHighlights(包含320个平均时长2小时的体育视频)以及无训练的分段方法TF-SELECTOR,通过大语言模型融合多模态信息预测片段级显著性分数,在多个指标上超越现有基线。
Comments Accepted to KDD 2026 (Datasets and Benchmarks Track). Project Page: https://leedongkyu2019.github.io/SVHighlights/
BRITE:面向不可信场景的可靠可解释文本到视频评估基准
机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)
专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。
多模态大语言模型作为视频研究中的合成参与者:一项评估
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。
Comments Accepted to SocialLLM @ ICWSM 2026
TimeLens:重新思考视频时间接地与多模态大语言模型
机构 * Nanjing University(南京大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。
Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/
CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类
机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。
Comments Accepted to CVPR 2026
VC-Bench:开创视频连接基准的Dataset与评估指标
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(计算机科学与技术学院,哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 VC-Bench提出一个用于视频连接任务的新型基准,包含多样化视频数据和综合评估指标,评估现有视频生成模型并揭示其在连贯性和流畅性上的不足。