arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2504.15182 2025-04-22 cs.CV 70%

Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform

Xianpan Zhou

机构 * Xianpan Zhou

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://tinytigerpan.github.io/tiger200k/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10326 2025-03-26 cs.CV 70%

VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs

Rohit Bharadwaj, Hanan Gani, Muzammal Naseer, Fahad Shahbaz Khan, Salman Khan

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01180 2025-03-24 cs.CV cs.CL 70%

UAL-Bench: The First Comprehensive Unusual Activity Localization Benchmark

Hasnat Md Abdullah, Tian Liu, Kangda Wei, Shu Kong, Ruihong Huang

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV

Journal ref wacv(2025) 5801-5811

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09367 2025-03-10 cs.CV 70%

Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs

Zijia Zhao, Haoyu Lu, Yuqi Huo, Yifan Du, Tongtian Yue, Longteng Guo, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20063 2025-03-04 cs.CV 70%

Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs

Zicheng Zhang, Ziheng Jia, Haoning Wu, Chunyi Li, Zijian Chen, Yingjie Zhou, Wei Sun, Xiaohong Liu, Xiongkuo Min, Weisi Lin, Guangtao Zhai

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11775 2025-02-18 cs.CV 70%

video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model

Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun MA, Chao Zhang

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08234 2025-02-13 cs.CV 70%

Learning Human Skill Generators at Key-Step Levels

Yilu Wu, Chenhui Zhu, Shuai Wang, Hanlin Wang, Jing Wang, Zhaoxiang Zhang, Limin Wang

专题命中 视频数据与评测 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06908 2025-02-07 cs.CV cs.CL 70%

EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation

Hao Liang, Zirong Chen, Hejun Dong, Wentao Zhang

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01549 2025-02-04 cs.IR cs.AI cs.CV 70%

VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos

Xubin Ren, Lingrui Xu, Long Xia, Shuaiqiang Wang, Dawei Yin, Chao Huang

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13123 2024-12-17 cs.AI cs.CV 70%

ViLCo-Bench: VIdeo Language COntinual learning Benchmark

Tianqi Tang, Shohreh Deldari, Hao Xue, Celso De Melo, Flora D. Salim

专题命中 视频数据与评测 :video-language(abstract);long video(abstract);分类 cs.CV

Comments 14 pages, 4 figures, 8 tables, Accepted at NeurIPS Dataset and Benchmark Track 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13503 2024-11-21 cs.CV 70%

VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models

Ziqi Huang, Fan Zhang, Xiaojie Xu, Yinan He, Jiashuo Yu, Ziyue Dong, Qianli Ma, Nattapol Chanpaisit, Chenyang Si, Yuming Jiang, Yaohui Wang, Xinyuan Chen, Ying-Cong Chen, Limin Wang, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Leaderboard: https://huggingface.co/spaces/Vchitect/VBench_Leaderboard Code: https://github.com/Vchitect/VBench Project page: https://vchitect.github.io/VBench-project/ extension of arXiv:2311.17982. arXiv admin note: substantial text overlap with arXiv:2311.17982

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04485 2024-11-12 cs.AI cs.CV 70%

GenAI Arena: An Open Evaluation Platform for Generative Models

Dongfu Jiang, Max Ku, Tianle Li, Yuansheng Ni, Shizhuo Sun, Rongqi Fan, Wenhu Chen

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 9 pages,7 figures

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10816 2024-10-15 cs.CV cs.AI cs.LG 70%

LVD-2M: A Long-take Video Dataset with Temporally Dense Captions

Tianwei Xiong, Yuqing Wang, Daquan Zhou, Zhijie Lin, Jiashi Feng, Xihui Liu

专题命中 视频数据与评测 :video generation(abstract);long video(abstract);分类 cs.CV

Comments NeurIPS 2024 Dataset and Benchmark Track. Project page: https://silentview.github.io/LVD-2M/ . Code: https://github.com/SilentView/LVD-2M

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00634 2024-09-25 cs.CV cs.LG 70%

Tarsier: Recipes for Training and Evaluating Large Video Description Models

Jiawei Wang, Liping Yuan, Yuchen Zhang, Haomiao Sun

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11606 2023-10-13 cs.CV cs.CL 70%

StoryBench: A Multifaceted Benchmark for Continuous Story Visualization

Emanuele Bugliarello, Hernan Moraldo, Ruben Villegas, Mohammad Babaeizadeh, Mohammad Taghi Saffar, Han Zhang, Dumitru Erhan, Vittorio Ferrari, Pieter-Jan Kindermans, Paul Voigtlaender

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments NeurIPS D&B 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13952 2023-09-26 cs.CV cs.AI cs.CL cs.LG 70%

VidChapters-7M: Video Chapters at Scale

Antoine Yang, Arsha Nagrani, Ivan Laptev, Josef Sivic, Cordelia Schmid

专题命中 视频数据与评测 :video-language(abstract);long video(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2023 Track on Datasets and Benchmarks; Project Webpage: https://antoyang.github.io/vidchapters.html ; 31 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09126 2023-08-21 cs.CV cs.AI cs.CL 70%

EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding

Karttikeya Mangalam, Raiymbek Akshulakov, Jitendra Malik

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments https://egoschema.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14717 2023-03-28 cs.CV 70%

CelebV-Text: A Large-Scale Facial Text-Video Dataset

Jianhui Yu, Hao Zhu, Liming Jiang, Chen Change Loy, Weidong Cai, Wayne Wu

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR2023. Project Page: https://celebv-text.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03929 2022-10-11 cs.CV cs.AI cs.CL cs.LG 70%

EgoTaskQA: Understanding Human Tasks in Egocentric Videos

Baoxiong Jia, Ting Lei, Song-Chun Zhu, Siyuan Huang

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

Comments Published at NeurIPS Track on Datasets and Benchmarks 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14806 2021-05-03 cs.CV 70%

GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions

Chenfei Wu, Lun Huang, Qianxi Zhang, Binyang Li, Lei Ji, Fan Yang, Guillermo Sapiro, Nan Duan

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.10937 2020-07-22 cs.CV 70%

MovieNet: A Holistic Dataset for Movie Understanding

Qingqiu Huang, Yu Xiong, Anyi Rao, Jiaze Wang, Dahua Lin

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by ECCV2020 as spotlight presentation. Project page: http://movienet.site

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11341 2025-07-15 cs.MM cs.CL cs.CV cs.LG eess.IV 67%

MSVD-Indonesian: A Benchmark for Multimodal Video-Text Tasks in Indonesian

Willy Fitra Hendria

机构 * Independent Researcher(独立研究者)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM

Comments 10 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08259 2025-03-27 cs.HC 67%

VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation

Zhiqiang Yuan, Jiapei Zhang, Ying Deng, Yeshuang Zhu, Jie Zhou, Jinchao Zhang

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新 62%

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06926 2026-06-18 cs.CV cs.MM 新提交 62%

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

SVHighlights: 迈向极长体育视频精彩片段检测

Donggyu Lee, Youngbin Ki, Jeonghun Kang, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology(釜山国立科学研究院)

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

AI总结 针对现有方法无法处理超长视频精彩片段检测的问题,提出首个基准SVHighlights(包含320个平均时长2小时的体育视频)以及无训练的分段方法TF-SELECTOR,通过大语言模型融合多模态信息预测片段级显著性分数,在多个指标上超越现有基线。

Comments Accepted to KDD 2026 (Datasets and Benchmarks Track). Project Page: https://leedongkyu2019.github.io/SVHighlights/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00873 2026-06-16 cs.MM cs.AI cs.CV 版本更新 62%

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

BRITE:面向不可信场景的可靠可解释文本到视频评估基准

Advait Tilak, Jiwon Choi, Nazifa Mouli, Wei Le

机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 62%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 62%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16966 2026-03-19 cs.CV cs.AI cs.MM cs.SD eess.AS 62%

CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization

CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类

Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao

机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19236 2026-01-28 cs.CV cs.MM 62%

VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics

VC-Bench:开创视频连接基准的Dataset与评估指标

Zhiyu Yin, Zhipeng Liu, Kehai Chen, Lemao Liu, Jin Liu, Hong-Dong Li, Yang Xiang, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(计算机科学与技术学院,哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 VC-Bench提出一个用于视频连接任务的新型基准,包含多样化视频数据和综合评估指标,评估现有视频生成模型并揭示其在连贯性和流畅性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏