arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2504.15376 2025-09-01 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

Towards Understanding Camera Motions in Any Video

Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

Comments Project site: https://linzhiqiu.github.io/papers/camerabench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20368 2025-07-29 cs.CV cs.MM 62%

MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation

Shuolin Xu, Bingyuan Wang, Zeyu Cai, Fangteng Fu, Yue Ma, Tongyi Lee, Hongchuan Yu, Zeyu Wang

机构 * National Centre for Computer Animation, Bournemouth University(伯恩茅斯大学计算机动画国家中心) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学) Department of Computer Science and Information Engineering, National Cheng Kung University(国立成功大学计算机科学与信息工程系)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

Comments 8 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20124 2025-06-10 cs.CV cs.MM 62%

TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos

Fanheng Kong, Jingyuan Zhang, Hongzhi Zhang, Shi Feng, Daling Wang, Linhao Yu, Xingguang Ji, Yu Tian, Victoria W., Fuzheng Zhang

机构 * Northeastern University(东北大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACL 2025 Main. Project page: https://friedrichor.github.io/projects/TUNA

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03161 2025-05-30 cs.CV cs.CL cs.MM 62%

BioVL-QR: Egocentric Biochemical Vision-and-Language Dataset Using Micro QR Codes

Tomohiro Nishimoto, Taichi Nishimura, Koki Yamamoto, Keisuke Shirai, Hirotaka Kameko, Yuto Haneji, Tomoya Yoshida, Keiya Kajimura, Taiyu Cui, Chihiro Nishiwaki, Eriko Daikoku, Natsuko Okuda, Fumihito Ono, Shinsuke Mori

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments ICIP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11425 2025-05-19 cs.CV cs.MM 62%

Face Consistency Benchmark for GenAI Video

Michal Podstawski, Malgorzata Kudelska, Haohong Wang

机构 * TCL Research Europe(TCL欧洲研究中心) TCL Research America(TCL美国研究中心)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13281 2025-03-25 cs.CV cs.AI cs.CL cs.MM 62%

VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation

Ziyang Luo, Haoning Wu, Dongxu Li, Jing Ma, Mohan Kankanhalli, Junnan Li

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments CVPR 2025, Project Page: https://videoautoarena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18709 2025-03-04 cs.CV cs.LG cs.MM cs.SD eess.AS 62%

Audio-Visual Instance Segmentation

Ruohao Guo, Xianghua Ying, Yaru Chen, Dantong Niu, Guangyao Li, Liao Qu, Yanyu Qi, Jinxing Zhou, Bowei Xing, Wenzhen Yue, Ji Shi, Qixun Wang, Peiliang Zhang, Buwen Liang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20962 2024-12-18 cs.CV cs.MM cs.SD eess.AS 62%

MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions

Xiaowei Chi, Yatian Wang, Aosong Cheng, Pengjun Fang, Zeyue Tian, Yingqing He, Zhaoyang Liu, Xingqun Qi, Jiahao Pan, Rongyu Zhang, Mengfei Li, Ruibin Yuan, Yanbing Jiang, Wei Xue, Wenhan Luo, Qifeng Chen, Shanghang Zhang, Qifeng Liu, Yike Guo

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

Comments 15 Pages. Dataset report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13743 2024-11-05 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation

Baiqi Li, Zhiqiu Lin, Deepak Pathak, Jiayao Li, Yixin Fei, Kewen Wu, Tiffany Ling, Xide Xia, Pengchuan Zhang, Graham Neubig, Deva Ramanan

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

Comments We open-source our dataset, model, and code at: https://linzhiqiu.github.io/papers/genai_bench ; Project page: https://linzhiqiu.github.io/papers/genai_bench ; GenAI-Bench was first introduced in arxiv:2404.01291. This article extends it with an additional GenAI-Rank benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00741 2024-10-07 cs.CL cs.CV cs.MM 62%

VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models

Jiapeng Wang, Chengyu Wang, Kunzhe Huang, Jun Huang, Lianwen Jin

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments EMNLP 2024 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01669 2024-08-20 cs.CV cs.MM 62%

SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses

Chaolei Tan, Zihang Lin, Junfu Pu, Zhongang Qi, Wei-Yi Pei, Zhi Qu, Yexin Wang, Ying Shan, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM MM 2024. Project page: https://synopground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02272 2024-08-06 cs.CV cs.CL cs.MM 62%

COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark

Koki Maeda, Tosho Hirasawa, Atsushi Hashimoto, Jun Harashima, Leszek Rybicki, Yusuke Fukasawa, Yoshitaka Ushiku

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments ECCV2024 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15046 2024-07-23 cs.CV cs.CL cs.MM 62%

Audio-visual training for improved grounding in video-text LLMs

Shivprasad Sagare, Hemachandran S, Kinshuk Sarabhai, Prashant Ullegaddi, Rajeshkumar SA

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04928 2024-07-09 cs.CV eess.IV 62%

CLIPVQA:Video Quality Assessment via CLIP

Fengchuang Xing, Mingjie Li, Yuan-Gen Wang, Guopu Zhu, Xiaochun Cao

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01291 2024-06-19 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

Evaluating Text-to-Visual Generation with Image-to-Text Generation

Zhiqiu Lin, Deepak Pathak, Baiqi Li, Jiayao Li, Xide Xia, Graham Neubig, Pengchuan Zhang, Deva Ramanan

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

Comments We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14899 2024-03-25 cs.CV cs.AI cs.CL cs.MM 62%

FunQA: Towards Surprising Video Comprehension

Binzhu Xie, Sicheng Zhang, Zitang Zhou, Bo Li, Yuanhan Zhang, Jack Hessel, Jingkang Yang, Ziwei Liu

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV、cs.MM

Comments Project Page: https://funqa-benchmark.github.io/ Codebase: https://github.com/Jingkang50/FunQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06176 2023-09-13 cs.CV cs.MM 62%

Dual-Path Temporal Map Optimization for Make-up Temporal Video Grounding

Jiaxiu Li, Kun Li, Jia Li, Guoliang Chen, Dan Guo, Meng Wang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14657 2023-05-01 cs.CV cs.MM 62%

Knowledge Enhanced Model for Live Video Comment Generation

Jieting Chen, Junkai Ding, Wenping Chen, Qin Jin

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13887 2022-11-28 cs.AI cs.CL cs.CV cs.GR eess.IV 62%

TPA-Net: Generate A Dataset for Text to Physics-based Animation

Yuxing Qiu, Feng Gao, Minchen Li, Govind Thattai, Yin Yang, Chenfanfu Jiang

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08190 2022-08-18 cs.CV cs.LG eess.IV 62%

DeepSportradar-v1: Computer Vision Dataset for Sports Understanding with High Quality Annotations

Gabriel Van Zandycke, Vladimir Somers, Maxime Istasse, Carlo Del Don, Davide Zambrano

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14631 2022-01-25 cs.CV eess.IV 62%

Text2Video: Text-driven Talking-head Video Synthesis with Personalized Phoneme-Pose Dictionary

Sibo Zhang, Jiahong Yuan, Miao Liao, Liangjun Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、eess.IV

Comments ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.04884 2021-06-22 cs.CV cs.LG cs.MM cs.SD eess.AS 62%

Piano Skills Assessment

Paritosh Parmar, Jaiden Reddy, Brendan Morris

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Dataset is available from: https://github.com/ParitoshParmar/Piano-Skills-Assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09889 2021-06-21 cs.CL cs.CV cs.MM 62%

GEM: A General Evaluation Benchmark for Multimodal Tasks

Lin Su, Nan Duan, Edward Cui, Lei Ji, Chenfei Wu, Huaishao Luo, Yongfei Liu, Ming Zhong, Taroon Bharti, Arun Sacheti

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

Comments Accepted by Findings of ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.09411 2021-04-20 cs.CV cs.MM 62%

Understanding Chinese Video and Language via Contrastive Multimodal Pre-Training

Chenyi Lei, Shixian Luo, Yong Liu, Wanggui He, Jiamang Wang, Guoxin Wang, Haihong Tang, Chunyan Miao, Houqiang Li

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.10514 2021-01-27 cs.CV cs.MM 62%

How Good is a Video Summary? A New Benchmarking Dataset and Evaluation Framework Towards Realistic Video Summarization

Vishal Kaushal, Suraj Kothawade, Anshul Tomar, Rishabh Iyer, Ganesh Ramakrishnan

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments 19 pages, 6 tables, 4 figures. arXiv admin note: substantial text overlap with arXiv:2007.14560

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13202 2020-11-30 cs.CV cs.GR cs.LG eess.IV 62%

t-EVA: Time-Efficient t-SNE Video Annotation

Soroosh Poorgholi, Osman Semih Kayhan, Jan C. van Gemert

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、eess.IV

Comments ICPR 2020 (HCAU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.14560 2020-08-26 cs.CV cs.IR cs.LG cs.MM 62%

Realistic Video Summarization through VISIOCITY: A New Benchmark and Evaluation Framework

Vishal Kaushal, Suraj Kothawade, Rishabh Iyer, Ganesh Ramakrishnan

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments 19 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.09418 2020-05-15 cs.MM cs.CV 62%

Video Storytelling: Textual Summaries for Events

Junnan Li, Yongkang Wong, Qi Zhao, Mohan S. Kankanhalli

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Published in IEEE Transactions on Multimedia

Journal ref J. Li, Y. Wong, Q. Zhao and M. S. Kankanhalli, "Video Storytelling: Textual Summaries for Events," in IEEE Transactions on Multimedia, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.00623 2019-04-02 cs.AI cs.CV cs.LG cs.MM 62%

Constructing Hierarchical Q&A Datasets for Video Story Understanding

Yu-Jung Heo, Kyoung-Woon On, Seongho Choi, Jaeseo Lim, Jinah Kim, Jeh-Kwang Ryu, Byung-Chull Bae, Byoung-Tak Zhang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted to AAAI 2019 Spring Symposium Series : Story-Enabled Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.07607 2017-09-28 cs.MM cs.CL cs.CV 62%

Fine-Grain Annotation of Cricket Videos

Rahul Anand Sharma, Pramod Sankar K, CV Jawahar

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments ACPR 2015

详情

展开后加载摘要…

URL PDF HTML 收藏