arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2505.19125 2025-05-27 cs.CV 57%

RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models

Yuqi Liu, Qin Jin, Tianyuan Qu, Xuan Liu, Yang Du, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) HKUST(香港理工大学) RUC(中国人民大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14391 2025-05-23 cs.CV 57%

How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?

Rahul Thapa, Andrew Li, Qingyang Wu, Bryan He, Yuki Sahashi, Christina Binder, Angela Zhang, Ben Athiwaratkun, Shuaiwen Leon Song, David Ouyang, James Zou

机构 * Stanford University(斯坦福大学) Together AI University of California, Berkeley(加州大学伯克利分校) Cedars-Sinai Medical Center(西德斯-西奈医学中心) University of California, San Francisco(加州大学旧金山分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15145 2025-05-22 cs.CV 57%

CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation

Xinran Wang, Songyu Xu, Xiangxuan Shan, Yuxuan Zhang, Muxi Diao, Xueyan Duan, Yanhua Huang, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Mobile Research Institute(中国移动研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14231 2025-05-21 cs.CV 57%

UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning

Sule Bai, Mingxing Li, Yong Liu, Jing Tang, Haoji Zhang, Lei Sun, Xiangxiang Chu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AMAP, Alibaba Group(阿里云研究院)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15270 2025-05-20 cs.CV 57%

FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning

Shiyu Hu, Xuchen Li, Xuzhao Li, Jing Zhang, Yipei Wang, Xin Zhao, Kang Hao Cheong

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11838 2025-05-20 cs.CV 57%

RVTBench: A Benchmark for Visual Reasoning Tasks

Yiqing Shen, Chenjia Li, Chenxiao Fan, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21435 2025-05-14 cs.CV cs.AI cs.CL 57%

SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding

Chenkai Zhang, Yiming Lei, Zeming Liu, Haitao Leng, Shaoguo Liu, Tingting Gao, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Hangzhou Innovation Institute, Beihang University(杭州创新研究院) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 29 pages, 15 figures, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03829 2025-05-08 cs.CV cs.AI 57%

VideoLLM Benchmarks and Evaluation: A Survey

Yogesh Kumar

机构 * Indian Institute of Technology Jodhpur(印度理工学院朱达普尔)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 12 pages, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21334 2025-05-01 cs.CV 57%

Simple Visual Artifact Detection in Sora-Generated Videos

Misora Sugiyama, Hirokatsu Kataoka

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17132 2025-04-29 cs.CV 57%

Latent Video Dataset Distillation

Ning Li, Antai Andy Liu, Jingran Zhang, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments https://openreview.net/forum?id=i665TIHv92

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08260 2025-04-29 cs.CV cs.AI 57%

Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content

Qiuheng Wang, Yukai Shi, Jiarong Ou, Rui Chen, Ke Lin, Jiahao Wang, Boyuan Jiang, Haotian Yang, Mingwu Zheng, Xin Tao, Fei Yang, Pengfei Wan, Di Zhang

机构 * Shenzhen University(深圳大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Accepted by CVPR2025. Project page: https://koala36m.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17343 2025-04-25 cs.CV 57%

TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos

Linli Yao, Yicheng Li, Yuancheng Wei, Lei Li, Shuhuai Ren, Yuanxin Liu, Kun Ouyang, Lean Wang, Shicheng Li, Sida Li, Lingpeng Kong, Qi Liu, Yuanxing Zhang, Xu Sun

机构 * Peking University(北京大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15415 2025-04-23 cs.CV cs.CL 57%

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang, Xiaojie Jin

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14429 2025-04-22 cs.CV cs.AI 57%

ResNetVLLM-2: Addressing ResNetVLLM's Multi-Modal Hallucinations

Ahmad Khalil, Mahmoud Khalil, Alioune Ngom

机构 * University of Windsor(温莎大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06163 2025-04-22 cs.AI cs.CV stat.AP 57%

VACT: A Video Automatic Causal Testing System and a Benchmark

Haotong Yang, Qingyuan Zheng, Yunjian Gao, Yongkun Yang, Yangbo He, Zhouchen Lin, Muhan Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments A preliminary version of this paper has been accepted by workshop SCSL@ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10358 2025-04-15 cs.CV cs.AI 57%

FingER: Content Aware Fine-grained Evaluation with Reasoning for AI-Generated Videos

Rui Chen, Lei Sun, Jing Tang, Geng Li, Xiangxiang Chu

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08212 2025-04-14 cs.CV 57%

RealCam-Vid: High-resolution Video Dataset with Dynamic Scenes and Metric-scale Camera Movements

Guangcong Zheng, Teng Li, Xianpan Zhou, Xi Li

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07956 2025-04-11 cs.CV cs.AI cs.CL 57%

VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning

Yukun Qi, Yiming Zhao, Yu Zeng, Xikun Bao, Wenxuan Huang, Lin Chen, Zehui Chen, Jie Zhao, Zhongang Qi, Feng Zhao

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07745 2025-04-11 cs.CV cs.AI 57%

SF2T: Self-supervised Fragment Finetuning of Video-LLMs for Fine-Grained Understanding

Yangliu Hu, Zikai Song, Na Feng, Yawei Luo, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03051 2025-04-10 cs.CV 57%

AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark

Wenhao Chai, Enxin Song, Yilun Du, Chenlin Meng, Vashisht Madhavan, Omer Bar-Tal, Jenq-Neng Hwang, Saining Xie, Christopher D. Manning

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://rese1f.github.io/aurora-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22952 2025-04-01 cs.CV 57%

OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts

Yuxuan Wang, Yueqian Wang, Bo Chen, Tong Wu, Dongyan Zhao, Zilong Zheng

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments To appear at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00599 2025-03-26 cs.CV cs.AI cs.LG 57%

VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM

Yuqian Yuan, Hang Zhang, Wentong Li, Zesen Cheng, Boqiang Zhang, Long Li, Xin Li, Deli Zhao, Wenqiao Zhang, Yueting Zhuang, Jianke Zhu, Lidong Bing

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 17 pages, 14 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14935 2025-03-20 cs.CV cs.AI 57%

FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding

Chongjun Tu, Lin Zhang, Pengtao Chen, Peng Ye, Xianfang Zeng, Wei Cheng, Gang Yu, Tao Chen

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments FAVOR-Bench project page: https://favor-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14064 2025-03-19 cs.CV 57%

AIGVE-Tool: AI-Generated Video Evaluation Toolkit with Multifaceted Benchmark

Xinhao Xiang, Xiao Liu, Zizhong Li, Zhuosheng Liu, Jiawei Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12769 2025-03-18 cs.CV 57%

ViSpeak: Visual Instruction Feedback in Streaming Videos

Shenghao Fu, Qize Yang, Yuan-Ming Li, Yi-Xing Peng, Kun-Yu Lin, Xihan Wei, Jian-Fang Hu, Xiaohua Xie, Wei-Shi Zheng

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14468 2025-03-18 cs.AI cs.CV cs.HC 57%

K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human Preferences

Zhikai Li, Xuewen Liu, Dongrong Joe Fu, Jianquan Li, Qingyi Gu, Kurt Keutzer, Zhen Dong

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://huggingface.co/spaces/ksort/K-Sort-Arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06171 2025-03-17 cs.CV 57%

Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity

Huaxin Zhang, Xiaohao Xu, Xiang Wang, Jialong Zuo, Xiaonan Huang, Changxin Gao, Shanjun Zhang, Li Yu, Nong Sang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12448 2025-02-21 cs.CV 57%

Infrared Small Target Detection in Satellite Videos: A New Dataset and A Novel Recurrent Feature Refinement Framework

Xinyi Ying, Li Liu, Zaipin Lin, Yangsi Shi, Yingqian Wang, Ruojing Li, Xu Cao, Boyang Li, Shilin Zhou, Wei An

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10300 2025-02-06 cs.CV 57%

Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos

Mingfei Han, Linjie Yang, Xiaojun Chang, Lina Yao, Heng Wang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025. Extended annotation with 43K multi-shot videos in total. https://mingfei.info/shot2story for updates and more information

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09668 2025-01-22 cs.CV 57%

EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models

Yupeng Chen, Penglin Chen, Xiaoyu Zhang, Yixian Huang, Qian Xie

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏