arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2412.09645 2025-08-22 cs.CV cs.AI cs.CL 57%

Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models

Fan Zhang, Shulin Tian, Ziqi Huang, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Equal contributions from first three authors. Project page: https://vchitect.github.io/Evaluation-Agent-project Code: https://github.com/Vchitect/Evaluation-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10771 2025-08-15 cs.CV cs.AI 57%

AEGIS: Authenticity Evaluation Benchmark for AI-Generated Video Sequences

Jieyu Li, Xin Zhang, Joey Tianyi Zhou

机构 * National University of Singapore(新加坡国立大学) Agency for Science, Technology and Research(科技研究局)

专题命中 视频数据与评测 :video diffusion(abstract);分类 cs.CV

Comments Proceedings of the 33rd ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05527 2025-08-08 cs.CV 57%

AI vs. Human Moderators: A Comparative Evaluation of Multimodal LLMs in Content Moderation for Brand Safety

Adi Levi, Or Levi, Sardhendu Mishra, Jonathan Morra

机构 * Zefr Inc(Zefr公司)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to the Computer Vision in Advertising and Marketing (CVAM) workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09994 2025-08-08 cs.CV 57%

TIME: Temporal-Sensitive Multi-Dimensional Instruction Tuning and Robust Benchmarking for Video-LLMs

Yunxiao Wang, Meng Liu, Wenqi Liu, Xuemeng Song, Bin Wen, Fan Yang, Tingting Gao, Di Zhang, Guorui Zhou, Liqiang Nie

机构 * Shandong University(山东大学) Shandong Jianzhu University(山东建筑大学) City University of Hong Kong(香港城市大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03955 2025-08-07 cs.CV 57%

Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm

Lin Zhang, Zefan Cai, Yufan Zhou, Shentong Mo, Jinhong Lin, Cheng-En Wu, Yibing Wei, Yijing Zhang, Ruiyi Zhang, Wen Xiao, Tong Sun, Junjie Hu, Pedro Morgado

机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Luma AI Adobe Research(Adobe研究) Microsoft(微软)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03050 2025-08-06 cs.CV 57%

Multi-human Interactive Talking Dataset

Zeyu Zhu, Weijia Wu, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05787 2025-08-06 cs.CV 57%

EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs

Ivan Rodin, Tz-Ying Wu, Kyle Min, Sharath Nittur Sridhar, Antonino Furnari, Subarna Tripathi, Giovanni Maria Farinella

机构 * University of Catania(卡塔尼亚大学) Intel Labs(英特尔实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to SAUAFG Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20987 2025-07-30 cs.CV cs.AI 57%

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1

Xinhan Di, Kristin Qi, Pengqian Yu

机构 * Computer Science, University of Massachusetts Boston(马萨诸塞大学波士顿分校计算机科学系) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments WiCV @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09081 2025-07-30 cs.CV cs.AI cs.CL 57%

FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation

Zheqi He, Yesheng Liu, Jing-shu Zheng, Xuejing Li, Jin-Ge Yao, Bowen Qin, Richeng Xuan, Xi Yang

机构 * BAAI FlagEval Team(BAAI 评测团队)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Accepted by ACL 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02733 2025-07-30 cs.CV cs.AI 57%

LinkTo-Anime: A 2D Animation Optical Flow Dataset from 3D Model Rendering

Xiaoyi Feng, Kaifeng Zou, Caichun Cen, Tao Huang, Hui Guo, Zizhou Huang, Yingli Zhao, Mingqing Zhang, Ziyuan Zheng, Diwei Wang, Yuntao Zou, Dagang Li

机构 * Link-To, Shenzhen, China(深圳Link-To) Macau University of Science and Technology, Macau, China(澳门科学技术大学) The Chinese University of Hong Kong, HongKong, China(香港中文大学) Wuzhou University, Guangxi, China(梧州大学) Université de Strasbourg, France(斯特拉斯堡大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07327 2025-07-30 cs.IR cs.CV 57%

Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos

Haowen Gao, Liang Pang, Shicheng Xu, Leigang Qu, Tat-Seng Chua, Huawei Shen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 13 pages, Accepted at ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16878 2025-07-24 cs.CV cs.AI 57%

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos

Xuchen Li, Xuzhao Li, Shiyu Hu, Kaiqi Huang, Wentao Zhang

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16151 2025-07-23 cs.CV cs.AI 57%

SPACT18: Spiking Human Action Recognition Benchmark Dataset with Complementary RGB and Thermal Modalities

Yasser Ashraf, Ahmed Sharshar, Velibor Bojkovic, Bin Gu

机构 * Department of Machine Learning(机器学习系) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13684 2025-07-23 cs.CV 57%

FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models

Minghan Li, Chenxi Xie, Yichen Wu, Lei Zhang, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学) Broad Institute(博德研究所) Hong Kong Polytechnic University(香港理工大学) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) City University of Hong Kong(香港城市大学) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(自然与人工智能研究学院,哈佛大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments 24 pages, 14 figures, 16 tables

Journal ref ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00574 2025-07-15 cs.CV cs.LG 57%

VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling

Xinhao Li, Yi Wang, Jiashuo Yu, Xiangyu Zeng, Yuhan Zhu, Haian Huang, Jianfei Gao, Kunchang Li, Yinan He, Chenting Wang, Yu Qiao, Yali Wang, Limin Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06732 2025-07-10 cs.CV 57%

Hierarchical Feature Alignment for Gloss-Free Sign Language Translation

Sobhan Asasi, Mohamed Ilyes Lakhal, Richard Bowden

机构 * University of Surrey(塞弗里大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

Comments Accepted in SLTAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04976 2025-07-08 cs.CV cs.CL 57%

Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models

Eunseop Yoon, Hee Suk Yoon, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02316 2025-07-04 cs.CV 57%

Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos

Zecheng Zhao, Selena Song, Tong Chen, Zhi Chen, Shazia Sadiq, Yadan Luo

机构 * The University of Queensland(昆士兰大学) The University of Southern Queensland(南方昆士兰大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments 7 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01949 2025-07-03 cs.CV 57%

Kwai Keye-VL Technical Report

Kwai Keye Team, Biao Yang, Bin Wen, Changyi Liu, Chenglong Chu, Chengru Song, Chongling Rao, Chuan Yi, Da Li, Dunju Zang, Fan Yang, Guorui Zhou, Hao Peng, Haojie Ding, Jiaming Huang, Jiangxia Cao, Jiankang Chen, Jingyun Hua, Jin Ouyang, Kaibing Chen, Kaiyu Jiang, Kaiyu Tang, Kun Gai, Shengnan Zhang, Siyang Mao, Sui Huang, Tianke Zhang, Tingting Gao, Wei Chen, Wei Yuan, Xiangyu Wu, Xiao Hu, Xingyu Lu, Yang Zhou, Yi-Fan Zhang, Yiping Yang, Yulong Chen, Zhenhua Wu, Zhenyu Li, Zhixin Ling, Ziming Li, Dehua Ma, Di Xu, Haixuan Gao, Hang Li, Jiawei Guo, Jing Wang, Lejian Ren, Muhao Wei, Qianqian Wang, Qigen Hu, Shiyao Wang, Tao Yu, Xinchen Luo, Yan Li, Yiming Liang, Yuhang Hu, Zeyi Lu, Zhuoran Yang, Zixing Zhang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Technical Report: https://github.com/Kwai-Keye/Keye

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01938 2025-07-03 cs.CV 57%

CI-VID: A Coherent Interleaved Text-Video Dataset

Yiming Ju, Jijin Hu, Zhengxiong Luo, Haoge Deng, hanyu Zhao, Li Du, Chengwei Wu, Donglin Hao, Xinlong Wang, Tengfei Pan

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01255 2025-07-03 cs.CV 57%

AIGVE-MACS: Unified Multi-Aspect Commenting and Scoring Model for AI-Generated Video Evaluation

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(信息与媒体实验室,加州大学戴维斯分校)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20103 2025-06-26 cs.CV cs.AI 57%

BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos

Jiahao Lin, Weixuan Peng, Bojia Zi, Yifeng Gao, Xianbiao Qi, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) IntelliFusion Inc.(IntelliFusion公司)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 7 page,4 figures,2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16141 2025-06-23 cs.CV cs.AI cs.CL cs.LG 57%

GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Code released at: https://github.com/TencentARC/GRPO-CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14827 2025-06-19 cs.CV cs.AI 57%

DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning

Yifeng Gao, Yifan Ding, Hongyu Su, Juncheng Li, Yunhan Zhao, Lin Luo, Zixing Chen, Li Wang, Xin Wang, Yixu Wang, Xingjun Ma, Yu-Gang Jiang

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07603 2025-06-17 cs.CV cs.AI 57%

SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis

Jianhui Wei, Zikai Xiao, Danyu Sun, Luqi Gong, Zongxin Yang, Zuozhu Liu, Jian Wu

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Harvard University(哈佛大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02357 2025-06-17 cs.CV 57%

Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content

Zicheng Zhang, Tengchuan Kou, Shushi Wang, Chunyi Li, Wei Sun, Wei Wang, Xiaoyu Li, Zongyu Wang, Xuezhi Cao, Xiongkuo Min, Xiaohong Liu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments CVPR 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06733 2025-06-12 cs.CV 57%

RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation

Ruoxuan Zhang, Jidong Gao, Bin Wen, Hongxia Xie, Chenming Zhang, Hong-Han Shuai, Wen-Huang Cheng

机构 * Jilin University(吉林大学) Guangdong University of Technology(广东工业大学) National Chiao Tung University(交通大学) National Taiwan University(国立台湾大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments This is an extended version of arXiv:2503.05228

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18223 2025-06-05 cs.CV cs.IR q-bio.NC q-bio.QM 57%

MammAlps: A multi-view video behavior monitoring dataset of wild mammals in the Swiss Alps

Valentin Gabeff, Haozhe Qi, Brendan Flaherty, Gencer Sumbül, Alexander Mathis, Devis Tuia

机构 * EPFL(苏黎世联邦理工学院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025; Benchmark and code at: https://github.com/eceo-epfl/MammAlps. After submission of v1, we noticed that a few audio files were not correctly aligned with the corresponding video. We fixed the issue, which had little to no impact on performance. We also now report results for three runs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10691 2025-06-05 cs.CV 57%

Reasoning is All You Need for Video Generalization: A Counterfactual Benchmark with Sub-question Evaluation

Qiji Zhou, Yifan Gong, Guangsheng Bao, Hongjie Qiu, Jinqiang Li, Xiangrong Zhu, Huajian Zhang, Yue Zhang

机构 * School of Engineering, Westlake University(西拉丘学院,西湖大学) College of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments It has been accepted to the ACL-2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03635 2025-05-28 cs.AI cs.CL cs.CV cs.LG stat.ML 57%

CLEVRER-Humans: Describing Physical and Causal Events the Human Way

Jiayuan Mao, Xuelin Yang, Xikun Zhang, Noah D. Goodman, Jiajun Wu

机构 * MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments Version 3. NeurIPS 2022 (Dataset and Benchmark Track). First two authors contributed equally. Project page: https://sites.google.com/stanford.edu/clevrer-humans/home

详情

展开后加载摘要…

URL PDF HTML 收藏