arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-07 至 2026-04-07 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 5 篇

2512.09299 2026-04-07 cs.CV cs.SD 79%

VABench: A Comprehensive Benchmark for Audio-Video Generation

VABench:音频视频生成的综合性基准

Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence (Peking University)(北京市数据智能重点实验室(北京大学)) Ant Group(蚂蚁集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出VABench,一个用于评估同步音频视频生成能力的综合性基准,涵盖三种任务类型和15个评估维度,旨在建立新的评估标准以推动视频生成领域的发展。

Comments 24 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04634 2026-04-07 cs.CV cs.AI 57%

Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale

保留伪造痕迹:在原生尺度上进行AI生成视频检测

Zhengcen Li, Chenyang Jiang, Hang Zhao, Shiyang Zhou, Yunyang Mo, Feng Gao, Fan Yang, Qiben Shan, Shaocong Wu, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出在原生尺度上进行AI生成视频检测的新方法,通过构建大规模数据集和新型框架,有效保留高频率伪影和时空不一致特征,提升检测性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04419 2026-04-07 cs.CV 57%

BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing

BoxComm:基于 boxing 的类别感知评论生成与叙述节奏基准测试

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Yiming Shi, Chenyi Guo, Ji Wu

机构 * Tsinghua University(清华大学) Beijing Sport University(北京体育大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出 BoxComm 数据集,包含 445 场世界拳击锦标赛视频及 52000 多条专业评论,通过分类注解和两项新评估方法,解决拳击评论生成中的节奏与类别准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04402 2026-04-07 cs.CV 57%

UENR-600K: A Large-Scale Physically Grounded Dataset for Nighttime Video Deraining

UENR-600K:一个大规模的物理基础数据集用于夜间视频去雨

Pei Yang, Hai Ci, Beibei Lin, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出UENR-600K数据集,通过Unreal Engine模拟真实夜间雨景,解决传统小规模数据无法捕捉物理特性的问题,提升模型在真实夜间雨场景下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03819 2026-04-07 cs.CV 57%

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

活动取证:一种全面的基准,用于定位视频中的篡改活动

Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) Jiangxi Provincial Key Laboratory of Multimedia Intelligent Processing(江西省多媒体智能处理重点实验室) Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程系) VinUniversity

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出ActivityForensics基准,用于定位视频中被篡改的活动。该基准包含6000多个无缝融合的篡改视频片段,并引入了Temporal Artifact Diffuser方法,评估了多种最先进的伪造定位器。

Comments [CVPR 2026] The first benchmark for action-level deepfake localization

详情

展开后加载摘要…

URL PDF HTML 收藏