arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-01 至 2026-04-01 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 3 篇

2603.29186 2026-04-01 cs.CV cs.AI 88%

SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation

SLVMEval: 合成元评估基准用于文本到长视频生成

Ryosuke Matsuda, Keito Kudo, Haruto Yoshida, Nobuyuki Shimizu, Jun Suzuki

机构 * Tohoku University(东北大学) LY Corporation

专题命中 视频数据与评测 :long video(title,abstract);video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SLVMEval基准,用于元评估文本到视频系统,通过合成降质视频对评估系统在长视频质量评估中的可靠性,实验显示人类评估准确率高于现有系统。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05513 2026-04-01 cs.CV 79%

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06561 2026-04-01 cs.CV 57%

EgoReasoner: Learning Egocentric 4D Reasoning via Task-Adaptive Structured Thinking

EgoReasoner:通过任务自适应结构化思维学习视角4D推理

Fangrui Zhu, Yunfeng Xi, Jianmo Ni, Mu Cai, Boqing Gong, Long Zhao, Chen Qu, Ian Miao, Yi Li, Cheng Zhong, Huaizu Jiang, Shwetak Patel

机构 * Northeastern University(东北大学) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出EgoReasoner框架,通过任务自适应结构化思维解决视角4D推理任务,提升空间锚定、时间跟踪和持续推理能力,模型在HD-EPIC基准上取得37.5%准确率。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏