arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-20 至 2026-04-20 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 2 篇

2604.15127 2026-04-20 cs.MM 57%

MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production

MCSC-Bench:多模态情境到脚本创建用于真实视频制作

Huanran Hu, Zihui Ren, Dingyi Yang, Liangyu Chen, Qixiang Gao, Tiezheng Ge, Qin Jin

专题命中 视频数据与评测 :video generation(abstract);分类 cs.MM

AI总结 本文提出MCSC任务,通过多模态输入和用户指令生成结构化视频脚本,并引入首个大规模MCSC数据集MCSC-Bench,包含11K+标注视频,支持全面评估材料选择、叙事规划和条件脚本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13091 2026-04-20 cs.CV 57%

Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence

视频推理:评估大语言模型如何提取、整合和重构时空证据

Seunghwan Bang, Hwanjun Song

机构 * UNIST(全南大学) KAIST(韩国科学技术院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。

Comments Project page: https://disl-lab.github.io/VAEX-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏