arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-11 至 2026-08-11 共收录 34 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 6 篇

2608.09666 2026-08-11 cs.AI 新提交 50%

Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

开放评估智能体:视觉生成模型的高效且可提示的评估

Shulin Tian, Ziqi Huang, Fan Zhang, Hongyuan Zhu, Yu Qiao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Agency for Science, Technology and Research (A*STAR)(科学、技术与研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频数据与评测 :video generation(abstract)

AI总结 该研究提出Evaluation Agent框架及基于其构建的Open-EA,可高效评估视觉生成模型,将评估时间减至传统方法的10%,还通过EA-CoT-10K和EA-3B减少对专有骨干的依赖,验证了其在多基准及跨家族的有效性。

Comments Journal extension of our ACL 2025 paper (arXiv:2412.09645). 12 pages. Code: https://github.com/Vchitect/Evaluation-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08852 2026-08-11 cs.AI cs.CY cs.HC cs.MA 新提交 50%

Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents

首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准

Yi-Cheng Lin, Yu-Kai Guo, Szu-Chi Chen, Bo-Han Feng, Yun-Man Hsu, Hsiang Hsieh, Yu-Jung Lin, Yue-Ling Wu, Jia-Kai Dong, An-Yu Cheng, Yu-Han Huang, Lok-Lam Ieong, Kuan-Yu Chen, Ming-Douo Tchouang, Shao-Hua Sun, Che Lin, Jian-Jiun Ding, Hung-yi Lee

专题命中 视频数据与评测 :video generation(abstract)

AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08070 2026-08-11 cs.RO 新提交 50%

SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning

SurgWMBench:面向世界建模的手术器械运动规划视觉基准

Huanrong Liu, Weiliang Huang, Bob Zhang, Weichao Cai, Chunlin Tian, Qingbiao Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 视频数据与评测 :video understanding(abstract)

AI总结 本文提出SurgWMBench,一种面向短程手术运动规划的视觉基准,可评估手术世界模型的器械运动预测与连续回推稳定性,解决现有指标与器械规划需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01045 2026-08-11 cs.AI 版本更新 50%

Med-CRAFT: An Information System for Explainable and Configurable Construction of Multimodal Medical QA Datasets

Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载

Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频数据与评测 :video reasoning(abstract)

AI总结 Med-CRAFT通过知识图谱遍历自动构建可解释的多跳视频工作负载,生成具有细粒度时间选择性和多跳逻辑复杂性的医疗视频推理基准。

Comments 23 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏