Localizing Moments in Video with Temporal Language
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
Comments EMNLP 2018
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
Comments EMNLP 2018
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
Comments In CVPR 2018. Ranked first in ICCV 2017 PoseTrack challenge (keypoint tracking in videos). Code: https://github.com/facebookresearch/DetectAndTrack and webpage: https://rohitgirdhar.github.io/DetectAndTrack/
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
Comments To appear in CVPR 2018. Check dataset page https://research.google.com/ava/ for details
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
Comments Youtube-8M Challenge, 4th place
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV
Comments 10 pages
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV
专题命中 视频数据与评测 :long video(abstract);分类 cs.CV
Comments CVPR 2016
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.MM
Comments Published in a Local Confrence, 2006
开放评估智能体:视觉生成模型的高效且可提示的评估
机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) ; Agency for Science, Technology and Research (A*STAR)(科学、技术与研究局(A*STAR)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频数据与评测 :video generation(abstract)
AI总结 该研究提出Evaluation Agent框架及基于其构建的Open-EA,可高效评估视觉生成模型,将评估时间减至传统方法的10%,还通过EA-CoT-10K和EA-3B减少对专有骨干的依赖,验证了其在多基准及跨家族的有效性。
Comments Journal extension of our ACL 2025 paper (arXiv:2412.09645). 12 pages. Code: https://github.com/Vchitect/Evaluation-Agent
首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准
专题命中 视频数据与评测 :video generation(abstract)
AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。
SurgWMBench:面向世界建模的手术器械运动规划视觉基准
机构 * University of Macau(澳门大学) ; National University of Singapore(新加坡国立大学) ; Xiamen University(厦门大学)
专题命中 视频数据与评测 :video understanding(abstract)
AI总结 本文提出SurgWMBench,一种面向短程手术运动规划的视觉基准,可评估手术世界模型的器械运动预测与连续回推稳定性,解决现有指标与器械规划需求不匹配的问题。
Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载
机构 * Beijing Institute of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 视频数据与评测 :video reasoning(abstract)
AI总结 Med-CRAFT通过知识图谱遍历自动构建可解释的多跳视频工作负载,生成具有细粒度时间选择性和多跳逻辑复杂性的医疗视频推理基准。
Comments 23 pages, 4 figures, 10 tables
PiL-World: 用于VLA策略环内评估的块式世界模型
机构 * Tongji University(同济大学) ; AIRC, Midea Group(美的集团人工智能研究院)
专题命中 视频数据与评测 :video generation(abstract)
AI总结 提出PiL-World,一种块式世界模型,通过交替VLA推理和世界模型预测实现闭环评估,无需真实机器人执行,显著降低成功率估计误差。
PRISM:一个程序化空间-时间推理的基准测试
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 视频数据与评测 :video generation(abstract)
AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。
OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进
机构 * NJU-LINK Team(南京大学链接团队)
专题命中 视频数据与评测 :video understanding(abstract)
AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。
OptMerge: 通过模型融合统一多模态大语言模型的能力与模态
机构 * Tsinghua University(清华大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频数据与评测 :video-language(abstract)
AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%
一致性三元组作为一般世界模型的定义原则
专题命中 视频数据与评测 :video generation(abstract)
AI总结 本文提出一致性三元组作为定义通用世界模型的原则,通过系统回顾多模态学习的演变,引入CoW-Bench基准测试,明确未来发展方向。
Comments 119 pages, 50 figures
SurgPub-Video: 一个全面的外科视频数据集,用于增强视觉-语言模型中的外科智能
专题命中 视频数据与评测 :video understanding(abstract)
AI总结 SurgPub-Video数据集和SurgLLaVA-Video模型通过提供高质量外科视频数据和专门的视觉-语言模型,提升了手术场景分析的智能水平。
Journal ref AAAI-2026
可扩展的策略评估与视频世界模型
机构 * Nvidia Research(Nvidia 研究院) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 视频数据与评测 :video generation(abstract)
AI总结 本文提出利用动作条件视频生成模型进行可扩展的策略评估,通过预训练模型利用互联网视频数据,减少现实世界测试需求,提升机器人策略评估效率。
机构 * Stanford University(斯坦福大学) ; NYU(纽约大学) ; Google DeepMind(谷歌DeepMind)
专题命中 视频数据与评测 :video generation(abstract)
Comments https://world-model-eval.github.io
机构 * MBZUAI ; University of Houston(德克萨斯大学休斯顿分校) ; McGill University(麦吉尔大学) ; University of Michigan(密歇根大学)
专题命中 视频数据与评测 :long video(abstract)
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; Alibaba Group(阿里巴巴集团)
专题命中 视频数据与评测 :video understanding(abstract)
机构 * UMass Amherst ; University of Maryland, College Park(美国马里兰大学学院公园分校)
专题命中 视频数据与评测 :video understanding(abstract)
Comments 16 pages
专题命中 视频数据与评测 :video understanding(abstract)
专题命中 视频数据与评测 :video understanding(abstract)
专题命中 视频数据与评测 :video understanding(abstract)
Comments 19 pages, 14 figures
专题命中 视频数据与评测 :video understanding(abstract)