HourVideo: 1-Hour Video-Language Understanding
专题命中 视频数据与评测 :video-language(title,abstract);long video(abstract);分类 cs.CV
Comments NeurIPS 2024 Datasets and Benchmarks Track; 28 pages
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频数据与评测 :video-language(title,abstract);long video(abstract);分类 cs.CV
Comments NeurIPS 2024 Datasets and Benchmarks Track; 28 pages
专题命中 视频数据与评测 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
Comments NeurIPS D&B 2024 (Spotlight)
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
Comments 29 pages
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
Comments Technical report
专题命中 视频数据与评测 :video-language(title,abstract);video language model(abstract);分类 cs.CV
Comments Preprint. 48 pages, 22 figures, 10 tables
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
Comments Working in progress
VNU-Bench:多源多模态新闻视频理解的基准数据集
机构 * University of Florida(佛罗里达大学)
专题命中 视频数据与评测 :video understanding(title,abstract);video reasoning(abstract)
AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。
专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);text-to-video(abstract);video-language(abstract)
Comments Data and Code: https://github.com/OpenGVLab/InternVideo/tree/main/Data/InternVid
GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集
专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。
MSVBench: 向多镜头视频生成的人机水平评估迈进
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Alibaba International Digital Commerce(阿里巴巴国际数字商业)
专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 MSVBench通过引入分层脚本和参考图像,提出混合评估框架,验证了视频生成模型的连贯性和吸引力,并展示了其在多镜头视频生成中的有效性。
一个非常大的视频推理套件
机构 * University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学) ; University of Tübingen(图宾根大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Michigan(密歇根大学) ; University of Southern California(南加州大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Cornell University(康奈尔大学) ; San Jose State University(圣何塞州立大学) ; University of California, Irvine(加州大学尔湾分校) ; Technical University of Munich(慕尼黑技术大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Imperial College London(伦敦帝国学院) ; University of Wisconsin--Madison(威斯康星大学麦迪逊分校) ; University of Edinburgh(爱丁堡大学) ; Hong Kong University of Science(香港科学大学) ; New York University(纽约大学) ; Auburn University(阿伯丁大学) ; Columbia University(哥伦比亚大学) ; University of Bristol(布里斯托大学) ; University of Waterloo(滑铁卢大学) ; The Chinese University of Hong Kong(香港中文大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV、cs.MM
AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。
Comments Homepage: https://video-reason.com/
机构 * Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学)
专题命中 视频数据与评测 :video understanding(title);long video(abstract);分类 cs.CV、cs.MM
Comments Submitted to ARR Rolling Review
专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV、cs.MM
Comments Accepted in NeurIPS 2024 Datasets and Benchmarks Track
专题命中 视频数据与评测 :long video(title);video understanding(abstract);分类 cs.CV、cs.MM
Comments Project page with all the artifacts - https://ruchitrawal.github.io/cinepile/. Updated version with adversarial refinement pipeline and more model evaluations
专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV、cs.MM
Comments Accepted at ACM Multimedia Asia 2021
专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV、eess.IV
专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV
Comments Accepted as Classification Challenge Track paper in CVPR 2017 Workshop on YouTube-8M Large-Scale Video Understanding
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
机构 * Beijing Jiaotong University(北京交通大学) ; HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) ; MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV
AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。
Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables
LVSum:一个用于时间感知长视频摘要的基准测试
机构 * Apple(苹果公司)
专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV
AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。
Comments 25 pages, 5 tables, 3 figures
CycliST:用于循环状态转换推理的视频语言模型基准
机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学) ; Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA)) ; Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国) ; Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学) ; Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI)) ; Center for Cognitive Science(认知科学中心) ; German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))
专题命中 视频数据与评测 :video language model(title,abstract);分类 cs.CV
AI总结 提出CycliST基准,通过合成视频评估视频语言模型对循环状态转换的文本推理能力,揭示现有模型在检测循环模式、时间理解和定量分析方面的局限。
Comments Published in the Journal of Data-centric Machine Learning Research (DMLR); https://openreview.net/forum?id=l03g53HUL2
Journal ref Journal of Data-centric Machine Learning Research, 2026
自然语言在小时级视频中的时间定位是一个搜索问题:基准与经验分解
机构 * NAVER Cloud AI ; KAIST AI(韩国科学技术院人工智能系)
专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV
AI总结 针对小时级视频的自然语言时间定位,提出搜索是主要瓶颈而非识别,发布首个开放小时级定位基准ExtremeWhenBench,并通过检索-定位混合方法显著提升性能。
Comments 10 pages, 6 figures, Code and benchmark: https://github.com/naver-ai/ExtremeWhenBench
AgentCVR:通过脚本模拟强化学习的主动多智能体跨视频推理
机构 * Xiaohongshu Inc.(小红书公司) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)
专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV
AI总结 提出AgentCVR多智能体框架,将跨视频推理视为主动证据获取任务,通过主智能体协调视觉和音频智能体进行定向证据提取,并引入脚本模拟强化学习优化策略,在跨视频对齐和定位任务上超越单次基线,达到与闭源系统相当的性能。
Video-MME-v2:迈向综合视频理解基准的下一阶段
专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV
AI总结 Video-MME-v2通过三级层次结构和非线性评估策略,评估视频理解的鲁棒性和准确性,揭示当前模型与人类专家间的差距及多模态推理瓶颈。
Comments Homepage: https://video-mme-v2.netlify.app/
VABench:音频视频生成的综合性基准
机构 * Peking University(北京大学) ; Zhongguancun Academy(中关村学院) ; Beijing Key Laboratory of Data Intelligence (Peking University)(北京市数据智能重点实验室(北京大学)) ; Ant Group(蚂蚁集团) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出VABench,一个用于评估同步音频视频生成能力的综合性基准,涵盖三种任务类型和15个评估维度,旨在建立新的评估标准以推动视频生成领域的发展。
Comments 24 pages, 25 figures
Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) ; Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。
SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性
专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。
Comments 16 pages, 9 figures
LongVidSearch: 一种多跳证据检索规划的代理基准
专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV
AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。
Comments 12 pages, 2 figures, appendix included
CircuitProbe: 跟踪视频语言模型中的视觉时间证据流
专题命中 视频数据与评测 :video language model(title);video-language(abstract);分类 cs.CV
AI总结 研究提出CircuitProbe框架,通过视觉审计和语义追踪分析视频语言模型中的时间证据流,设计针对性干预提升时间理解性能。
APPO:基于注意力的视频推理感知策略优化
机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院) ; AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG人工智能技术中心)
专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV
AI总结 APPO通过基于注意力的感知策略优化,利用token级奖励提升视频推理中的细粒度感知能力,有效提高模型性能。