OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining
专题命中 视频数据与评测 :video-language(title);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频数据与评测 :video-language(title);分类 cs.CV
专题命中 视频数据与评测 :video generation(title);分类 cs.CV
Comments CVPR2024 NTIRE Workshop
专题命中 视频数据与评测 :video-language(title);分类 cs.CV
Comments 3 pages, 1 figure, 2 tables. Technical report
VideoSTF: 视频大语言模型中输出重复性压力测试
机构 * National University of Singapore(新加坡国立大学) ; University of New South Wales(新南威尔士大学) ; CSIRO’s Data61(CSIRO数据61)
专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM
AI总结 VideoSTF通过系统测量和压力测试揭示视频大语言模型中普遍存在的输出重复问题,发现其对时间扰动高度敏感,并暴露了其作为安全漏洞的风险。
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Ho Chi Minh University of Science(胡志明市科学大学) ; Deakin University(德肯大学)
专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV、cs.MM
Comments Published at ACMMM2025 (Dataset track)
HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准
专题命中 视频数据与评测 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。
Comments 18 pages, 8 figures
PhyCheck:面向视频大语言模型的物理规律理解细粒度证据驱动数据集
机构 * Zhejiang University(浙江大学) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙江大学杭州国际科技创新中心) ; Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 本文提出PhyCheck数据集,通过粗粒度、细粒度及诊断子集提升视频大语言模型的物理规律理解,实验证实其训练效果,同时指出当前模型难以整合因果条件的问题。
Comments 15pages, 4 figures, 4 tables
HuM-Eval: 一种以人为中心的视频评估框架
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出HuM-Eval框架,通过粗到细策略评估生成视频中的人体运动质量,实验显示其在人体相关性上达到58.2%的平均值,优于现有方法。
Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)
SceneScribe-1M:一个具有全面几何和语义标注的大规模视频数据集
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东部技术研究院,宁波) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江工业智能与数字孪生重点实验室)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 SceneScribe-1M通过提供一个包含一百万真实视频的数据集,支持3D几何感知与视频合成的统一资源,推动了单目深度估计、场景重建等下游任务及文本到视频合成等生成任务的发展。
Comments Accepted by CVPR 2026
长时自体视频中的空间条件推理
机构 * Clemson University(克莱姆森大学)
专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。
在回答前观看:从视觉引导的后训练中学习
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Etude AI ; Kolors Team, Kuaishou Technology(快手科技Kolors团队) ; University of Toronto(多伦多大学) ; University of Waterloo(滑铁卢大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。
VQQA:视频评估与质量提升的代理方法
机构 * Google(谷歌)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。
UniVBench:迈向统一评估视频基础模型
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动) ; Zhejiang Lab(浙江实验室)
专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。
TimeBlind: 一种用于视频大语言模型的时空组合性基准
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Pittsburgh(匹兹堡大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。
Comments For code and data, see https://baiqi-li.github.io/timeblind_project/
T2VEval: 用于T2V生成视频的基准数据集和客观评估方法
机构 * School of Information and Communication Engineering, Communication University of China, No.1 East Street, Dingfuzhuang, Chaoyang District, Beijing, China(信息与通信工程学院,中国传媒大学) ; Beijing Academy of Artificial Intelligence, No.150 Chengfu Road, Haidian District, Beijing, China(北京人工智能研究院)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 T2VEval提出了一种多分支融合方案,通过多维评估指标对T2V生成视频进行客观质量评估,提升视频生成模型的优化效果。
Comments This paper has been accepted by DISPLAYS
MomentSeeker: 一个面向任务的长视频时刻检索基准
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 MomentSeeker提出一个面向任务的长视频时刻检索基准,通过多样化的视频和查询形式,评估长视频中关键时刻检索的准确性和效率挑战。
AI生成的驾驶视频是否准备好用于自动驾驶?一种诊断评估框架
机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出了一种诊断评估框架,系统研究AI生成驾驶视频在自动驾驶训练和评估中的可靠性,通过分析失败模式和构建基准测试,验证了过滤AIGVs可提升性能并补充现实数据。
PAI-Bench: 一个全面的物理AI基准
机构 * Georgia Tech(佐治亚理工学院) ; CMU(卡内基梅隆大学)
专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。
ViMix-14M:一个经过精心整理的多源视频-文本数据集,具有长形式、高质量的描述和无爬虫访问
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 ViMix-14M是一个经过精心整理的多源视频-文本数据集,提供无爬虫访问、高质量描述和长形式文本,用于提升视频生成和多模态任务的性能。
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学)
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
机构 * KAUST(卡塔尔科技大学) ; Monash University(墨尔本大学) ; RICE University(里士满大学)
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
Comments Accepted for oral presentation at the EMNLP 2025 main conference
机构 * The University of Hong Kong(香港大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Lingnan University(岭大)
专题命中 视频数据与评测 :video generation(abstract);video diffusion(abstract);分类 cs.CV
Comments ICCV 2025
机构 * Princeton University(普林斯顿大学)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Waterloo(滑铁卢大学) ; Independent(独立) ; M-A-P ; University of Toronto(多伦多大学) ; Zhejiang University(浙江大学) ; Abaka AI
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV
Comments 20 pages,6 figures,survey
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Technologies(华为技术)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments Accepted by ACMMM 2025
机构 * Nanjing University(南京大学)
专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV
Comments 21 pages, 11 figures
机构 * KDDI Research, Inc.(KDDI研究公司)
专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
机构 * University of Science and Technology Beijing(北京科技大学) ; Tencent(腾讯) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments submitting