Sports Intelligence: Assessing the Sports Understanding Capabilities of Language Models through Question Answering from Text to Video
专题命中 视频问答 :video language model(abstract)
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频问答 :video language model(abstract)
专题命中 视频问答 :video understanding(abstract)
事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架
机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) ; Tianjin University(天津大学) ; Institute of Computing and Intelligence(计算与智能研究所) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) ; Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) ; School of Future Technology(未来技术学院) ; Shanghai University(上海大学)
专题命中 动作与事件理解 :video reasoning(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。
一种多智能体感知-行动联盟用于高效长视频推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Systems(思科系统)
专题命中 动作与事件理解 :video reasoning(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。
Comments Accepted by CVPR2026
专题命中 动作与事件理解 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://mvideo-v1.github.io/
SAW:通过可控且可扩展的视频生成实现手术动作世界模型
机构 * Johns Hopkins University(约翰霍普金斯大学) ; NVIDIA
专题命中 动作与事件理解 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV
AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。
Comments The manuscript is under review
专题命中 动作与事件理解 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments NeurIPS 2022 Datasets and Benchmarks Track. This projects webpage is located at https://bit.ly/3CNOly4
Journal ref Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks (2022)
Motion-o:基于轨迹的视频推理
机构 * Northeastern University(东北大学)
专题命中 动作与事件理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 Motion-o通过引入运动链推理,使视频推理模型能够显式且可验证地表示物体运动轨迹,提升动态和轨迹依赖性推理的可监督性。
PhyVLLM:具有运动-外观解耦的物理引导视频语言模型
机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)
专题命中 动作与事件理解 :video language model(title);video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。
机构 * Shanghai Jiao Tong University(上海交通大学) ; Monash University(墨尔本大学) ; Zhongguancun Academy(中关村academy) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract);long video(abstract);分类 cs.CV
Comments Accepted by IEEE TPAMI (IEEE Transactions on Pattern Analysis and Machine Intelligence). arXiv admin note: substantial text overlap with arXiv:2409.17647
专题命中 动作与事件理解 :video reasoning(title,abstract);long video(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2024 as a spotlight paper
专题命中 动作与事件理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
超越视觉思维链:用于主动视频推理的内化视觉思维
机构 * Apple(苹果公司)
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV、cs.MM
AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。
机构 * Tsinghua University(清华大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) ; Artificial Intelligence Innovation and Incubation (Al’) Institute of Fudan University(复旦大学人工智能创新与孵化院) ; University of Chinese Academy of Sciences(中国科学院大学) ; PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; Shenzhen University and Carleton University(深圳大学和卡尔顿大学)
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV、cs.MM
Comments Accepted by TPAMI. Github Repo: https://github.com/Winn1y/Awesome-Human-Motion-Video-Generation IEEE Access: https://ieeexplore.ieee.org/document/11106267
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2025
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments ACCV 2024 Oral
SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架
机构 * Zhejiang University(浙江大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV
AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。
Comments ACMMM 2026
GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Great Bay University(大湾区大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)
专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract);分类 cs.CV
AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。
Comments Accepted to ACM MM 2026
面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 动作与事件理解 :text-to-video(title,abstract);分类 cs.CV
AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。
无需训练的视频推理
机构 * Qualcomm AI Research(高通AI研究) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV
AI总结 提出V-Reason方法,利用输出分布熵作为信号,通过轻量级控制器在推理时自适应调整值缓存,无需强化学习或微调即可提升视频推理性能。
Comments CVPR Findings 2026. Project Page https://deepaksridhar.github.io/vreason.github.io/
SLAP: 用于变分视频-语言建模的语义最小作用原理
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学)
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。
Comments Accepted by ICML 2026
GraphThinker: 通过事件图思维强化时间感知的视频推理
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Samsung AI Centre Cambridge(剑桥三星人工智能中心) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV
AI总结 本文提出GraphThinker,通过构建结构化事件表示并强化视觉 grounding,减少视频推理中的时间幻觉。在RexTime和VidHalluc数据集上取得显著提升。
Comments Under review
MMGT:基于运动遮罩的两阶段网络用于语音手势视频生成
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出MMGT网络,通过结合音频、运动遮罩和姿态视频生成同步语音手势视频,解决单一音频控制导致的大动作缺失问题,提升视频质量与细节控制。
Comments Accepted by IEEE TCSVT
运动强制:一种解耦框架,用于运动动态中的鲁棒视频生成
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
AI总结 运动强制通过解耦物理推理与视觉合成,提升复杂场景下视频生成的鲁棒性和物理一致性。
FC-VFI: 用于高帧率慢动作视频生成的忠实且一致的视频帧插值
机构 * Zhejiang University Chinese University of Hong Kong(浙江大学香港中文大学)
专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 FC-VFI通过引入时间建模策略和语义匹配线,实现了高帧率慢动作视频生成中的忠实且一致的帧插值。
Comments ICASSP2026
从跟踪中获取结构:从自回归视频跟踪模型中蒸馏保持结构的运动用于视频生成
机构 * HKUST(香港科技大学) ; University of Washington(华盛顿大学) ; Georgia Tech(佐治亚理工学院) ; Adobe(Adobe公司)
专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 通过蒸馏自回归视频跟踪模型中的结构保持运动先验,SAM2VideoX在视频生成任务中实现了更高的保真度和一致性。
Comments Project Website: https://sam2videox.github.io/
专题命中 动作与事件理解 :video language model(title,abstract);分类 cs.CV
Comments Accepted to AAAI 2026
机构 * University of Manchester(曼彻斯特大学) ; University of York(约克大学) ; University of California, Irvine(加州大学 Irvine 分校)
专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV
机构 * University of Rochester(罗切斯特大学) ; University of California Irvine(加州大学尔湾分校) ; Imperial College(帝国理工学院)
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
Comments Accepted to ACM MM 2025. Project Page: https://andypinxinliu.github.io/Contextual-Gesture/
机构 * Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系) ; Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系) ; Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) ; Intel Corporation(英特尔公司)
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
Comments 14 pages in the main text, 22 pages including references and supplementary materials. 3 figures and 3 tables in the main text, 6 figures and 3 tables in supplementary materials
Journal ref Transactions on Machine Learning Research (TMLR) (02/2025)
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV