Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV
Comments CVPR 2025
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV
Comments CVPR 2025
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
Comments CVPR 2025 camera ready. Project page: https://motion-prompting.github.io/
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2025. Project page: https://shaelynz.github.io/synergize-motion-appearance/
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
Comments Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024 Spolight)
专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV
Comments CVPR 2025. Project Page: https://mint-video.github.io/
专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV
Journal ref CVPR 2025
专题命中 动作与事件理解 :video understanding(title,abstract);分类 cs.CV
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
Comments Project Page: https://egovid.github.io/
专题命中 动作与事件理解 :video-language(title);video generation(abstract);分类 cs.CV
Comments Tech Report. Authors are listed in alphabetical order. Project page: https://gr2-manipulation.github.io
专题命中 动作与事件理解 :video-language(title);video understanding(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
Comments CVPR 2024
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
Comments AAAI 2023, 7 pages, 3 figures
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
Comments NeurIPS 2023 spotlight
专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV
专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV
Comments Accepted by Advances in Neural Information Processing Systems (NeurIPS), 2022 (Spotlight Presentation). Camera-Ready Version, 19 Pages
专题命中 动作与事件理解 :long video(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2022
专题命中 动作与事件理解 :long video(title,abstract);分类 cs.CV
Comments ACM International Conference on Multimedia 2020
专题命中 动作与事件理解 :video understanding(title,abstract);分类 cs.CV
Comments 12 pages, 12 figures
专题命中 动作与事件理解 :video-language(title,abstract)
Comments To appear in NeurIPS Workshop on Video-Language Models 2024
机构 * Kuaishou Technology(快手科技) ; Shandong University(山东省大学)
专题命中 动作与事件理解 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
STEER: 通过多目标强化学习进行视频推理的结构事件证据
机构 * University of Western Australia(西澳大学) ; CUHKSZ(香港科技大学) ; Tencent Youtu Lab(腾讯优图实验室) ; SUSTech(南方科技大学) ; Monash University(墨尔本大学)
专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract)
AI总结 本文提出结构事件证据方法,通过多目标强化学习解决视频推理中事件结构缺失问题,提出STEER-60K数据集和P-FAB算法提升推理效率与准确性。
MotionV2V: 视频中运动的编辑
机构 * Google(谷歌) ; Stony Brook University(石溪大学)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 MotionV2V通过直接编辑稀疏轨迹实现视频运动编辑,利用生成性主干提升视频编辑能力,在用户研究中表现优异。
VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力
机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)
专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。
专题命中 动作与事件理解 :video generation(title);分类 cs.CV、cs.MM
Comments Accepted in AAAI2024
专题命中 动作与事件理解 :video generation(title);分类 cs.CV、cs.MM
Comments 22 pages, 8 figures, CVPR 2024
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);text-to-video(abstract)
Comments Website: https://github.com/AgibotTech/EWMBench
OR-Action: 细粒度动作的多角色视频理解
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Carl Zeiss AG(卡尔蔡司股份公司)
专题命中 动作与事件理解 :video understanding(title);分类 cs.CV
AI总结 针对手术室活动理解中场景图方法缺乏时间建模的问题,提出基于公开数据集的细粒度多角色动作基准,并引入纯视觉时序模型,显著优于图方法,同时提出多视角到单视角特征对齐策略提升单视角性能。