arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 473 篇

1909.03877 2019-09-10 cs.CV 57%

Gaussian Temporal Awareness Networks for Action Localization

Fuchen Long, Ting Yao, Zhaofan Qiu, Xinmei Tian, Jiebo Luo, Tao Mei

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2019 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.08861 2019-09-04 cs.GR cs.CV cs.LG stat.ML 57%

Animating Arbitrary Objects via Deep Motion Transfer

Aliaksandr Siarohin, Stéphane Lathuilière, Sergey Tulyakov, Elisa Ricci, Nicu Sebe

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments CVPR-2019 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.04013 2019-08-13 cs.CV 57%

Multi-Frame Content Integration with a Spatio-Temporal Attention Mechanism for Person Video Motion Transfer

Kun Cheng, Hao-Zhi Huang, Chun Yuan, Lingyiqing Zhou, Wei Liu

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.03477 2019-08-12 cs.CV 57%

Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings

Michael Wray, Diane Larlus, Gabriela Csurka, Dima Damen

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted for presentation at ICCV. Project Page: https://mwray.github.io/FGAR

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.03327 2019-08-01 cs.CV 57%

HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips

Antoine Miech, Dimitri Zhukov, Jean-Baptiste Alayrac, Makarand Tapaswi, Ivan Laptev, Josef Sivic

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted at ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.12165 2019-07-01 cs.CV cs.IR 57%

Localizing Unseen Activities in Video via Image Query

Zhu Zhang, Zhou Zhao, Zhijie Lin, Jingkuan Song, Deng Cai

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IJCAI 2019 as a poster paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03544 2019-06-06 cs.CV 57%

A Structured Model For Action Detection

Yubo Zhang, Pavel Tokmakov, Martial Hebert, Cordelia Schmid

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10575 2019-06-04 cs.CV 57%

Stacked Spatio-Temporal Graph Convolutional Networks for Action Segmentation

Pallabi Ghosh, Yi Yao, Larry S. Davis, Ajay Divakaran

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.03460 2019-05-09 cs.CV 57%

DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition

Zheng Shou, Xudong Lin, Yannis Kalantidis, Laura Sevilla-Lara, Marcus Rohrbach, Shih-Fu Chang, Zhicheng Yan

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR'19

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04869 2019-04-09 cs.CV 57%

A Perceptual Prediction Framework for Self Supervised Event Segmentation

Sathyanarayanan N. Aakur, Sudeep Sarkar

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR 2019 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04527 2019-03-26 cs.CV 57%

SoccerNet: A Scalable Dataset for Action Spotting in Soccer Videos

Silvio Giancola, Mohieddine Amine, Tarek Dghaily, Bernard Ghanem

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR Workshop on Computer Vision in Sports 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10180 2018-11-28 cs.CV 57%

Bringing a Blurry Frame Alive at High Frame-Rate with an Event Camera

Liyuan Pan, Cedric Scheerlinck, Xin Yu, Richard Hartley, Miaomiao Liu, Yuchao Dai

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.10706 2018-07-30 cs.CV 57%

Diagnosing Error in Temporal Action Detectors

Humam Alwassel, Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00097 2018-05-09 cs.CV 57%

Budget-Aware Activity Detection with A Recurrent Policy Network

Behrooz Mahasseni, Xiaodong Yang, Pavlo Molchanov, Jan Kautz

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.01058 2017-09-15 cs.CV 57%

Skeleton-aided Articulated Motion Generation

Yichao Yan, Jingwei Xu, Bingbing Ni, Xiaokang Yang

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments ACM MM 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00558 2017-05-17 cs.CV 57%

Unsupervised Human Action Detection by Action Matching

Basura Fernando, Sareh Shirazi, Stephen Gould

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments IEEE International Conference on Computer Vision and Pattern Recognition CVPR 2017 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.01180 2017-05-04 cs.CV 57%

Cascaded Boundary Regression for Temporal Action Detection

Jiyang Gao, Zhenheng Yang, Ram Nevatia

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.02031 2016-06-08 cs.CV 57%

Hand Action Detection from Ego-centric Depth Sequences with Error-correcting Hough Transform

Chi Xu, Lakshmi Narasimhan Govindarajan, Li Cheng

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.02129 2016-04-25 cs.CV 57%

Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs

Zheng Shou, Dongang Wang, Shih-Fu Chang

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.04574 2016-04-18 cs.CV 57%

Learning Temporal Regularity in Video Sequences

Mahmudul Hasan, Jonghyun Choi, Jan Neumann, Amit K. Roy-Chowdhury, Larry S. Davis

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.09041 2015-12-31 cs.CV 57%

Actor-Action Semantic Segmentation with Grouping Process Models

Chenliang Xu, Jason J. Corso

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
1508.03755 2015-08-18 cs.CV 57%

Beat-Event Detection in Action Movie Franchises

Danila Potapov, Matthijs Douze, Jerome Revaud, Zaid Harchaoui, Cordelia Schmid

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.05769 2015-05-22 cs.CV 57%

Watch and Learn: Semi-Supervised Learning of Object Detectors from Videos

Ishan Misra, Abhinav Shrivastava, Martial Hebert

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments To appear in CVPR 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.6505 2015-05-07 cs.CV 57%

Pooled Motion Features for First-Person Videos

M. S. Ryoo, Brandon Rothrock, Larry Matthies

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1309.6390 2013-09-26 cs.CV 57%

Contextually learnt detection of unusual motion-based behaviour in crowded public spaces

Ognjen Arandjelović

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Journal ref Computer and Information Sciences II Computer and Information Sciences II, pp 403-410, 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
1010.3935 2010-10-20 cs.CV 57%

3-D Rigid Models from Partial Views - Global Factorization

Pedro M. Q. Aguiar, Rui F. C. Guerreiro, Bruno B. Gonçalves

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11521 2026-08-14 cs.RO cs.AI 版本更新 50%

Keep the Future, Drop the Rollout: RIFT for World Action Models

保留未来,放弃展开:面向世界动作模型的RIFT

Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文针对世界动作模型部署延迟问题,提出RIFT方法,通过学习的预期标记一次构建未来K/V缓存,在LIBERO、RoboTwin 2.0任务上实现高成功率且大幅降低动作块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 50%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 50%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 动作与事件理解 :video-language(abstract)

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 50%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏