arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

1906.12165 2019-07-01 cs.CV cs.IR 57%

Localizing Unseen Activities in Video via Image Query

Zhu Zhang, Zhou Zhao, Zhijie Lin, Jingkuan Song, Deng Cai

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IJCAI 2019 as a poster paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03544 2019-06-06 cs.CV 57%

A Structured Model For Action Detection

Yubo Zhang, Pavel Tokmakov, Martial Hebert, Cordelia Schmid

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10575 2019-06-04 cs.CV 57%

Stacked Spatio-Temporal Graph Convolutional Networks for Action Segmentation

Pallabi Ghosh, Yi Yao, Larry S. Davis, Ajay Divakaran

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.03460 2019-05-09 cs.CV 57%

DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition

Zheng Shou, Xudong Lin, Yannis Kalantidis, Laura Sevilla-Lara, Marcus Rohrbach, Shih-Fu Chang, Zhicheng Yan

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR'19

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04869 2019-04-09 cs.CV 57%

A Perceptual Prediction Framework for Self Supervised Event Segmentation

Sathyanarayanan N. Aakur, Sudeep Sarkar

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR 2019 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04527 2019-03-26 cs.CV 57%

SoccerNet: A Scalable Dataset for Action Spotting in Soccer Videos

Silvio Giancola, Mohieddine Amine, Tarek Dghaily, Bernard Ghanem

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR Workshop on Computer Vision in Sports 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10180 2018-11-28 cs.CV 57%

Bringing a Blurry Frame Alive at High Frame-Rate with an Event Camera

Liyuan Pan, Cedric Scheerlinck, Xin Yu, Richard Hartley, Miaomiao Liu, Yuchao Dai

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.10706 2018-07-30 cs.CV 57%

Diagnosing Error in Temporal Action Detectors

Humam Alwassel, Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00097 2018-05-09 cs.CV 57%

Budget-Aware Activity Detection with A Recurrent Policy Network

Behrooz Mahasseni, Xiaodong Yang, Pavlo Molchanov, Jan Kautz

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.01058 2017-09-15 cs.CV 57%

Skeleton-aided Articulated Motion Generation

Yichao Yan, Jingwei Xu, Bingbing Ni, Xiaokang Yang

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments ACM MM 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00558 2017-05-17 cs.CV 57%

Unsupervised Human Action Detection by Action Matching

Basura Fernando, Sareh Shirazi, Stephen Gould

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments IEEE International Conference on Computer Vision and Pattern Recognition CVPR 2017 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.01180 2017-05-04 cs.CV 57%

Cascaded Boundary Regression for Temporal Action Detection

Jiyang Gao, Zhenheng Yang, Ram Nevatia

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.02031 2016-06-08 cs.CV 57%

Hand Action Detection from Ego-centric Depth Sequences with Error-correcting Hough Transform

Chi Xu, Lakshmi Narasimhan Govindarajan, Li Cheng

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.02129 2016-04-25 cs.CV 57%

Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs

Zheng Shou, Dongang Wang, Shih-Fu Chang

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.04574 2016-04-18 cs.CV 57%

Learning Temporal Regularity in Video Sequences

Mahmudul Hasan, Jonghyun Choi, Jan Neumann, Amit K. Roy-Chowdhury, Larry S. Davis

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.09041 2015-12-31 cs.CV 57%

Actor-Action Semantic Segmentation with Grouping Process Models

Chenliang Xu, Jason J. Corso

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
1508.03755 2015-08-18 cs.CV 57%

Beat-Event Detection in Action Movie Franchises

Danila Potapov, Matthijs Douze, Jerome Revaud, Zaid Harchaoui, Cordelia Schmid

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.05769 2015-05-22 cs.CV 57%

Watch and Learn: Semi-Supervised Learning of Object Detectors from Videos

Ishan Misra, Abhinav Shrivastava, Martial Hebert

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments To appear in CVPR 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.6505 2015-05-07 cs.CV 57%

Pooled Motion Features for First-Person Videos

M. S. Ryoo, Brandon Rothrock, Larry Matthies

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1309.6390 2013-09-26 cs.CV 57%

Contextually learnt detection of unusual motion-based behaviour in crowded public spaces

Ognjen Arandjelović

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Journal ref Computer and Information Sciences II Computer and Information Sciences II, pp 403-410, 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
1010.3935 2010-10-20 cs.CV 57%

3-D Rigid Models from Partial Views - Global Factorization

Pedro M. Q. Aguiar, Rui F. C. Guerreiro, Bruno B. Gonçalves

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11521 2026-08-14 cs.RO cs.AI 版本更新 50%

Keep the Future, Drop the Rollout: RIFT for World Action Models

保留未来,放弃展开:面向世界动作模型的RIFT

Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文针对世界动作模型部署延迟问题,提出RIFT方法,通过学习的预期标记一次构建未来K/V缓存,在LIBERO、RoboTwin 2.0任务上实现高成功率且大幅降低动作块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 50%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 50%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 动作与事件理解 :video-language(abstract)

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 50%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 50%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06558 2026-07-14 cs.RO 版本更新 50%

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

RynnWorld-Teleop:用于数字遥操作的动作条件世界模型

Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 研究针对机器人学习数据收集瓶颈,提出数字遥操作范式,用生成世界模型解耦数据收集与物理约束。以RynnWorld-Teleop系统实现,含多种技术,能实时生成,训练策略可零样本转移,还能增强数据集,是高保真可扩展数据引擎。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-Teleop.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-Teleop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 50%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03964 2026-07-07 cs.RO cs.AI 新提交 50%

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 动作与事件理解 :video generation(abstract)

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31101 2026-07-01 cs.RO 新提交 50%

Efficient Sim-to-Real Transfer of World-Action Models from Synthetic Priors

基于合成先验的世界-动作模型的高效仿真到现实迁移

Zixing Wang, Kausik Sivakumar, Jinghuan Shang, Yafei Hu, Zhaoming Xie, Ran Gong, Xiaohan Zhang, Karl Schmeckpeper

机构 * Purdue University(普渡大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 本文研究从合成先验训练世界-动作模型并零样本部署到真实机器人操作,通过域随机化和AnyTask运动规划生成演示,首次成功实现仿真到现实的迁移。

Comments This work is accepted by CVPR'26, Embodied AI Workshop. This paper represent a part of early result of our official world-action model zero-shot sim-to-real transfer work, which will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏