Localizing Unseen Activities in Video via Image Query
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted by IJCAI 2019 as a poster paper
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted by IJCAI 2019 as a poster paper
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted by CVPR'19
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments CVPR 2019 Camera Ready
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments CVPR Workshop on Computer Vision in Sports 2018
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
Comments 14 pages, 11 figures
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted to ECCV 2018
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
Comments ACM MM 2017
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments IEEE International Conference on Computer Vision and Pattern Recognition CVPR 2017 Workshops
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments CVPR 2016
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Technical report
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments To appear in CVPR 2015
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Journal ref Computer and Information Sciences II Computer and Information Sciences II, pp 403-410, 2012
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments 21 pages, 16 figures
保留未来,放弃展开:面向世界动作模型的RIFT
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文针对世界动作模型部署延迟问题,提出RIFT方法,通过学习的预期标记一次构建未来K/V缓存,在LIBERO、RoboTwin 2.0任务上实现高成功率且大幅降低动作块延迟。
无视觉前瞻:面向世界动作模型的潜在未来
机构 * Shanghai Jiao Tong University(上海交通大学) ; ACE Robotics(ACE机器人公司) ; Nanyang Technological University(南洋理工大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。
Comments 12 pages, 3 figures
TOPReward: 令牌概率作为机器人学中的隐式零样本奖励
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究所) ; Amazon(亚马逊) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 动作与事件理解 :video-language(abstract)
AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。
AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型
机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) ; School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。
MotuBrain: 一种先进的世界动作模型用于机器人控制
机构 * MotuBrain Team(MotuBrain团队)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。
RynnWorld-Teleop:用于数字遥操作的动作条件世界模型
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; CUHK(香港中文大学) ; Hupan Lab(湖畔实验室) ; Alibaba Group(阿里巴巴集团) ; Ant Group(蚂蚁集团)
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 研究针对机器人学习数据收集瓶颈,提出数字遥操作范式,用生成世界模型解耦数据收集与物理约束。以RynnWorld-Teleop系统实现,含多种技术,能实时生成,训练策略可零样本转移,还能增强数据集,是高保真可扩展数据引擎。
Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-Teleop.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-Teleop
InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动
机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。
Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/
Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型
机构 * Tsinghua University(清华大学) ; Manifold AI
专题命中 动作与事件理解 :video generation(abstract)
AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。
Comments 36 pages
基于合成先验的世界-动作模型的高效仿真到现实迁移
机构 * Purdue University(普渡大学) ; Robotics and AI Institute(机器人与人工智能研究所)
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 本文研究从合成先验训练世界-动作模型并零样本部署到真实机器人操作,通过域随机化和AnyTask运动规划生成演示,首次成功实现仿真到现实的迁移。
Comments This work is accepted by CVPR'26, Embodied AI Workshop. This paper represent a part of early result of our official world-action model zero-shot sim-to-real transfer work, which will be released soon