arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-31 至 2026-03-31 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 5 篇

2511.07732 2026-03-31 cs.RO cs.AI cs.CL cs.CV cs.LG 57%

ViPRA: Video Prediction for Robot Actions

ViPRA:用于机器人动作的视频预测

Sandeep Routray, Hengkai Pan, Unnat Jain, Shikhar Bahl, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Skild AI University of California, Irvine(加州大学尔湾分校)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 ViPRA通过预训练和微调框架,从无标注视频中学习连续机器人控制,利用视频语言模型预测视觉观察和运动中心潜在动作,支持跨机器人形态的泛化和高频率连续控制。

Comments In ICLR 2026. Website: https://vipra-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV 57%

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27449 2026-03-31 cs.CV 57%

LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model

LOME:基于动作条件的视点世界模型学习人类-物体操控

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, Yue Wang

机构 * University of Southern California(南加州大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 LOME通过结合空间人类动作与环境上下文,生成逼真的人-物交互视频,提升动作跟随精度与泛化能力,实现物理效果如液体倒出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV 57%

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

专题命中 动作与事件理解 :video reasoning(abstract);分类 cs.CV

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22578 2026-03-31 cs.RO 50%

EgoDemoGen: Egocentric Demonstration Generation for Viewpoint Generalization in Robotic Manipulation

EgoDemoGen:用于机器人操作中视角泛化的眼动演示生成

Yuan Xu, Jiabing Yang, Xiaofeng Wang, Yixiang Chen, Zheng Zhu, Bowen Fang, Guan Huang, Xinze Chen, Yun Ye, Qiang Zhang, Peiyan Li, Xiangnan Wu, Kai Wang, Bing Zhan, Shuo Lu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) GigaAI Tsinghua University(清华大学) X-Humanoid FiveAges

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出EgoDemoGen框架,通过EgoTrajTransfer和EgoViewTransfer生成新型眼动视角下的观察-动作演示,提升机器人操作在视角变化下的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏