arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-08 至 2026-05-08 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2604.04415 2026-05-08 cs.CL 78%

STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning

STEER: 通过多目标强化学习进行视频推理的结构事件证据

Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang, Mohammed Bennamoun, Farid Boussaid, Feng Zheng, Qiuhong Ke

机构 * University of Western Australia(西澳大学) CUHKSZ(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) SUSTech(南方科技大学) Monash University(墨尔本大学)

专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract)

AI总结 本文提出结构事件证据方法,通过多目标强化学习解决视频推理中事件结构缺失问题,提出STEER-60K数据集和P-FAB算法提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06192 2026-05-08 cs.CV cs.AI cs.RO 70%

EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields

EA-WM:事件感知生成世界模型与结构运动-视觉动作场

Zhaoyang Yang, Yurun Jin, Lizhe Qi, Cong Huang, Kai Chen

机构 * Fudan University(复旦大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) DeepCybo(深瞳)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 EA-WM通过结构化运动-视觉动作场闭环连接运动控制与视觉感知,提升机器人空间几何和细粒度交互动态的生成精度。

Comments Preprint. 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏