arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-15 至 2026-07-15 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 3 篇

2607.13017 2026-07-15 cs.RO cs.CV 新提交 57%

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

FlowWAM:光流作为世界动作模型的统一动作表示

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(无) MBZUAI(无) Alibaba Group(阿里巴巴集团)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 研究针对世界动作模型控制中动作表示难题,提出FlowWAM双流扩散框架,以光流为统一动作表示。该框架可实现WAMs两种模式,能利用无动作标签视频预训练,实验表明在操纵和世界建模任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 57%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01117 2026-07-15 cs.CV 版本更新 57%

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

MoHallBench: 视频大语言模型中运动幻觉的基准测试

Sihan Chen, Jiale Li, Jianghang Lin, Mengyuan Liu

机构 * Xiamen University(厦门大学) South China University of Technology(华南理工大学) Peking University(北京大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出MoHallBench基准,系统评估视频大语言模型中的运动幻觉,涵盖共现先验、顺序推理和相似混淆三类来源,揭示动作识别与幻觉抵抗的解耦现象。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏