The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping
低频陷阱:视频语言模型在简单事件记录上的失败
专题命中 动作与事件理解 :video language model(title)
AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
低频陷阱:视频语言模型在简单事件记录上的失败
专题命中 动作与事件理解 :video language model(title)
AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。
MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) ; The University of Adelaide(阿德莱德大学) ; Wuhan University(武汉大学) ; Southeast University(东南大学) ; Beijing Jiaotong University(北京交通大学) ; Fudan University(复旦大学) ; Li Auto(理想汽车) ; School of Information, Renmin University of China(中国人民大学信息学院)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。