MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 视频理解 :video understanding(abstract);分类 cs.MM
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 视频理解 :video understanding(abstract);分类 cs.MM
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
代理世界建模:基础、能力、定律及更远
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Chinese University of Hong Kong(香港中文大学) ; University of Hong Kong(香港大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院) ; XGEN Labs(XGEN实验室)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。
Flash-GRPO:通过单步策略优化实现视频扩散的高效对齐
机构 * Zhejiang University(浙江大学) ; Joy Future Academy(京东探索研究院) ; Independent Researcher(独立研究员) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出Flash-GRPO单步训练框架,通过等时分组和时间梯度校正解决计算瓶颈,在低计算预算下实现优于全轨迹训练的对齐质量和训练效率。
Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模
机构 * Northwestern University(西北大学) ; Dolby Laboratories(杜比实验室)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。
长视频全模态推理基准
机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; American University of Beirut(贝鲁特美国大学) ; Linköping University(利尔贝里大学)
专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。