A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models
多模态大语言模型时代的动态场景图生成研究
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
多模态大语言模型时代的动态场景图生成研究
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。