Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
迈向多模态终身理解:一个数据集和代理基准
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
迈向多模态终身理解:一个数据集和代理基准
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。
OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进
机构 * NJU-LINK Team(南京大学链接团队)
专题命中 视频数据与评测 :video understanding(abstract)
AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。