M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions
M$^3$Exam: 面向真实用户-智能体交互的多模态记忆基准
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Beijing University of Chemical Technology(北京化工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海)) ; Tencent Hy(腾讯(深圳)) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
AI总结 提出M$^3$Exam基准,用于评估多模态大语言模型在真实用户-智能体交互中的跨模态推理和隐式信息推断能力,并设计M$^3$Proctor方法通过按需处理视觉源提升准确率13%,同时降低索引构建时间和检索token超70%。