Ask Now, Use Later: Benchmarking the Proactivity Gap in Long-Lived LLM Agents
现在询问,以后使用:评估长期 LLM 代理中的主动性差距
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Noumena AI
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL
AI总结 针对长期 LLM 代理在跨会话中未能主动获取用户偏好而导致的主动性差距,提出 Ask-to-Remember (ATR) 基准 ATRBench,通过隐藏用户偏好作为真实值来量化该差距,并诊断出获取环节是瓶颈。