Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents
计划不会持久:为什么上下文管理对LLM代理至关重要
机构 * Snowflake AI Research(Snowflake AI研究)
AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。
Comments 17 pages, 8 figures
大厂专区
计划不会持久:为什么上下文管理对LLM代理至关重要
机构 * Snowflake AI Research(Snowflake AI研究)
AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。
Comments 17 pages, 8 figures
当智能体过早承诺:诊断LLM智能体中的过早承诺问题
机构 * Snowflake AI Research
AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。
Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL
自信且错误:编码智能体中的无声语义失败
机构 * Snowflake AI Research(Snowflake AI研究院)
AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。
Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI