TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
TRACES: 通过轨迹状态建模实现多轮LLM智能体的主动安全审计
机构 * Brown University(布朗大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Rutgers University(罗格斯大学) ; Texas A&M University(德克萨斯阿姆斯特朗大学)
专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);分类 cs.CL、cs.LG
AI总结 提出TRACES方法,通过观察LLM的隐藏表示学习前缀级轨迹风险状态,实现多轮工具使用环境下的主动安全审计,提升全轨迹安全预测和主动风险判别能力。