AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent
AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导
机构 * University of Georgia(佐治亚大学) ; University of South Florida(南佛罗里达大学) ; Rutgers University(罗格斯大学) ; University of Southern California(南加州大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。