SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces
SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。