ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs
ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突
机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。
Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026