arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-30 至 2026-07-30 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 1 篇

2607.26228 2026-07-30 cs.CL 新提交 57%

Steering Instruction Hierarchies at Inference Time

推理时的指令层级调控

Siqi Zeng, Sewoong Lee, Han Zhao, Julia Hockenmaier

专题命中 提示注入 :safety(abstract);分类 cs.CL

AI总结 针对前沿大语言模型常违反指令层级的问题,提出无需训练的V-Steer方法,通过编辑缓存值向量调控指令层级,提升角色冲突基准准确率,性能优于仅提示基线,部分场景达到SoTA训练方法水平。

Comments Published as a conference paper at COLM '26; the first two authors contributed equally to the work. 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏