arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-27 至 2026-02-27 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2602.23279 2026-02-27 cs.CY 79%

Safety First: Psychological Safety as the Key to AI Transformation

安全优先:心理安全是人工智能转型的关键

Aaron Reich, Diana Wolfe, Matt Price, Alice Choe, Fergus Kidd, Hannah Wagner

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 研究发现心理安全是员工采用人工智能工具的关键因素,但不影响其使用频率和持续时间,强调需区分采用与持续使用,推动早期AI实施的针对性干预。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19680 2026-02-27 cs.HC cs.AI 70%

PolicyPad: Collaborative Prototyping of LLM Policies

PolicyPad: LLM策略协同原型设计

K. J. Kevin Feng, Tzu-Sheng Kuo, Quan Ze Chen, Inyoung Cheong, Kenneth Holstein, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 PolicyPad通过结合用户体验原型设计方法,为LLM策略协作设计提供交互式支持,提升政策制定的协作效率与反馈质量。

Comments CHI 2026 paper. Supplementary materials: https://docs.google.com/document/d/1jBmKXusoWmCHfwpmNhSTJtbwZ5fwVWLNppKeqqd_-pY/edit?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏