arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2509.13854 2026-03-27 cs.CY cs.AI 81%

Understanding the Process of Human-AI Value Alignment

理解人机价值对齐的过程

Jack McKinlay, Marina De Vos, Janina A. Hoffmann, Andreas Theodorou

机构 * University of Bath(巴斯大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过系统文献综述,探讨人工智能中价值对齐的核心方法与挑战,提出更精确的定义,识别六个关键主题以指导未来研究。

Comments 39 pages, 7 figures

Journal ref JAIR, Vol 85, Article 29 (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25379 2026-03-27 cs.AI cs.HC 57%

Does Structured Intent Representation Generalize? A Cross-Language, Cross-Model Empirical Study of 5W3H Prompting

结构化意图表示是否具有泛化性?一项跨语言、跨模型的5W3H提示经验研究

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过跨语言和跨模型的实验,探讨结构化意图表示的泛化能力,发现AI辅助写作工具生成的5W3H提示在目标对齐上与手动创建的提示无显著差异,且能减少跨模型输出方差。

Comments 28 pages, figures, tables, and appendix. Follow-up empirical study extending prior work on PPS and 5W3H structured prompting to cross-language, cross-model, and AI-assisted authoring settings

详情

展开后加载摘要…

URL PDF HTML 收藏