arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Edinburgh(爱丁堡大学)

2026-04-13 至 2026-04-13 共收录 2
2601.23045 2026-04-13 cs.AI

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

AI的混乱:模型智能与任务复杂性如何影响对齐问题

Alexander Hägele, Aryo Pradipta Gema, Henry Sleight, Ethan Perez, Jascha Sohl-Dickstein

机构 * Anthropic Fellows Program(Anthropic 研究员计划) EPFL(瑞士联邦理工学院洛桑) University of Edinburgh(爱丁堡大学) Constellation Anthropic

AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。

Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09075 2026-04-13 cs.CL

Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency

层级对齐:通过逻辑一致性在LLM中强制执行层级指令遵循

Shu Yang, Zihao Zhou, Di Wang, Wenda Li

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学)

AI总结 本文提出NSHA方法,通过显式建模和执行指令优先级,解决LLM在多指令环境下保持一致性与安全性的挑战,提升任务性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏