arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 62 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 12 篇

2604.27917 2026-05-01 cs.LO math.LO 50%

A Logic of Inability

无法能力的逻辑

Shanxia Wang

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种扩展的联盟逻辑,引入明确的无法能力算子,用于研究能力的模态概念,证明了其正确性、完备性和保守性,并分析了其模态行为。

Comments Preliminary draft, comments and feedback are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27737 2026-05-01 physics.soc-ph 50%

Crowd Dynamics in Historical Perspective: Reframing the Amritsar Massacre through Agent-Based Modelling and Social Psychology

从历史视角看人群动态:通过基于代理建模和社会心理学重新审视阿姆利则大屠杀

Mohcine Chraibi, Krisztina Konya, Ezel Üsten

专题命中 其他安全 :safety(abstract)

AI总结 本文通过基于代理建模和社会心理学重新审视阿姆利则大屠杀,揭示人群作为现象的物理与社会心理动态,指出即使在保守的物理假设下,模拟结果仍高于官方死亡人数,强调跨学科建模对历史责任和当前人群安全的重要性。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏