AI Value Alignment for Evolving Social Norms
用于不断演变的社会规范的人工智能价值对齐
专题命中 安全训练 :alignment(title,abstract);分类 cs.CY
AI总结 研究人工智能价值对齐对社会规范演变的影响,引入基于社会物理学的数学建模框架,通过解析与模拟分析长期后果,强调价值锁定等风险,倡导用此模型作认知桥梁助力社会技术预见及大规模智能体评估。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
用于不断演变的社会规范的人工智能价值对齐
专题命中 安全训练 :alignment(title,abstract);分类 cs.CY
AI总结 研究人工智能价值对齐对社会规范演变的影响,引入基于社会物理学的数学建模框架,通过解析与模拟分析长期后果,强调价值锁定等风险,倡导用此模型作认知桥梁助力社会技术预见及大规模智能体评估。
通过对比信念更新来衡量奖励寻求行为
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。
Comments 101 pages, 66 figures
评估两用生物学环境中的校准拒绝和安全有用性
机构 * American Wetware(美国湿科公司) ; LatchBio
专题命中 安全训练 :alignment(title);分类 cs.AI
AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。
用于自我改进系统的可证伪发布门限
机构 * AI Architect(人工智能架构师)
专题命中 安全训练 :safety(abstract,comments);分类 cs.AI
AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。
Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source
用于弹性关键基础设施的去中心化多智能体强化学习
机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院) ; School of Energy Systems, LUT University(卢特大学能源系统学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 研究用于弹性关键基础设施的去中心化多智能体强化学习,基于对其特性与基础设施要求的分析,指出信用分配和通信是实际可行的核心条件,提出包含结构、因果、弹性感知信用分配及相关通信等的研究议程,为弹性关键基础设施构建有条件的基础。
Comments Accepted at the 2026 IEEE International Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2026)
Fence:用于大语言模型应用的专用小型语言模型护栏
机构 * JPMorgan(摩根大通)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。
Guard Vector:通过任务向量合成和流感知前缀监督微调超越英语大语言模型护栏
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 研究提出Guard Vector安全任务向量,通过与目标语言模型合成及流感知方法调整得到TGM,能提升分类质量、实现语言扩展和模型可移植性,前缀SFT保持流环境下分类质量,单令牌输出设计提高效率,有助于构建更负责的AI生态系统。