Language-Specific Gaps in AI Safety Training Datasets
AI安全训练数据集中的语言特定缺口
专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CY、cs.LG
AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
AI安全训练数据集中的语言特定缺口
专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CY、cs.LG
AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。
Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。
条件 regime 验证:安全分类器适配与监控的正确性估计
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。
Comments 16 pages including technical appendix, 6 figures
通过安全表示理解并缓解大语言模型的过度拒绝
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 安全训练 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL
AI总结 本文提出MOSR方法,通过干预大语言模型的安全表示来缓解过度拒绝问题,同时保持安全性。
Comments Added experiments
智能体事务:面向ACID兼容的智能体系统
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。
SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距
机构 * Independent researcher(独立研究人员)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。
Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added
通过危险信息合成包络确保城市移动中的安全物理人工智能
机构 * Xortech DOO
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对异构机器人城市部署的安全挑战,提出结合危险分析与运行时执行的统一框架,通过跨层安全转换保障物理AI的城市移动安全。
Comments The 2026 International Conference on Control, Robotics Engineering and Technology (CRET 2026), this https URL (https://www.cret.net/)
微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。
基于GRPO的LoRA秩分配:一项实证研究
机构 * Independent Researcher(独立研究者)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 本文探讨LoRA秩分配在强化学习中的有效性,发现GRPO环境下梯度重要性无法预测容量需求,非均匀分配反而降低准确性。
Comments Accepted at the Insights from Negative Results in NLP Workshop, EMNLP 2026
响应性验证:预测会改变吗?改变多少?改变频率如何?
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本研究提出测量响应性的算法与交互模型框架,搭配统计保证,可用于检测累犯预测的排除情况、估计内容审核博弈成本、测试LLM基准鲁棒性,提升模型安全性与可靠性。