arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-17 至 2026-08-17 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2608.13695 2026-08-17 cs.CY cs.LG 新提交 88%

Language-Specific Gaps in AI Safety Training Datasets

AI安全训练数据集中的语言特定缺口

Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CY、cs.LG

AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14392 2026-08-17 cs.AI 新提交 85%

Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons

Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14089 2026-08-17 cs.AI cs.CL cs.CR cs.LG 新提交 82%

Regime-Conditional Verification: Correctness Estimation for Adapting and Monitoring Safety Classifiers

条件 regime 验证:安全分类器适配与监控的正确性估计

Thiago Sandoval, Ufuk Topcu

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。

Comments 16 pages including technical appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19009 2026-08-17 cs.CR cs.CL 版本更新 77%

Understanding and Mitigating Over-refusal for Large Language Models via Representation Intervention

通过安全表示理解并缓解大语言模型的过度拒绝

Junbo Zhang, Ran Chen, Qianli Zhou, Xinyang Deng, Wen Jiang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 安全训练 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL

AI总结 本文提出MOSR方法,通过干预大语言模型的安全表示来缓解过度拒绝问题,同时保持安全性。

Comments Added experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13900 2026-08-17 cs.DB cs.AI cs.CL cs.LG 新提交 67%

Agentic Transaction: Towards ACID-Compliant Agent Systems

智能体事务:面向ACID兼容的智能体系统

Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25420 2026-08-17 cs.CL cs.AI cs.CY 版本更新 67%

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距

Khalid Yusuf Dahir

机构 * Independent researcher(独立研究人员)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。

Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14481 2026-08-17 cs.RO cs.AI 新提交 57%

Ensuring Safe Physical AI in Urban Mobility via Hazard-Informed Synthesized Envelopes

通过危险信息合成包络确保城市移动中的安全物理人工智能

Alexei Odinokov, Rostislav Yavorskiy

机构 * Xortech DOO

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对异构机器人城市部署的安全挑战,提出结合危险分析与运行时执行的统一框架,通过跨层安全转换保障物理AI的城市移动安全。

Comments The 2026 International Conference on Control, Robotics Engineering and Technology (CRET 2026), this https URL (https://www.cret.net/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-08-17 cs.SE cs.AI cs.ET 新提交 57%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07366 2026-08-17 cs.CL 版本更新 57%

When Gradient Importance Lies: Adaptive LoRA Rank Allocation Fails Under GRPO

基于GRPO的LoRA秩分配:一项实证研究

Yash Ganpat Sawant

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文探讨LoRA秩分配在强化学习中的有效性,发现GRPO环境下梯度重要性无法预测容量需求,非均匀分配反而降低准确性。

Comments Accepted at the Insights from Negative Results in NLP Workshop, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02169 2026-08-17 cs.LG 版本更新 57%

Responsiveness Verification: Will Predictions Change? How Much? How Often?

响应性验证:预测会改变吗?改变多少?改变频率如何?

Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本研究提出测量响应性的算法与交互模型框架,搭配统计保证,可用于检测累犯预测的排除情况、估计内容审核博弈成本、测试LLM基准鲁棒性,提升模型安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏