Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks
移动安全屏障:针对白盒攻击的动态路由自适应对齐
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 针对大型基础模型易受路由级白盒攻击的问题,提出动态路由自适应对齐框架,通过引入动态补偿路由提升模型安全稳健性且保留通用实用性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
移动安全屏障:针对白盒攻击的动态路由自适应对齐
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 针对大型基础模型易受路由级白盒攻击的问题,提出动态路由自适应对齐框架,通过引入动态补偿路由提升模型安全稳健性且保留通用实用性。
形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦
机构 * Islamic University of Technology(伊斯兰科技大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。
Comments 15 pages, 6 figures
机构 * Georgia State University(佐治亚州立大学) ; Morehouse School of Medicine(莫尔豪斯医学院)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref JMIR Cancer 2026;12:e82971
单一规范提示低估了大语言模型安全的表面形式敏感性
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。
Comments 9 pages, 3 tables
VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。
RoguePrompt: 双层加密用于自我重建以规避LLM审核
专题命中 安全训练 :safety(abstract);jailbreak(abstract)
AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。
Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version
通过结构感知策略学习内化学术写作工作流以生成引言
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM生成论文引言的挑战,提出StructPO框架将多阶段写作工作流内化为单遍策略,实验显示其在语义对齐等指标上优于基线,泛化性好且与GPT-5.1性能相当。
LEAP:面向GPU内核生成的代码强化学习的自适应剪枝轻量环境反馈框架
机构 * Moore Threads(摩尔线程)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 LEAP是针对GPU内核生成的代码强化学习框架,通过难度条件剪枝与基于排名的奖励公式解决低级代码RL的信号稀疏性等问题,收敛更快且性能更优。
LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。