arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-05 至 2026-08-05 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2608.02674 2026-08-05 cs.CR cs.AI 新提交 88%

Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

移动安全屏障:针对白盒攻击的动态路由自适应对齐

Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 针对大型基础模型易受路由级白盒攻击的问题,提出动态路由自适应对齐框架,通过引入动态补偿路由提升模型安全稳健性且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02941 2026-08-05 cs.CL 新提交 83%

Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦

Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10472 2026-08-05 cs.CL cs.AI cs.HC cs.LG 82%

Large Language Models for Cancer Communication: Evaluating Linguistic Quality, Safety, and Accessibility in Generative AI

Agnik Saha, Victoria Churchill, Anny D. Rodriguez, Ugur Kursuncu, Muhammed Y. Idris

机构 * Georgia State University(佐治亚州立大学) Morehouse School of Medicine(莫尔豪斯医学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref JMIR Cancer 2026;12:e82971

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02665 2026-08-05 cs.CR cs.AI cs.CL 新提交 81%

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

单一规范提示低估了大语言模型安全的表面形式敏感性

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13981 2026-08-05 cs.CR 版本更新 67%

VirtualCrime: Evaluating the Criminal Potential and Agentic Behaviors of Large Language Models via Sandbox Simulation

VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力

Yilin Tang, Yu Wang, Lanlan Qiu, Wenchang Gao, Yunfei Ma, Baicheng Chen, Tianxing He

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18790 2026-08-05 cs.CR 版本更新 67%

RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt: 双层加密用于自我重建以规避LLM审核

Benyamin Tafreshian

专题命中 安全训练 :safety(abstract);jailbreak(abstract)

AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。

Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03138 2026-08-05 cs.CL cs.AI 新提交 62%

Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning

通过结构感知策略学习内化学术写作工作流以生成引言

Meicong Zhang, Tiancheng Su, Jiahao Cheng, Guoxiu He, Xinqi Tao, Dejia Song

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM生成论文引言的挑战,提出StructPO框架将多阶段写作工作流内化为单遍策略,实验显示其在语义对齐等指标上优于基线,泛化性好且与GPT-5.1性能相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01804 2026-08-05 cs.LG cs.AI 版本更新 62%

LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation

LEAP:面向GPU内核生成的代码强化学习的自适应剪枝轻量环境反馈框架

Tankun Li, Zhi Chen, Yaohua Tang

机构 * Moore Threads(摩尔线程)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 LEAP是针对GPU内核生成的代码强化学习框架,通过难度条件剪枝与基于排名的奖励公式解决低级代码RL的信号稀疏性等问题,收敛更快且性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03838 2026-08-05 cs.AI 新提交 57%

LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法

Zhinan Liu, Jie Li, Mingyu Kang, Jiayi Ji

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏