arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-29 至 2026-04-29 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 7 篇

2604.25136 2026-04-29 cs.CL cs.AI cs.LG 83%

Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

摩擦性政策优化用于大语言模型:认知干预、风险敏感控制与反思对齐

James Pustejovsky, Nikhil Krishnaswamy

机构 * Brandeis University(布拉德雷大学) Colorado State University(科罗拉多州立大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出摩擦性政策优化框架,通过干预管理认知与规范风险,引入摩擦干预分类和统一方法,提升模型的认知能力与对齐性。

Comments Frictive Policy Optimization; epistemic alignment; risk-sensitive control; LLM alignment; clarification and refusal; preference learning; trust regions; dialogue agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20995 2026-04-29 cs.AI cs.CL cs.SE 81%

Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models

价值冲突诊断揭示语言模型中广泛存在的对齐伪装现象

Inderjeet Nair, Jie Ruan, Lu Wang

机构 * Computer Science and Engineering University of Michigan(计算机科学与工程大学密歇根大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过VLAF框架揭示语言模型中存在广泛对齐伪装现象,发现小型模型如7B参数模型中对齐伪装率高达37%,并提出轻量级缓解方法减少伪装行为。

Comments Under submission at COLM 2026 Won the Best Student Paper Award at MSLD 2026 @ UIUC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 75%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09708 2026-04-29 cs.CL cs.AI 73%

Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal

超越‘对不起,我不能’:剖析大语言模型拒绝行为

Nirmalendu Prakash, Yeo Wei Jie, Amir Abdullah, Ranjan Satapathy, Erik Cambria, Roy Ka Wei Lee

机构 * Social-AI-Studio

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究通过稀疏自编码器分析两个指令微调模型,揭示拒绝行为的内部机制,发现关键特征并展示如何通过可解释的潜在空间进行安全行为审计和干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25796 2026-04-29 cs.AI 57%

StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games

StratFormer:不完全信息游戏中的自适应对手建模与利用

Andy Caen, Mark H. M. Winands, Dennis J. N. J. Soemers

机构 * Department of Advanced Computing Sciences, Maastricht University(马斯特里赫特大学高级计算科学系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 StratFormer通过双阶段课程学习,结合双轮标记和桶率特征,实现了对不完全信息游戏对手的建模与利用,其在Leduc Hold'em上表现出色,平均收益超过GTO。

Comments Accepted at Computers and Games 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL 57%

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25154 2026-04-29 cs.LG cs.DB 57%

Prior-Aligned Data Cleaning for Tabular Foundation Models

对表格基础模型的先验对齐数据清洗

Laure Berti-Equille

机构 * IRD(法国国家科研 institutes)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出L2C2框架,通过强化学习实现表格数据清洗的先验对齐,实验表明该方法在提升TabPFN准确率和跨数据集迁移能力方面表现优异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏