arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-18 至 2026-05-18 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2504.09006 2026-05-18 cs.GT cs.LG 70%

Learning in Structured Stackelberg Games

在结构化Stackelberg游戏中学习

Maria-Florina Balcan, Kiriaki Fragkia, Keegan Harris

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California(加州大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文研究了结构化Stackelberg游戏,提出Stackelberg-Littlestone维度以优化在线学习算法,并在分布设定中提供样本复杂度的上下界。

Comments Accepted as a spotlight paper to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12667 2026-05-18 cs.LG cs.AI 62%

ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

ODRPO:离散奖励的序分解以实现鲁棒策略优化

Nirmal Patel, Fei Wang, Inderjit S. Dhillon

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ODRPO框架,通过将离散奖励分解为序二进制指标,减少噪声影响,提升策略优化鲁棒性,实验表明在Qwen2.5-7B和Qwen3-4B模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16067 2026-05-18 cs.LG stat.ML 57%

SAFE Quantum Machine Learning with Variational Quantum Classifiers

安全量子机器学习中的变分量子分类器

Ying Chen, Paolo Giudici, Vasily Kolesnikov, Paolo Recchia

机构 * National University of Singapore(新加坡国立大学) University of Pavia(帕维亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于幅度编码的变分量子分类器,结合归一化幅度嵌入与有界量子可观测量,构建了结构化且平滑的假设空间,通过SAFE-AI指标评估模型可靠性,实验证明其在预测性能和噪声鲁棒性方面优于经典基线。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14205 2026-05-18 cs.AI 57%

SimPersona: Learning Discrete Buyer Personas from Raw Clickstreams for Grounded E-Commerce Agents

SimPersona: 从原始点击流中学习离散买家人设以构建 grounded 的电子商务代理

Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ted Chaiwachirasak, Han Li, Lingyun Wang

机构 * Shopify

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 SimPersona 通过学习离散买家类型并将其映射为 LLM 代理的紧凑人设标记,提升电子商务代理的个性化能力,实现 78% 的转化率对齐,并在目标购物任务中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏