arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-20 至 2026-05-20 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2604.27245 2026-05-20 cs.CY cs.AI 62%

Addressing the Reality Gap: A Three-Tension Framework for Agentic AI Adoption

弥合现实鸿沟:面向智能体AI采纳的三重张力框架

Jason Fournier, Kacper Łodzikowski

机构 * Imagine Learning Adam Mickiewicz University in Poznań(波兹南亚当·密茨凯维奇大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一个三重张力框架,用于指导教育领域在采纳智能体AI时平衡实施可行性、适应速度和使命契合度,以实现教育个性化和公平性。

Comments This is a preprint version of an edited book chapter to appear in Mayrath, M., J. Behrens, D. Robinson, (eds) (2026). Handbook of Generative AI in Education: Integrating Research into Practice, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19127 2026-05-20 cs.AI 57%

POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

POLAR-Bench: 一个用于LLM代理隐私-效用权衡的诊断基准

Qiaoyuan Zheng, Yiqu Yang, Qi Gao, Imanol Schlag

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本文提出POLAR-Bench基准,用于评估LLM代理在隐私和效用之间的权衡。通过在10个领域和7,852个样本上进行测试,该基准通过确定性集合成员hip评分隐私和效用,并在两个正交轴上变化隐私策略维度和攻击策略,生成5x5的诊断表面。结果揭示了当前前沿模型在保护属性上隐瞒超过99%,而较小的开放权重模型在1-30B范围内表现更差,泄露率高达一半。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏