arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ServiceNow

2026-06-23 至 2026-06-23 共收录 2
2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21638 2026-06-23 cs.CR cs.CL 新提交

Toward Open Weight Models Without Risks: Separating Public and Private Capabilities in LLMs

迈向无风险的开源权重模型:在LLM中分离公共与私有能力

Charbel El Feghali, Arkil Patel, Nicholas Meade, Spandana Gella, Verna Dankers, Siva Reddy

机构 * Mila and McGill University(Mila和麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ServiceNow Research(ServiceNow研究) McGill-NLP/tiered-language-models(麦吉尔-自然语言处理/分层语言模型)

AI总结 提出层级语言模型(TLM),通过单一权重集和秘密密钥实现多级能力控制,公共配置保持基础能力,密钥配置解锁私有能力,抵抗微调提取和密钥部分泄露。

Comments Preprint. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏