arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-07-13 至 2026-07-13 共收录 2
2601.22313 2026-07-13 cs.LG 版本更新

Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment

触发式对齐:黑盒评估无法保证更新后对齐

Yavuz Bakman, Duygu Nur Yaldiz, Eleni Triantafillou, Peter Kairouz, Salman Avestimehr, Sai Praneeth Karimireddy

机构 * University of Southern California(南加州大学)

AI总结 研究大语言模型更新后对齐问题,指出静态黑盒评估有局限,无法保证更新后对齐,通过理论分析和多领域实证验证,揭示模型隐藏对抗行为及与模型规模的关系,强调更新后鲁棒对齐评估的迫切性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18665 2026-07-13 cs.IR cs.AI cs.CL cs.CR cs.LG

Membership Inference Attacks on In-Context Examples in LLM-based Recommender Systems

基于LLM的推荐系统中上下文示例的成员推断攻击

Jiajie He, Min-Chun Chen, Xintong Chen, Xinyang Fang, Yuechun Gu, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) University of Cincinnati(辛辛那提大学) University of Southern California(南加州大学)

AI总结 本文提出两种针对LLM推荐系统中上下文示例的成员推断攻击,揭示了敏感信息暴露的风险及现有防御方法的不足。

Comments This is paper is accepted by ACM RecSys 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏