arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 6 篇

2604.19219 2026-05-19 cs.CR cs.AI cs.DC cs.LG 81%

Sherpa.ai Privacy-Preserving Multi-Party Entity Alignment without Intersection Disclosure for Noisy Identifiers

Sherpa.ai 保护隐私的多方实体对齐无需披露交集

Daniel M. Jimenez-Gutierrez, Dario Pighin, Enrique Zuazua, Georgios Kellaris, Joaquin Del Rio, Oleksii Sliusarenko, Xabi Uribe-Etxebarria

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Sherpa.ai多方PSU协议,用于垂直联邦学习中的隐私保护实体对齐,实现精确和噪声匹配,同时隐藏交集成员信息,适用于多机构医疗疾病检测等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17341 2026-05-19 cs.CV cs.AI 79%

Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment

通过跨模态语义对齐实现面向视觉-语言模型的单样本黑盒成员推断攻击

Jiaqing Li, Yajuan Lu, Xiaochuan Shi, Gang Wu, ZhongYuan Wang, Chao Liang

机构 * Wuhan University(武汉大学) Tarim University(塔里木大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于跨模态语义对齐的新型成员推断攻击框架,针对视觉-语言模型在单样本和黑盒场景下的数据安全风险进行评估,通过量化联合嵌入空间中的对齐程度,显著提升了攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22471 2026-05-19 cs.LG cs.AI stat.ML 62%

The Bayesian Geometry of Transformer Attention

Transformer 注意力的贝叶斯几何

Naman Agarwal, Siddhartha R. Dalal, Vishal Misra

机构 * Columbia University(哥伦比亚大学) Columbia University School of Professional Studies(哥伦比亚大学专业研究学院) Department of Statistics(统计学系) Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建贝叶斯风道,验证了Transformer在上下文中的贝叶斯推理能力,发现其通过几何机制实现后验更新与路由,揭示了注意力机制的必要性及扁平架构的不足。

Comments v2: Add dual-entropy measurement framework (H_I, H_P, \r{ho} = H_P/H_I); incorporate Overleaf revisions; fix duplicate bibliography entries (akyurek mashup; openai title; legacy aliases removed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22056 2026-05-19 cs.CL 57%

Dual-Space Knowledge Distillation with Key-Query Matching for Large Language Models with Vocabulary Mismatch

双空间知识蒸馏与关键-查询匹配用于具有词汇不匹配的大型语言模型

Stella Eva Tsiapali, Cong-Thanh Do, Kate Knill

机构 * University of Cambridge, Department of Engineering(剑桥大学工程系) Toshiba Europe Limited(东芝欧洲有限公司)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文研究了针对具有词汇不匹配的大型语言模型的双空间知识蒸馏与关键-查询匹配方法,通过分析注意力机制揭示其优缺点,并提出基于生成对抗学习的新方法以解决关键-查询分布不匹配问题。

Comments Copyright 2026 IEEE. Published in ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), scheduled for 4-8 May 2026 in Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06907 2026-05-19 cs.AI cs.CV cs.NE 57%

A Survey on Foundation Models for Personalized Federated Intelligence

面向个性化联邦智能的基础模型综述

Yu Qiao, Huy Q. Le, Avi Deb Raha, Phuong-Nam Tran, Apurba Adhikary, Mengchun Zhang, Loc X. Nguyen, Eui-Nam Huh, Dusit Niyato, Choong Seon Hong

机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) Noakhali Science and Technology University(诺阿克利科学与技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了基础模型在个性化联邦智能中的应用,探讨了联邦学习与基础模型的结合,提出了一种新的个性化联邦智能范式,旨在为实现人工智能个性化提供基础支持。

Comments Accepted ACM Computing Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00273 2026-05-19 cs.HC 50%

Understanding, Challenging, and Demystifying Perceptions of Gig Worker Vulnerabilities

理解、挑战和祛魅网约车工人脆弱性感知

Sander de Jong, Jane Hsieh, Tzu-Sheng Kuo, Rune Møberg Jacobsen, Niels van Berkel, Haiyi Zhu

专题命中 隐私与版权 :safety(abstract)

AI总结 本文研究了网约车工人对自身脆弱性的认知及误解,通过实验发现工人对常见误解的认知不足,提出通过说服策略提升公众对网约车工人劳动条件的认识,以支持集体谈判权益。

详情

展开后加载摘要…

URL PDF HTML 收藏