arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-29 至 2026-05-29 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2605.30289 2026-05-29 cs.LG stat.AP stat.ML 79%

Statistical Embeddings for Similarity, Retrieval, and Interpretable Alignment of Numeric Tabular Datasets

用于数值表格数据集的相似性、检索和可解释对齐的统计嵌入

M. Ross Kunz, John Merickel, Keith Wilson

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 提出一种通过结构化探索性数据分析描述符、句子变换器嵌入和典型相关分析(CCA)来表征和比较数值表格数据集的方法,实现跨数据集的相似性检索和可解释变量级对齐,并支持差分隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28975 2026-05-29 cs.LG 79%

A Training-Time Diagnostic for Generalization via the Log-Alignment Ratio

基于对数对齐比率的训练时泛化诊断

Ali Shehper, Ashish Vaswani

机构 * Essential AI

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 提出对数对齐比率(LAR)作为参数-激活对齐的度量,通过捕捉训练中权重谱与激活谱的扩散来跟踪记忆与泛化的转换,并在grokking和语言模型预训练中预测泛化差距。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29202 2026-05-29 cs.LG 57%

Auditing Training Data in Generative Music Models via Black-Box Membership Inference

通过黑盒成员推断审计生成音乐模型中的训练数据

Yi Chen Liu, Jiawei Yu, Kexin Cao, Syed Irfan Ali Meerza, Trishika Movva, Jian Liu

机构 * University of Georgia(佐治亚大学) Independent Researcher(独立研究者) University of Tennessee(田纳西大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种黑盒成员推断方法,通过比较候选音频与模型基于其描述生成输出的语义对齐程度,并训练音乐审计器分类成员身份,实现对生成音乐模型训练数据的高精度审计。

Comments The paper has been accepted for presentation at the workshop ArtSec 2026: Workshop on Artwork Security and Provenance in the Age of AI

详情

展开后加载摘要…

URL PDF HTML 收藏