arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 4 篇

2503.05954 2026-03-17 cs.LG 79%

A Survey on Deep Learning Approaches for Tabular Data Generation: Utility, Alignment, Fidelity, Privacy, Diversity, and Beyond

关于表格数据生成的深度学习方法的综述:效用、对齐、保真度、隐私、多样性及其他

Mihaela Cătălina Stoian, Eleonora Giunchiglia, Thomas Lukasiewicz

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 本文综述了表格数据生成的深度学习方法,从效用、对齐、保真度、隐私、多样性等方面探讨不同需求下的生成方法,并讨论评估方法和未来发展方向。

Comments Accepted to Transactions on Machine Learning Research (02/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 70%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 70%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09775 2026-03-17 cs.CR cs.AI cs.IT cs.LG cs.NI math.IT 62%

Privacy-Preserving Explainable AIoT Application via SHAP Entropy Regularization

通过SHAP熵正则化实现隐私保护的可解释AIoT应用

Dilli Prasad Sharma, Xiaowei Sun, Liang Xue, Xiaodong Lin, Pulei Xiong

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于SHAP熵正则化的隐私保护方法,通过惩罚低熵的SHAP属性分布,减少可解释AIoT中的隐私泄露,同时保持高预测准确性和解释忠实性。

Journal ref 2025 IEEE Annual Congress on Artificial Intelligence of Things (AIoT)

详情

展开后加载摘要…

URL PDF HTML 收藏