arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-02 至 2026-06-02 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 4 篇

2606.00467 2026-06-02 cs.CL cs.AI cs.LG stat.ML 67%

On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

论大语言模型适应性的局限:模型内化先验对标注任务性能的影响

Etienne Casanova, Rafal Kocielnik, R. Michael Alvarez

机构 * University of Washington(华盛顿大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过毒性检测实验,研究大语言模型内化先验与指令交互的三个维度,发现近三分之二的零样本错误难以通过提示纠正,并引入定义特定熟悉度(DSF)指标,证明其与性能正相关,而文本记忆指标则无此关联。

Comments Accepted at ICML 2026 (Oral & Spotlight); PMLR vol. 306. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00105 2026-06-02 cs.CV cs.AI 57%

Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

视觉噪声引导的上下文蒸馏用于多模态大语言模型遗忘

Junkai Chen, Yuhao He, Junxiang You, Ruiqi Liu, Chenyu Wang, Shu Wu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 提出视觉噪声引导的上下文蒸馏(VGID)框架,通过双模态干预构建教师分布进行蒸馏,实现多模态大语言模型参数级遗忘,平衡遗忘效果与模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02016 2026-06-02 cs.CR cs.CY 57%

What's on Your Mind? Exploring Privacy of Mental Health Apps

你在想什么?探索心理健康应用的隐私

Chloe Georgiou, Hans Lu, Emiliano De Cristofaro, Gene Tsudik

专题命中 隐私与版权 :alignment(abstract);分类 cs.CY

AI总结 通过对25款流行的Android心理健康应用进行静态分析、动态网络捕获和LLM辅助隐私政策提取,发现这些应用存在严重的透明度问题,包括未披露的跟踪器、权限政策矛盾以及第三方AI处理披露不充分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01225 2026-06-02 cs.CR 50%

Privacy-Preserving Smart Surveillance with Cross-Dataset Violence Detection and Decentralized Evidence Governance

隐私保护的智能监控:跨数据集暴力检测与去中心化证据治理

Hasan Coşkun, Furkan Çolhak, Andrea Kulakov, Vesna Dimitrova

专题命中 隐私与版权 :safety(abstract)

AI总结 提出一种隐私保护智能监控框架,使用轻量级MobileNetV2视频分类器检测暴力片段,并通过Shamir秘密共享和公钥加密实现去中心化证据访问控制,在多个数据集上评估了不同时序模型的表现。

Comments 7 pages. Submitted to the CyberMACS Conference

详情

展开后加载摘要…

URL PDF HTML 收藏