AI Safety Should Prioritize the Future of Work
机构 * University of Utah ; Allen Institute for AI ; Stony Brook University \& Salesforce AI Research
专题命中 隐私与版权 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Utah ; Allen Institute for AI ; Stony Brook University \& Salesforce AI Research
专题命中 隐私与版权 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 隐私与版权 :safety(title,abstract);trustworthy(title);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 隐私与版权 :alignment(title,abstract);safety(title);DPO(abstract);分类 cs.CL
Comments AAAI 2026 Extended Version
专题命中 隐私与版权 :safety(title,abstract);trustworthy(title,abstract);分类 cs.LG
Journal ref APSIPA Transactions on Signal and Information Processing, vol. 12, no. 3, 2023
面向青少年的文化感知生成式AI风险:来自非西方背景的青少年、父母和教师视角
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 隐私与版权 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY
AI总结 研究从非西方视角探讨青少年使用生成式AI工具的风险,分析文化、宗教和社会因素对隐私和安全的影响,揭示家庭经济因素加剧的共享账户使用问题,并提出符合文化规范的家长控制设计。
版权纠纷的概率分析与生成式AI安全
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 隐私与版权 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY
AI总结 本文通过概率方法分析版权纠纷,并评估生成式AI的版权安全,揭示了NAF条件的局限性。
Comments 5 pages
Journal ref Proc. 20th Int. Conf. on Artificial Intelligence and Law (ICAIL '25), ACM, pp. 470-474 (2026)
对齐的打砖块:微调激活大型语言模型对版权书籍的原文回忆
机构 * Stony Brook University(石溪大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia Law School(哥伦比亚法学院)
专题命中 隐私与版权 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究显示微调可绕过安全对齐策略,使GPT-4o等模型能回忆85-90%的版权书籍,揭示模型权重存储版权作品的漏洞。
Comments Preprint Under Review
PII-VisBench: 在可见性连续体上评估视觉语言模型中个人可识别信息安全性
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 隐私与版权 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 PII-VisBench 评估视觉语言模型在可见性连续体上对个人可识别信息安全性的保护,通过4000个探测器分析不同可见性水平下的隐私泄露情况。
SafeLM:面向可信联邦大语言模型的统一隐私意识优化
机构 * Istanbul Technical University(伊斯坦布尔技术大学)
专题命中 隐私与版权 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
AI总结 SafeLM通过整合隐私、安全、虚假信息和对抗鲁棒性四大支柱,提升联邦大语言模型的可信度,实现98%有害内容检测准确率,降低通信开销并提升隐私保护效率。
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; ELLIS Institute(ELLIS研究所) ; MPI for Intelligent Systems(智能系统研究所) ; Tübingen AI Center(图宾根人工智能中心)
专题命中 隐私与版权 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI
RH-RAG:适用于隐私受限场景的可信长文本生成
机构 * Indian Institute of Technology, Roorkee(鲁尔基印度理工学院)
专题命中 隐私与版权 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL
AI总结 该研究针对隐私受限场景下的长文本生成难题,提出基于本地语言模型的多智能体框架RH-RAG,通过三阶段协同生成与双层检索索引提升生成质量,且兼顾数据隐私。
Comments accepted in KDD 2026 SeT-LLM Workshop
OmniCompliance-100K:一个多领域、基于规则、现实世界安全合规数据集
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 隐私与版权 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 本文构建了一个涵盖74项法规的多领域安全合规数据集,包含12,985条规则和106,009个现实案例,通过基准测试评估了不同规模LLM的安全合规能力。
Comments Accepted to ACL 2026 Findings
ContextLens:建模不完美隐私和安全上下文以满足法律合规
机构 * Beihang University(北京航空航天大学) ; HKUST(香港科技大学) ; National University of Singapore(新加坡国立大学) ; Faculty of Law, University of Macau(澳门大学法学院)
专题命中 隐私与版权 :safety(title,abstract);AI safety(abstract);分类 cs.CL
AI总结 本文提出ContextLens框架,利用LLM建模法律领域上下文,识别已知和未知因素以提升合规评估,实验表明其能有效提升LLM合规性评估性能。
Comments Accepted by ACL 26
专题命中 隐私与版权 :alignment(title,abstract);trustworthy(abstract);分类 cs.LG
Comments arXiv admin note: text overlap with arXiv:2202.02242
大语言模型在隐私与亲社会冲突下的价值-行动对齐
机构 * Arizona State University(亚利桑那州立大学) ; University of Southern California(南加州大学)
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨大语言模型在隐私与亲社会冲突中的价值-行动对齐,通过多组结构方程模型分析隐私关注与亲社会性对数据共享的影响,提出价值-行动对齐率(VAAR)作为评估指标。
Comments Findings of the Association for Computational Linguistics: ACL 2026
HelpBench:评估LLM提供隐私、安全和安全建议的能力
专题命中 隐私与版权 :safety(title,abstract);trustworthy(abstract)
AI总结 提出HelpBench基准,通过450个真实用户问题评估18个LLM的隐私、安全建议准确性,发现平均得分82%但10%回答低于65%存在有害建议。
PolicyGapper:利用LLMs自动检测Google Play数据安全部分与隐私政策之间的不一致之处
专题命中 隐私与版权 :safety(title,abstract);alignment(abstract)
AI总结 本文提出PolicyGapper,一种基于LLM的方法,用于自动检测Google Play数据安全部分与隐私政策之间的不一致之处,通过四个阶段处理330款应用,发现2689处遗漏披露,验证精度达75%。
Comments Submitted for consideration to the Journal of Information Security and Applications (JISA)
SineProject:用于稳定视觉语言对齐的机器反遗忘
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)
专题命中 隐私与版权 :alignment(title,abstract);safety(abstract)
AI总结 SineProject通过在冻结的投影器中加入正弦调制的可训练参数,提升Jacobian的谱条件数,稳定反遗忘过程中的视觉语言对齐,减少无害查询拒绝并实现目标信息遗忘。
Comments Accepted at CVPR 2026
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 12 pages, 4 figures
OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 隐私与版权 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。
Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026
PrivacyAlign: LLM代理的上下文隐私对齐
机构 * University of Waterloo(滑铁卢大学) ; ServiceNow AI Research(ServiceNow AI 研究) ; McGill University(麦吉尔大学) ; Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。
针对安全分类器的边界目标成员推断攻击
机构 * University of Sheffield(谢菲尔德大学) ; Carnegie Mellon University(卡内基梅隆大学) ; MBZUAI
专题命中 隐私与版权 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 提出一种边界目标选择策略,通过识别低置信度样本来放大成员推断信号,在安全分类器上以5%假阳性率恢复19%的敏感对话,比现有方法高3.5倍。
Sherpa.ai 保护隐私的多方实体对齐无需披露交集
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Sherpa.ai多方PSU协议,用于垂直联邦学习中的隐私保护实体对齐,实现精确和噪声匹配,同时隐藏交集成员信息,适用于多机构医疗疾病检测等场景。
探测器几何对齐:在偶然机会以下消除跨序列记忆签名
机构 * Howard University(霍华德大学)
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了大语言模型中记忆痕迹的消除方法,提出通过探测器几何对齐技术在不损害能力的前提下,有效消除跨序列记忆签名,且在多种模型上验证了其有效性。
大语言模型能从在线对话中推断政治倾向
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.CY
AI总结 研究展示大语言模型能可靠推断隐藏的政治倾向,优于传统机器学习模型,通过聚合文本推断和使用相关领域提升预测精度,揭示LLM在利用社会文化关联方面的潜力与风险。
Comments 56 pages; 4 figures in the main text and 18 supplementary figures, 11 supplementary tables
违规状态:多模态语言模型接口中的安全状态持续
专题命中 隐私与版权 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 研究发现多模态语言模型在面对版权拒绝后,会持续拒绝无关图像生成请求,揭示了会话级安全状态的持续性问题。
Comments 19 pages, 1 figure, 1 table
机构 * Universitas Gadjah Mada, Indonesia(加雅玛大学) ; Monash University, Indonesia(墨尔本大学)
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI、cs.LG
Comments 8 pages, TrustCom 2025 Conference
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.LG
Comments ICLR 2025 Camera Ready; Code: https://github.com/UKPLab/iclr2025-psa
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL
Comments Ontology alignment, contextual descriptors, semantic matching, knowledge representation, essential descriptors, ontology integration, hierarchical structure, semantic heterogeneity, ethical AI
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL
Comments LLM, CPT, knowledge learning, format alignment; work in progress