arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-21 至 2026-07-21 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 5 篇

2607.16227 2026-07-21 cs.LG cs.CR 新提交 70%

LLM Unlearning for Cyber Defense: A Survey on Methods, Challenges, and Emerging Threats

用于网络防御的大语言模型遗忘:方法、挑战及新出现威胁的综述

Ruppikha Sree Shankar, Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan, Troy Paulus Asia, Saptarshi Sengupta

机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院) San José State University(圣何塞州立大学)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 综述聚焦于网络防御中LLM遗忘问题,探讨其面临风险,核心问题是现有方法能否真的去除知识。主要关注基于梯度的方法,因其与现有训练管道兼容且可扩展,从多方面审视LLM遗忘,为解决相关问题提供参考。

Comments 42 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-07-21 cs.SE cs.AI cs.CR cs.IR cs.LG 新提交 62%

How Do You Choose Your AI Component? An Interview Study of Secure AI Integration in Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-07-21 cs.SE cs.AI 新提交 57%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16292 2026-07-21 cs.CR cs.LG 57%

In-Context Probing for Membership Inference in Fine-Tuned Language Models

上下文探查用于微调语言模型中的成员推断

Zhexi Lu, Hongliang Chi, Nathalie Baracaldo, Swanand Ravindra Kadhe, Yuseok Jeon, Lei Yu

机构 * Korea University, Seoul, South Korea(韩国大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出ICP-MIA框架,通过上下文探查技术有效检测微调语言模型中的成员身份,提升隐私保护能力。

Journal ref Proceedings of the 33rd Network and Distributed System Security Symposium (NDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16280 2026-07-21 cs.CV 新提交 50%

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 隐私与版权 :alignment(abstract)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏