arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Technion - Israel Institute of Technology(以色列理工学院)

2026-06-08 至 2026-06-08 共收录 2
2602.04894 2026-06-08 cs.CR cs.AI 版本更新

Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software

从黑盒LLM生成的软件中提取重复漏洞

Tomer Kordonsky, Amit LeVi, Maayan Yamin, Noam Benzimra, Avi Mendelson

机构 * Technion - Israel Institute of Technology(技术学院 - 以色列理工学院)

AI总结 提出特征-安全表(FSTab),通过黑盒攻击从前端特征预测后端漏洞,并量化模型跨程序、重述和领域的漏洞复现一致性,实验显示跨域攻击成功率高达94%。

Comments ICML 2026, Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02600 2026-06-08 cs.LG cs.AI 版本更新

Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models

自回归与扩散语言模型中的逐步拒绝动态

Eliron Rahimi, Elad Hirshel, Rom Himelstein, Amit LeVi, Avi Mendelson, Chaim Baskin

机构 * Department of Computer Science, Technion – Israel Institute of Technology(技术学院计算机科学系,以色列技术学院) INSIGHT Lab, School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel(内斯坦实验室,贝内-加隆大学内加尔分校,以色列) Computer Science Department, University of Haifa, Haifa, Israel(海法大学计算机科学系,海法,以色列)

AI总结 研究扩散语言模型(DLM)与自回归(AR)模型在拒绝有害生成行为上的差异,发现扩散重掩码机制可促进恢复,提出逐步拒绝内部动态(SRI)信号,并基于此构建无需修改推理的越狱检测器。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏