arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-16 至 2026-04-16 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2512.20405 2026-04-16 cs.CR 75%

ChatGPT: Excellent Paper! Accept It. Editor: Imposter Found! Review Rejected

ChatGPT: 优秀论文!接受它。编辑:冒名顶替者发现!审稿被拒

Kanchon Gharami, Sanjiv Kumar Sarkar, Safayat Bin Hakim, Yongxin Liu, Nahid Farhady Ghalaty, Shafika Showkat Moni

专题命中 提示注入 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文探讨了LLM在科学论文写作与审稿中的风险,提出通过隐式提示注入技术攻击和防御LLM审稿的漏洞,旨在增强同行评审过程的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04288 2026-04-16 cs.CR cs.SE 50%

LLM-Enabled Open-Source Systems in the Wild: An Empirical Study of Vulnerabilities in GitHub Security Advisories

基于大语言模型的开源系统在现实中的应用:对GitHub安全通告中漏洞的实证研究

Fariha Tanjim Shifat, Hariswar Baburaj, Ce Zhou, Jaydeb Sarker, Mia Mohammad Imran

专题命中 提示注入 :prompt injection(abstract)

AI总结 本研究分析了295份GitHub安全通告,发现大多数漏洞映射到已知CWE,但模型中介暴露不足,建议结合CWE和OWASP视角更全面地评估LLM集成系统的漏洞。

Comments The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏