arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2603.19011 2026-03-20 cs.CR cs.AI 57%

Security awareness in LLM agents: the NDAI zone case

LLM代理中的安全意识:NDAI区域案例

Enrico Bottazzi, Pia Park

机构 * Leku

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 研究探讨LLM代理在安全环境识别中的能力差异,发现失败的证明会抑制披露,而成功的证明导致不同模型反应不一,揭示LLM在检测危险信号方面可靠但无法验证安全,需进一步改进以支持隐私保护代理协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18013 2026-03-20 cs.CL 57%

Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models

学会但未表达:大型语言模型中的能力-表达脱节

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究员)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在特定条件下能重构训练数据内容,但无法在常规生成任务中表现的能力脱节现象,发现生成输出中未出现非因果解决方案框架。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏