arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 7 篇

2606.29602 2026-06-30 cs.CR 85%

An Empirical Evaluation of Prompt Injection Vulnerabilities in Large Language Models Across Multilingual and Obfuscated Attack Scenarios

多语言与混淆攻击场景下大语言模型提示注入漏洞的实证评估

Caglar Uysal, Baturay Birinci, Süha Orhun Mutluergil, Orçun Çetin

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文实证评估六种大语言模型在多语言和混淆攻击下的提示注入漏洞,发现所有模型均易受攻击,非英语语言恶意合规率更高,需加强安全防御。

Comments Accepted to the AI-SS 2026 Workshop at the 21st European Dependable Computing Conference (EDCC 2026). To be published in the EDCC Companion Proceedings (EDCC-C)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12277 2026-06-30 cs.CL cs.AI cs.CR 81%

Prompt Injection as Role Confusion

提示注入作为角色混淆

Charles Ye, Jasmine Cui, Dylan Hadfield-Menell

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过角色探测和CoT伪造攻击,揭示提示注入源于LLM对文本来源的角色感知混淆,并提出角色混淆程度可预测攻击成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28649 2026-06-30 cs.CR cs.AI cs.RO 79%

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

RIPA: 针对LLM控制的ROS 2机器人的感官向量提示注入攻击

Nima Dorzhiev

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出RIPA,首个通过感官管道对ROS 2机器人进行多通道提示注入攻击的系统研究,发现模型脆弱性不随规模单调变化,并提出混合语义防火墙。

Comments 12 pages, 4 figures, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29960 2026-06-30 cs.CL 70%

IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies

IHDec:面向多轮指令层级安全性的散度引导对比解码

Nicole Geumheon Liu, Haeun Jang, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 针对多轮对话中指令层级失效问题,提出基于Jensen-Shannon散度的无训练对比解码方法IHDec,自动检测并抑制越级指令,优于训练基线且保持响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29142 2026-06-30 cs.CY cs.SE 57%

Agent Security Meets Regulatory Reality -- A Practitioner Systematization of Autonomous-Agent Threats and Controls in Regulated Financial Systems

代理安全遇上监管现实——受监管金融系统中自主代理威胁与控制的从业者系统化

Krishna Mohan, Guda Nagavenkata Srinivasa

专题命中 提示注入 :prompt injection(abstract);分类 cs.CY

AI总结 本文基于生产经验,将六类代理威胁映射到美欧金融监管义务,提出四种架构模式将手动流程自动化处理约80%案例,并报告三项负面结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 57%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28791 2026-06-30 cs.SE 50%

From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer

从确定性到委托:AI原生软件工程与智能体工程师的演进

Mamdouh Alenezi

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出AI原生软件工程是范式转变,定义新职业角色“智能体工程师”,其核心工件从程序转向智能体系统,并分析工作单元、正确性和问责制的三大转变。

详情

展开后加载摘要…

URL PDF HTML 收藏