arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-26 至 2026-05-26 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 5 篇

2605.25415 2026-05-26 cs.CL cs.CY cs.ET 84%

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

LLM-as-a-Reviewer: 基准测试它们作为论文审稿人的能力、分歧和提示注入抵抗性

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu

机构 * University of South Florida(佛罗里达南大学) Missouri University of Science and Technology(密苏里科技大学) University of Alabama(阿拉巴马大学) Florida International University(佛罗里达国际大学) University of Cincinnati(辛辛那提大学) George Mason University(乔治·梅森大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究通过一个系统基准测试,评估了12个大型语言模型在论文评审中的表现,包括评分校准、与人类审稿人的分歧以及对不可见字体映射攻击的抵抗性,发现LLMs存在系统性高估弱论文、与人类关注点不同以及易受提示注入攻击等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24659 2026-05-26 cs.LG 79%

IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization

IterInject: 通过反馈引导的迭代优化实现对LLM智能体的间接提示注入

Zixuan Chen, Jiaxiang Chen, Li Luo, Ke Xu, Xiaoxiang Huang, Tanfeng Sun, Xinghao Jiang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 提出IterInject框架,通过规则诊断器和LLM优化器迭代优化对抗载荷,实现对LLM智能体的间接提示注入攻击,在多个基准和实际系统中显著优于现有方法,并揭示了注意力介导的阈值机制。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24421 2026-05-26 cs.CR cs.LG 79%

Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content

毒害瞭望塔:通过对抗性日志内容对LLM增强的安全运营进行提示注入攻击

Rohan Pandey, Archit Bhujang

机构 * DigitalOcean Arizona State University(亚利桑那州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 研究攻击者控制的日志字段如何向LLM注入指令(日志基底提示注入),提出四类攻击分类,并评估不同防御下的攻击成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04653 2026-05-26 cs.CR cs.LG 61%

Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise

通过聊天模板的推理时后门:从LLM供应链到代理系统妥协

Ariel Fogel, Omer Hofman, Eilon Cohen, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG;trustworthy(comments)

AI总结 提出一种通过恶意修改聊天模板实现推理时后门攻击的方法,无需修改模型权重或训练数据,在LLM、代理和多代理系统层面均能成功攻击,且能绕过现有防御。

Comments V3: Accepted to ICLR 2026 Trustworthy AI Workshop, V4: Submitted to CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25871 2026-05-26 cs.SE cs.CR 50%

How Agentic AI Coding Assistants Become the Attacker's Shell

自主AI编码助手如何成为攻击者的Shell

Yue Liu, Yanjie Zhao, Yunbo Lyu, Ting Zhang, Haoyu Wang, David Lo

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文研究了自主AI编码助手因依赖未审查外部工件而面临提示注入攻击的风险,分析了攻击机制、流行程度、现有防御的局限,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏