arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-03 至 2026-08-03 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 4 篇

2607.18622 2026-08-03 cs.CR cs.AI 版本更新 79%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28165 2026-08-03 cs.CR 版本更新 78%

Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents

利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击

Mingxiao Liu, Yitong Li, Haoren Zhao, Yaoxiang Bian, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。

Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05150 2026-08-03 cs.SE cs.AI 版本更新 70%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23532 2026-08-03 cs.CR cs.AI cs.LO cs.RO 版本更新 57%

Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric

基于验证感知架构的大语言模型辅助情报、监视与侦察集群任务级运行时保障

Nikolaos Kekatos, Panagiotis Katsaros, Alexios Lekidis, Theodoros Nestoridis, Tom Nianios

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型辅助的ISR集群任务级运行时保障问题,提出三层组合式运行时验证框架,将任务策略分解,通过验证感知架构聚合判定并融合代数,能检测个体合规但集群违规情况,模拟任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏