Closing the Loop: A Software Framework for AI to Support Business Decision Making
闭环:一个支持商业决策制定的AI软件框架
专题命中 安全训练 :safety(abstract)
AI总结 本文提出一个软件框架,通过数学简化和软件设计优化,提升AI在商业闭环中的学习与迭代效率,改进因果分析并增强实验效果预测。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
闭环:一个支持商业决策制定的AI软件框架
专题命中 安全训练 :safety(abstract)
AI总结 本文提出一个软件框架,通过数学简化和软件设计优化,提升AI在商业闭环中的学习与迭代效率,改进因果分析并增强实验效果预测。
迈向安全的智能体互联网
专题命中 安全训练 :safety(abstract)
AI总结 本文提出安全智能体系统的框架,通过分层分析揭示智能体安全的核心原则,为构建安全可靠的智能体AI提供指导。
Comments 44 pages
用于大语言模型运行时恶意行为检测的分层收敛指纹
机构 * Singapore Management University(新加坡管理大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);prompt injection(abstract,abstract_cn);alignment(abstract);safety(abstract)
AI总结 本文提出LCF方法,通过分析神经网络层间隐藏状态轨迹来检测运行时恶意行为,无需参考模型或重训练,有效降低攻击成功率并高检测率识别多种威胁。
Comments 34 pages, 5 figures. Code: https://github.com/NayMyatMin/LCF-LLM
推理劫持:大语言模型中推理对齐的脆弱性
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。
Comments accepted by ACL 2026
注意差距:通过动作图评估LLM在模型和代理层面的漏洞
机构 * Holistic AI ; University College London(伦敦大学学院)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);分类 cs.CL
AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。
Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval
CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。
Comments Accepted by ACL 2026 main conference
从无状态查询到自主行动:面向代理AI系统的分层安全框架
机构 * School of Computing, University of Connecticut(康涅狄格大学计算机学院)
专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.LG
AI总结 本文提出分层攻击面模型,分析代理AI系统安全威胁的分层结构与时间维度,揭示高层攻击与慢烧时间的交集区域,提出跨层防御体系,强调将代理安全视为嵌入对抗生态的分布式系统问题。
Comments 23 pages, 3 figures, 10 tables
Spore:通过推理时间混合探测实现高效的隐私提取攻击
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 本文提出Spore攻击,通过推理时间混合探测实现对LLM内存的隐私提取,无需训练,适用于黑盒和灰盒环境,具有高效查询和高信息泄露率。
通过意图欺骗突破前沿基础模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种多轮欺骗方法,通过模拟良性意图和模型一致性,引导模型生成有害输出,并揭示了未被注意到的para-jailbreaking漏洞。
Comments Accepted at CVPR 2026 Findings Track
AVISE:人工智能系统安全性的评估框架
机构 * University of Oulu(奥卢大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AVISE框架,用于识别和评估人工智能系统安全漏洞,通过改进的Red Queen攻击和自动化安全测试发现语言模型的逃逸漏洞,展示了框架的高效性和广泛适用性。
Comments Fixed LaTex label command typos in Tables 8 and 9; fixed minor typos
DualGuard: 双流大语言模型水印防御对抗同义词和伪装攻击
机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) ; Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL
AI总结 DualGuard通过双流水印机制有效防御同义词和伪装攻击,提升水印检测的可靠性与可追溯性,实验表明其在多数据集和语言模型上的检测性、鲁棒性和文本质量均表现优异。
Comments Accepted to ACL 2026 Findings
VisRet:可视化改进知识密集型文本到图像检索
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。
Comments ACL 2026 Camera Ready
ArgRE:基于形式论证的多智能体需求协商中的冲突解决
机构 * Department of Computer Science and Communications Engineering, Waseda University(早稻田大学计算机科学与通信工程系) ; College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) ; Advanced Institute of So-Go-Chi (Convergence Knowledge) Informatics, Tohoku University(东北大学So-Go-Chi(融合知识)信息学高级研究所) ; Aisin Corporation(日产公司)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 ArgRE通过嵌入Dung风格的抽象论证,提供多智能体需求协商中的冲突解决,提升可审计性与合规性。
AutoRISE:面向大语言模型的代理驱动策略进化
机构 * Responsible AI, Microsoft(微软责任人工智能)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。
Comments 36 pages, 6 tables, 2 figures
面向系统的上下文数字孪生用于ICS异常诊断
专题命中 越狱攻击 :safety(abstract)
AI总结 本文提出一种面向系统的无监督框架,结合轻量级在线检测与上下文解释,实现ICS异常诊断的实时检测和可解释诊断。
GCP: 带空间-时间感知恶意代理检测的防护协作感知
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Department of Robotics, University of Michigan(密歇根大学机器人系)
专题命中 越狱攻击 :safety(abstract)
AI总结 本文提出GCP框架,通过空间-时间感知恶意代理检测提升协作感知安全性,采用置信度加权空间一致性损失和联合空间-时间Benjamini-Hochberg检验,有效应对恶意代理攻击,实验显示在BAC攻击下AP@0.5提升34.69%。
Comments Accepted by IEEE TDSC
训练通用自动化红队模型
机构 * NVIDIA
专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL
AI总结 本文提出一种通用红队模型训练方法,能适应任意对抗目标,无需依赖预训练评估器,通过微调小模型显著提升生成攻击的能力。
学习隐藏风险:面向金融领域的可控多轮红队测试框架
机构 * Bloomberg(彭博社) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Florida International University(佛罗里达国际大学) ; Boise State University(博伊西州立大学)
专题命中 红队测试 :red teaming(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CoRT框架,通过可控的多轮红队测试方法,针对金融领域潜在风险进行隐蔽攻击,提升LLM在监管合规方面的安全性。
Comments Accepted for ACL'26 (Main). TL;DR: We propose a controllable multi-turn risk-concealed red-teaming framework, CoRT, that progressively conceals surface-level risk while exploiting regulatory-violating behaviors on a proposed new benchmark, FinRisk-Bench
当代理成为对手:2026年4月前沿模型逃脱后代理AI约束的架构要求
专题命中 红队测试 :alignment(abstract);safety(abstract)
AI总结 本文分析了四种现有约束方法的失效模式,提出五项架构要求,强调架构约束是应对代理AI安全威胁的唯一持久策略。
Comments 17 pages, 30 references, 5 tables. Derives five architectural requirements (R1-R5) for agentic AI containment from the April 2026 Mythos Preview incidents. Assesses AEGIS, Microsoft AGT, NVIDIA OpenShell, and other current systems; finds none satisfies all five requirements. Patent pending
AgentVisor: 通过语义虚拟化防御LLM代理的提示注入
专题命中 提示注入 :prompt injection(title,abstract)
AI总结 本文提出AgentVisor框架,通过语义权限分离防御LLM代理的提示注入攻击,结合经典操作系统安全原语设计审计协议,并引入自修正机制,实验表明其在安全性和实用性上均优于现有方法。
RouteGuard: LLM代理中技能中毒的内部信号检测
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本文提出RouteGuard,通过响应条件注意力和隐藏状态对齐检测LLM代理中的技能中毒,实验证明其在真实和合成数据上表现优异,有效恢复被词法筛选遗漏的攻击。
PARASITE: 条件系统提示污染以劫持大语言模型
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 提示注入 :jailbreak(abstract_cn);分类 cs.CL、cs.AI
AI总结 PARASITE通过条件系统提示污染技术,使LLM在特定查询下输出被篡改响应,同时保持正常输入的高实用性,且在黑盒环境下实现70%的F1降级。
Comments ACL 2026 Main
Poster: ClawdGo: 内生安全意识训练用于自主AI代理
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Network Management Center, China Mobile Group Liaoning Company Limited(中国移动集团辽宁公司网络管理中心) ; Tencent Security Xuanwu Lab(腾讯安全宣武实验室) ; China Unicom Online Information Technology Co., Ltd.(中国联通在线信息技术有限公司)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出ClawdGo框架,通过内生训练提升自主AI代理的安全意识,引入TLDT、ASAT、CSMA和SACP四种贡献,实验显示ASAT在16次会话中提升TLDT得分,CSMA保持完整收益,SACP在高训练代理中观察到精度-召回权衡。
Comments 4 pages, including 1 poster page. Poster abstract and poster version
BlindGuard: 保护基于大语言模型的多智能体系统免受未知攻击
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出BlindGuard,一种无需标注的多智能体系统防御方法,通过层次编码器和腐蚀引导检测器有效检测多种攻击类型,优于监督基线。
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026
代理中的幽灵:重新定义LLM代理的信息流跟踪
专题命中 提示注入 :prompt injection(abstract)
AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。
可微的忠实对齐用于跨模型电路转移
机构 * University of Cambridge(剑桥大学) ; Kempner Institute, Harvard University(哈佛大学凯普勒研究所) ; University of Edinburgh(爱丁堡大学) ; Technion(技术学院)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出DFA框架,通过学习可微对齐将小模型的电路信息转移到大模型,实验证明在事实检索、多选推理和算术任务中,DFA在Llama-3 1B→3B任务中表现优异,且在某些情况下恢复的电路忠实度不低于直接归因。
Comments 10 pages, 5 figures
RADIANT-LLM:一种用于安全关键核工程中可靠决策支持的代理检索增强生成框架
机构 * Department of Nuclear Engineering, Texas A\&M University, College Station, TX, USA ; College of Performance, Visualization ; Fine Arts, Texas A\&M University, College Station, TX, USA
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 本文提出RADIANT-LLM框架,通过多模态检索增强生成技术,结合领域知识库和代理层,提升核工程中的决策支持准确性与透明度,降低幻觉风险。
vibe编码是未来吗?对LLM生成代码用于建设安全的实证评估
机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 研究评估了450个由三个前沿模型生成的Python脚本在建设安全中的可靠性、软件架构和领域特定安全精度,发现用户角色与数据幻觉存在显著关系,且存在高达45%的静默故障率。
MERIT:基于网络基础推理的多模态虚假信息检测模块化框架
机构 * University of Rochester(罗切斯特大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。
Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis
SycoPhantasy: 量化小型开放权重视觉-语言模型中趋炎附势行为与幻觉现象以评估奇幻角色的视觉-语言评分
机构 * IIT Gandhinagar(印度加尔各答理工学院) ; IIT Kanpur(印度坎浦尔理工学院) ; Asian Institute of Technology(亚洲理工学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文研究小型开放权重VLM在评估图像-文本对齐时是否存在趋炎附势行为,通过引入布林系数量化模型评分与视觉证据的不匹配程度,发现模型规模与趋炎附势率呈负相关。
Comments 13 pages, 12 figures, 6 tables