MemFail: Stress-Testing Failure Modes of LLM Memory Systems
MemFail: LLM记忆系统的故障模式压力测试
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出MemFail基准测试,通过形式化记忆系统为摘要、存储和检索三个操作并构建对抗性数据集,系统性地评估和诊断LLM记忆系统的故障模式。
作者
AI / Security
MemFail: LLM记忆系统的故障模式压力测试
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出MemFail基准测试,通过形式化记忆系统为摘要、存储和检索三个操作并构建对抗性数据集,系统性地评估和诊断LLM记忆系统的故障模式。
InfoSynth: 信息引导的大语言模型基准合成
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 提出基于信息论(KL散度和熵)的InfoSynth框架,自动生成高难度、多样化的Python编程基准,97%的测试用例和解决方案准确。
世界不会静止:为智能体基准测试的可编程进化
机构 * Amazon(亚马逊公司) ; UC Berkeley(伯克利大学)
AI总结 本文研究了结构化环境进化作为智能体基准测试构建问题,提出了一种基于图的框架ProEvolve,使环境进化可编程,并在电商和航班预订领域验证了其在质量、实现有效性及失败模式方面的表现。
为LLM代理的安全性需要意图到执行的完整性
AI总结 本文提出了一种新的正确性属性,用于定义LLM代理在执行时如何忠实反映用户的意图,同时提出了四个必须同时满足的完整性属性,以确保代理的安全性。
无需外部奖励的学习推理
机构 * UC Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学)
AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。
Comments ICLR 2026
生成基础模型的可信度:指南、评估与视角
AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。
Progent:通过权限控制保障AI代理
机构 * UC Berkeley(加州大学伯克利分校) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; National University of Singapore(新加坡国立大学)
AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。
安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。
ExploitGym:AI代理能否将安全漏洞转化为实际攻击?
机构 * UC Berkeley(加州大学伯克利分校) ; Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; Arizona State University(亚利桑那州立大学) ; Anthropic(Anthropic公司) ; OpenAI ; Google(谷歌)
AI总结 ExploitGym通过大规模真实漏洞数据评估AI代理的漏洞利用能力,揭示前沿模型在复杂漏洞利用中的表现,凸显AI发展对网络安全的潜在风险。
自主持续学习用于计算机使用智能体的环境适应
机构 * The Ohio State University(俄亥俄州立大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出ACuRL框架,通过自主生成任务实现持续学习,无需人工标注数据,在不同环境中实现3-29%的性能提升,且避免灾难性遗忘。
Comments 28 pages, 10 figures
MalTool:针对LLM代理的恶意工具攻击
AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。
位置:LLM水印应使所有相关方的利益一致以实现实际应用
机构 * UC Santa Barbara(加州大学圣芭芭拉分校) ; UC Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。
Comments ACL2026
RepIt:通过概念特定拒绝向量引导语言模型
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 RepIt通过隔离语言模型激活中的概念特定表示,揭示当前安全评估的漏洞,展示如何利用少量资源实现针对特定概念的拒绝抑制。
Comments ICLR 2026
大语言模型代理中的不确定性量化:基础、新兴挑战与机遇
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。
Comments ACL 2026 Main Conference
长远任务的幻觉?诊断代理系统何时及为何失效
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。
通过可追溯的细化实现意图对齐的正式规范合成
机构 * Amazon Web Services(亚马逊云服务) ; Harvard University(哈佛大学)
AI总结 本文提出VeriSpecGen框架,通过需求级归因和局部修复生成意图对齐的规范,提升规范合成的准确性和效率。
小规模训练能否可靠地指导数据整理?重新审视代理模型实践
机构 * Princeton University(普林斯顿大学) ; Tsinghua University(清华大学) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Virginia Tech(弗吉尼亚理工大学)
AI总结 本文探讨了小规模代理模型训练在数据整理中的可靠性问题,指出固定配置协议与全规模模型开发流程的差异,并提出通过降低学习率提升小规模实验的可靠性。
Comments ICLR 2026
自主主权代理
机构 * National University of Singapore(新加坡国立大学)
AI总结 研究自主主权代理的前景,探讨其经济自给和自主运行能力,分析技术障碍及安全、社会和治理挑战。
消除偏见的可预测性:通过强化学习训练鲁棒的大语言模型推理
AI总结 本文提出Epistemic Independence Training (EIT)框架,通过使偏见提示非预测性来提升大语言模型的推理鲁棒性,实验表明其在对抗性偏见下表现更优,并能泛化至多种偏见类型。
SecPI: 通过安全推理内化实现安全代码生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。
上下文水印用于大型语言模型
机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) ; UC Berkeley(加州大学伯克利分校)
AI总结 本文提出In-Context Watermarking方法,通过提示工程在生成文本中嵌入水印,无需访问解码过程,适用于检测AI生成内容,验证了其作为通用且实用的水印方法的可行性。
Comments ICLR2026
CyberGym:大规模评估AI代理的真实世界网络安全能力
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 CyberGym通过大规模基准测试评估AI代理的网络安全能力,发现其在漏洞复现任务中表现有限,同时发现34个零日漏洞和18个历史未完成补丁,凸显其作为网络安全评估和实际影响平台的价值。
一个形式化大语言模型代理安全性的框架
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; UC Berkeley(加州大学伯克利分校) ; Duke University(杜克大学)
AI总结 本文提出一个框架,从情境安全角度系统化现有攻击与防御,定义四个安全属性并引入Oracle函数验证,重新定义攻击和防御,为未来研究提供方向。
噪声中的信号:多义干扰转移和跨模型影响预测
机构 * Independent Scholar(独立学者) ; University of Chicago(芝加哥大学) ; UC Berkeley(伯克利大学)
AI总结 研究通过稀疏自编码器揭示语言模型中的多义性结构,并发现干预措施在不同模型间可转移,挑战了多义性仅为随机现象的观点。
Journal ref ICLR 2026
VERINA:可验证代码生成基准测试
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta FAIR
AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。
CUBE:统一智能体基准的标准化
AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。
Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard
OpenSage:自主编程代理生成引擎
AI总结 OpenSage是首个允许大语言模型自动创建代理的ADK,提供结构化内存支持和自动生成拓扑与工具集,通过实验验证其在代理开发中的优势。
代理AI的攻击与防御景观:全面调查
AI总结 本文首次系统调查了代理AI的安全性,分析了设计空间、攻击景观和防御机制,并指出现有安全不足及开放挑战,为构建安全系统和推进研究提供基础。
Comments Accepted to USENIX Security 2026. This manuscript is an extended version of the conference paper, including additional discussion and updated content
代理AI的适应:训练后、记忆和技能的综述
机构 * UIUC(伊利诺伊大学香槟分校) ; Stanford(斯坦福大学) ; Princeton(普林斯顿大学) ; Harvard(哈佛大学) ; UC Berkeley(加州大学伯克利分校) ; Caltech(加州理工学院) ; UCSD(加州大学圣地亚哥分校) ; Georgia Tech(佐治亚理工学院) ; Northwestern(西北大学) ; TAMU(德克萨斯大学奥斯汀分校) ; MGH(麻省总医院) ; Keiji AI ; Unity
AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。
AgentSynth: 通用计算机使用代理的可扩展任务生成
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 AgentSynth通过生成多样化任务和轨迹数据集,提升通用计算机使用代理的训练效率和性能评估的准确性。
Comments ICLR 2026