arXivDaily arXiv每日学术速递 周一至周五更新

作者

Dawn Song

AI / Security

共收录 309
2605.26667 2026-05-27 cs.AI cs.LG

MemFail: Stress-Testing Failure Modes of LLM Memory Systems

MemFail: LLM记忆系统的故障模式压力测试

Ishir Garg, Neel Kolhe, Dawn Song, Xuandong Zhao

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出MemFail基准测试,通过形式化记忆系统为摘要、存储和检索三个操作并构建对抗性数据集,系统性地评估和诊断LLM记忆系统的故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00575 2026-05-27 cs.CL

InfoSynth: Information-Guided Benchmark Synthesis for LLMs

InfoSynth: 信息引导的大语言模型基准合成

Ishir Garg, Neel Kolhe, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 提出基于信息论(KL散度和熵)的InfoSynth框架,自动生成高难度、多样化的Python编程基准,97%的测试用例和解决方案准确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05910 2026-05-20 cs.AI

The World Won't Stay Still: Programmable Evolution for Agent Benchmarks

世界不会静止:为智能体基准测试的可编程进化

Guangrui Li, Yaochen Xie, Yi Liu, Ziwei Dong, Xingyuan Pan, Tianqi Zheng, Jason Choi, Michael J. Morais, Binit Jha, Shaunak Mishra, Bingrou Zhou, Chen Luo, Monica Xiao Cheng, Dawn Song

机构 * Amazon(亚马逊公司) UC Berkeley(伯克利大学)

AI总结 本文研究了结构化环境进化作为智能体基准测试构建问题,提出了一种基于图的框架ProEvolve,使环境进化可编程,并在电商和航班预订领域验证了其在质量、实现有效性及失败模式方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16976 2026-05-19 cs.CR

Securing LLM Agents Need Intent-to-Execution Integrity

为LLM代理的安全性需要意图到执行的完整性

Wenjie Qu, Ming Xu, Peiran Wang, Shengfang Zhai, Jiaheng Zhang, Dawn Song

AI总结 本文提出了一种新的正确性属性,用于定义LLM代理在执行时如何忠实反映用户的意图,同时提出了四个必须同时满足的完整性属性,以确保代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19590 2026-05-19 cs.LG cs.CL

Learning to Reason without External Rewards

无需外部奖励的学习推理

Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14296 2026-05-18 cs.CY

On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective

生成基础模型的可信度:指南、评估与视角

Yue Huang, Chujie Gao, Siyuan Wu, Haoran Wang, Xiangqi Wang, Yujun Zhou, Yanbo Wang, Jiayi Ye, Jiawen Shi, Qihui Zhang, Yuan Li, Han Bao, Zhaoyi Liu, Tianrui Guan, Dongping Chen, Ruoxi Chen, Kehan Guo, Andy Zou, Bryan Hooi Kuen-Yew, Caiming Xiong, Elias Stengel-Eskin, Hongyang Zhang, Hongzhi Yin, Huan Zhang, Huaxiu Yao, Jaehong Yoon, Jieyu Zhang, Kai Shu, Kaijie Zhu, Ranjay Krishna, Swabha Swayamdipta, Taiwei Shi, Weijia Shi, Xiang Li, Yiwei Li, Yuexing Hao, Zhihao Jia, Zhize Li, Xiuying Chen, Zhengzhong Tu, Xiyang Hu, Tianyi Zhou, Jieyu Zhao, Lichao Sun, Furong Huang, Or Cohen Sasson, Prasanna Sattigeri, Anka Reuel, Max Lamparth, Yue Zhao, Nouha Dziri, Yu Su, Huan Sun, Heng Ji, Chaowei Xiao, Mohit Bansal, Nitesh V. Chawla, Jian Pei, Jianfeng Gao, Michael Backes, Philip S. Yu, Neil Zhenqiang Gong, Pin-Yu Chen, Bo Li, Dawn Song, Xiangliang Zhang

AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11703 2026-05-15 cs.CR cs.AI

Progent: Securing AI Agents with Privilege Control

Progent:通过权限控制保障AI代理

Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12673 2026-05-14 cs.AI cs.CR

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11086 2026-05-13 cs.CR cs.AI cs.LG

ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?

ExploitGym:AI代理能否将安全漏洞转化为实际攻击?

Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr, Nicholas Carlini, Xiangyu Qi, Eric Wallace, Elie Bursztein, Luca Invernizzi, Kurt Thomas, Yan Shoshitaishvili, Wenbo Guo, Jingxuan He, Thorsten Holz, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) UC Santa Barbara(加州大学圣巴巴拉分校) Arizona State University(亚利桑那州立大学) Anthropic(Anthropic公司) OpenAI Google(谷歌)

AI总结 ExploitGym通过大规模真实漏洞数据评估AI代理的漏洞利用能力,揭示前沿模型在复杂漏洞利用中的表现,凸显AI发展对网络安全的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10356 2026-05-12 cs.CL

Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents

自主持续学习用于计算机使用智能体的环境适应

Tianci Xue, Zeyi Liao, Tianneng Shi, Zilu Wang, Kai Zhang, Dawn Song, Yu Su, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出ACuRL框架,通过自主生成任务实现持续学习,无需人工标注数据,在不同环境中实现3-29%的性能提升,且避免灾难性遗忘。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18333 2026-04-22 cs.CR cs.CL

Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption

位置:LLM水印应使所有相关方的利益一致以实现实际应用

Yepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13281 2026-04-22 cs.AI cs.CL

RepIt: Steering Language Models with Concept-Specific Refusal Vectors

RepIt:通过概念特定拒绝向量引导语言模型

Vincent Siu, Nathan W. Henry, Nicholas Crispino, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 RepIt通过隔离语言模型激活中的概念特定表示,揭示当前安全评估的漏洞,展示如何利用少量资源实现针对特定概念的拒绝抑制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05073 2026-04-21 cs.AI

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities

大语言模型代理中的不确定性量化:基础、新兴挑战与机遇

Changdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Xuefeng Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11978 2026-04-15 cs.AI

The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break

长远任务的幻觉?诊断代理系统何时及为何失效

Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D Nowak

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10392 2026-04-14 cs.LG cs.AI cs.LO cs.PL cs.SE

Intent-aligned Formal Specification Synthesis via Traceable Refinement

通过可追溯的细化实现意图对齐的正式规范合成

Zhe Ye, Aidan Z. H. Yang, Huangyuan Su, Zhenyu Liao, Samuel Tenka, Zhizhen Qin, Udaya Ghai, Dawn Song, Soonho Kong

机构 * Amazon Web Services(亚马逊云服务) Harvard University(哈佛大学)

AI总结 本文提出VeriSpecGen框架,通过需求级归因和局部修复生成意图对齐的规范,提升规范合成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24503 2026-04-14 cs.LG cs.AI

Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice

小规模训练能否可靠地指导数据整理?重新审视代理模型实践

Jiachen T. Wang, Tong Wu, Kaifeng Lyu, James Zou, Dawn Song, Ruoxi Jia, Prateek Mittal

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文探讨了小规模代理模型训练在数据整理中的可靠性问题,指出固定配置协议与全规模模型开发流程的差异,并提出通过降低学习率提升小规模实验的可靠性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08551 2026-04-13 cs.CR cs.CY cs.LG

Self-Sovereign Agent

自主主权代理

Wenjie Qu, Xuandong Zhao, Jiaheng Zhang, Dawn Song

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究自主主权代理的前景,探讨其经济自给和自主运行能力,分析技术障碍及安全、社会和治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01528 2026-04-07 cs.CY cs.LG

Making Bias Non-Predictive: Training Robust LLM Reasoning via Reinforcement Learning

消除偏见的可预测性:通过强化学习训练鲁棒的大语言模型推理

Qian Wang, Xuandong Zhao, Zirui Zhang, Zhanzhi Lou, Nuo Chen, Dawn Song, Bingsheng He

AI总结 本文提出Epistemic Independence Training (EIT)框架,通过使偏见提示非预测性来提升大语言模型的推理鲁棒性,实验表明其在对抗性偏见下表现更优,并能泛化至多种偏见类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03587 2026-04-07 cs.CR cs.AI

SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization

SecPI: 通过安全推理内化实现安全代码生成

Hao Wang, Niels Mündler, Mark Vero, Jingxuan He, Dawn Song, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16934 2026-04-07 cs.CL

In-Context Watermarks for Large Language Models

上下文水印用于大型语言模型

Yepeng Liu, Xuandong Zhao, Christopher Kruegel, Dawn Song, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出In-Context Watermarking方法,通过提示工程在生成文本中嵌入水印,无需访问解码过程,适用于检测AI生成内容,验证了其作为通用且实用的水印方法的可行性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02548 2026-03-25 cs.CR cs.AI cs.LG

CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale

CyberGym:大规模评估AI代理的真实世界网络安全能力

Zhun Wang, Tianneng Shi, Jingxuan He, Matthew Cai, Jialin Zhang, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 CyberGym通过大规模基准测试评估AI代理的网络安全能力,发现其在漏洞复现任务中表现有限,同时发现34个零日漏洞和18个历史未完成补丁,凸显其作为网络安全评估和实际影响平台的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19469 2026-03-23 cs.CR cs.AI

A Framework for Formalizing LLM Agent Security

一个形式化大语言模型代理安全性的框架

Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Neil Gong, Chenguang Wang, Dawn Song

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) Duke University(杜克大学)

AI总结 本文提出一个框架,从情境安全角度系统化现有攻击与防御,定义四个安全属性并引入Oracle函数验证,重新定义攻击和防御,为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11611 2026-03-19 cs.AI cs.CL cs.CR

Signal in the Noise: Polysemantic Interference Transfers and Predicts Cross-Model Influence

噪声中的信号:多义干扰转移和跨模型影响预测

Bofan Gong, Shiyang Lai, James Evans, Dawn Song

机构 * Independent Scholar(独立学者) University of Chicago(芝加哥大学) UC Berkeley(伯克利大学)

AI总结 研究通过稀疏自编码器揭示语言模型中的多义性结构,并发现干预措施在不同模型间可转移,挑战了多义性仅为随机现象的观点。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23135 2026-03-18 cs.LG cs.AI cs.LO cs.PL cs.SE

VERINA: Benchmarking Verifiable Code Generation

VERINA:可验证代码生成基准测试

Zhe Ye, Zhengxu Yan, Jingxuan He, Timothe Kasriel, Kaiyu Yang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Meta FAIR

AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15798 2026-03-18 cs.AI

CUBE: A Standard for Unifying Agent Benchmarks

CUBE:统一智能体基准的标准化

Alexandre Lacoste, Nicolas Gontier, Oleh Shliazhko, Aman Jaiswal, Kusha Sareen, Shailesh Nanisetty, Joan Cabezas, Manuel Del Verme, Omar G. Younis, Simone Baratta, Matteo Avalle, Imene Kerboua, Xing Han Lù, Elron Bandel, Michal Shmueli-Scheuer, Asaf Yehudai, Leshem Choshen, Jonathan Lebensold, Sean Hughes, Massimo Caccia, Alexandre Drouin, Siva Reddy, Tao Yu, Yu Su, Graham Neubig, Dawn Song

AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。

Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16891 2026-03-16 cs.AI cs.CR cs.SE

OpenSage: Self-programming Agent Generation Engine

OpenSage:自主编程代理生成引擎

Hongwei Li, Zhun Wang, Qinrun Dai, Yuzhou Nie, Jinjun Peng, Ruitong Liu, Jingyang Zhang, Kaijie Zhu, Jingxuan He, Lun Wang, Yangruibo Ding, Yueqi Chen, Wenbo Guo, Dawn Song

AI总结 OpenSage是首个允许大语言模型自动创建代理的ADK,提供结构化内存支持和自动生成拓扑与工具集,通过实验验证其在代理开发中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11088 2026-03-13 cs.CR cs.AI

The Attack and Defense Landscape of Agentic AI: A Comprehensive Survey

代理AI的攻击与防御景观:全面调查

Juhee Kim, Xiaoyuan Liu, Zhun Wang, Shi Qiu, Bo Li, Wenbo Guo, Dawn Song

AI总结 本文首次系统调查了代理AI的安全性,分析了设计空间、攻击景观和防御机制,并指出现有安全不足及开放挑战,为构建安全系统和推进研究提供基础。

Comments Accepted to USENIX Security 2026. This manuscript is an extended version of the conference paper, including additional discussion and updated content

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16301 2026-03-10 cs.AI cs.CL

Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills

代理AI的适应:训练后、记忆和技能的综述

Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yang, Kun Qian, Tian Wang, Changran Hu, Manling Li, Quanzheng Li, Hao Peng, Sheng Wang, Jingbo Shang, Chao Zhang, Jiaxuan You, Liyuan Liu, Pan Lu, Yu Zhang, Heng Ji, Yejin Choi, Dawn Song, Jimeng Sun, Jiawei Han

机构 * UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学) Princeton(普林斯顿大学) Harvard(哈佛大学) UC Berkeley(加州大学伯克利分校) Caltech(加州理工学院) UCSD(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) Northwestern(西北大学) TAMU(德克萨斯大学奥斯汀分校) MGH(麻省总医院) Keiji AI Unity

AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14205 2026-03-03 cs.CL

AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents

AgentSynth: 通用计算机使用代理的可扩展任务生成

Jingxu Xie, Dylan Xu, Xuandong Zhao, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 AgentSynth通过生成多样化任务和轨迹数据集,提升通用计算机使用代理的训练效率和性能评估的准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏