Agentic Vulnerability Reasoning on COTS Binaries
基于商用现货二进制文件的智能体漏洞推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。
高校专区
基于商用现货二进制文件的智能体漏洞推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。
具有可验证奖励的强化学习的非空泛化界限
机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) ; MIT(麻省理工学院) ; Bridgewater AIA Labs(布里奇沃特人工智能实验室)
AI总结 研究针对具有可验证奖励的强化学习在十亿参数规模下泛化性差的问题,通过将PAC-贝叶斯压缩界限与Gumbel-max重参数化技巧结合,并提出渐进式RLVR框架,在多领域建立非空泛化界限,性能优于基础模型且接近微调模型。
Comments 22 pages, 7 figures
FlashDiff:用于扩散模型服务的高效区域执行与调度
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Vanderbilt University(范德比大学) ; HKUST(香港科技大学) ; NVIDIA(英伟达) ; Texas A&M University(德克萨斯农工大学)
AI总结 研究针对扩散模型服务效率低的问题,提出FlashDiff系统,通过自适应区域执行和调度,利用扩散细化特性及三种机制,有效降低端到端服务延迟,提高吞吐量。
通过推理模型作为评估器来提升评估时的计算能力
机构 * CMU(卡内基梅隆大学) ; UIUC(伊利诺伊大学) ; KAIST AI(韩国科学技术院人工智能研究所) ; NEC Laboratories Europe(日本 NEC 欧洲实验室) ; Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)
AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。
Comments ACL 2026 Findings