EVMbench: Evaluating AI Agents on Smart Contract Security
EVMbench:在智能合约安全上评估AI代理
机构 * OpenAI ; Paradigm ; OtterSec
专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI、cs.LG
AI总结 EVMbench通过评估AI代理在智能合约安全领域的检测、修补和利用能力,揭示了AI在区块链安全评估中的潜力与挑战。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
EVMbench:在智能合约安全上评估AI代理
机构 * OpenAI ; Paradigm ; OtterSec
专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI、cs.LG
AI总结 EVMbench通过评估AI代理在智能合约安全领域的检测、修补和利用能力,揭示了AI在区块链安全评估中的潜力与挑战。
自我归因偏差:当AI监控对自己宽容时
专题命中 软件智能体 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。
LLM裁判可靠性检测工具:检验LLM裁判的可靠性
机构 * RAND Corporation(RAND公司)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 本研究提出了一种开源工具,用于评估LLM裁判在不同基准中的可靠性,发现模型和扰动类型对性能有显著影响。
Comments Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil
迈向自编码信息系统的构建
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文提出自编码信息系统,旨在通过自动生成和部署源代码来提升系统动态适应能力,缩短新功能的上市时间。
Comments Accepted for ICSE 2026 Track "Software Architecture BoF"