arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-06 至 2026-03-06 共收录 4 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 4 篇

2603.04915 2026-03-06 cs.LG cs.AI cs.CR 81%

EVMbench: Evaluating AI Agents on Smart Contract Security

EVMbench:在智能合约安全上评估AI代理

Justin Wang, Andreas Bigger, Xiaohai Xu, Justin W. Lin, Andy Applebaum, Tejal Patwardhan, Alpin Yukseloglu, Olivia Watkins

机构 * OpenAI Paradigm OtterSec

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 EVMbench通过评估AI代理在智能合约安全领域的检测、修补和利用能力,揭示了AI在区块链安全评估中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 73%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 软件智能体 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05399 2026-03-06 cs.AI 57%

Judge Reliability Harness: Stress Testing the Reliability of LLM Judges

LLM裁判可靠性检测工具:检验LLM裁判的可靠性

Sunishchal Dev, Andrew Sloan, Joshua Kavner, Nicholas Kong, Morgan Sandler

机构 * RAND Corporation(RAND公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本研究提出了一种开源工具,用于评估LLM裁判在不同基准中的可靠性,发现模型和扰动类型对性能有显著影响。

Comments Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14132 2026-03-06 cs.SE 57%

Toward architecting self-coding information systems

迈向自编码信息系统的构建

Rodrigo Falcão, Frank Elberzhager, Karthik Vaidhyanathan

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出自编码信息系统,旨在通过自动生成和部署源代码来提升系统动态适应能力,缩短新功能的上市时间。

Comments Accepted for ICSE 2026 Track "Software Architecture BoF"

详情

展开后加载摘要…

URL PDF HTML 收藏