arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-18 至 2026-03-18 共收录 2 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 其他Agent 2 篇

2603.11214 2026-03-18 cs.AI cs.LG 76%

Measuring AI Agents' Progress on Multi-Step Cyber Attack Scenarios

在多步骤网络攻击场景中衡量AI代理的进展

Linus Folkerts, Will Payne, Simon Inman, Philippos Giavridis, Joe Skinner, Sam Deverett, James Aung, Ekin Zorer, Michael Schmatz, Mahmoud Ghanem, John Wilkinson, Alan Steer, Vy Hong, Jessica Wang

机构 * AI Security Institute, United Kingdom(人工智能安全研究所,英国)

专题命中 其他Agent :AI agent(title);分类 cs.AI、cs.LG

AI总结 本文评估前沿AI模型在需要链式异构能力的多步骤网络攻击场景中的自主攻击能力,发现模型性能与计算资源呈对数线性关系,且后续模型在固定资源下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08139 2026-03-18 cs.CL cs.AI 62%

Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models

LLMs能否检测其编造?在不确定性感知语言模型中估计可靠性

Tianyi Zhou, Johanne Medina, Sanjay Chawla

机构 * KTH Royal Institute of Technology(皇家理工学院) QCRI, HBKU(哈马德 bin 玉素菲大学量子计算与人工智能研究所)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了上下文信息如何影响模型行为,并提出利用token级不确定性来指导内部表示聚合的可靠性估计方法,通过实验发现正确上下文能提升回答准确性,而误导性上下文常导致自信错误响应。

Comments Published at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏