arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-11 至 2026-03-11 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 20 篇

2603.09052 2026-03-11 cs.AI cs.CL cs.LG 89%

From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring

从天到分钟:一个自主AI代理在远程患者监测中实现可靠的临床分诊

Seunghwan Kim, Tiffany H. Kung, Heena Verma, Dilan Edirisinghe, Kaveh Sedehi, Johanna Alvarez, Diane Shilling, Audra Lisa Doyle, Ajit Chary, William Borden, Ming Jack Po

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Sentinel通过自主AI代理实现远程患者监测的高效分诊,超越个体医生的灵敏度,提供可扩展且临床可行的解决方案。

Comments 46 pages, 11 figures, Abstract in metadata is shortened to meet arXiv character limits; see PDF for full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08806 2026-03-11 cs.SE cs.AI 88%

Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications

基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理

Tzafrir Rehan

机构 * Fiverr Labs(Fiverr 实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.SE

AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。

Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 88%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08835 2026-03-11 cs.AI cs.CL cs.LG 88%

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval: 从模型到系统的多智能体评估扩展

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Oxford(牛津大学) University of Tübingen(图宾根大学) TU Darmstadt(德累斯顿理工大学) MBZUAI NAVER AI Lab(NAVER AI实验室) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title);multi-agent(title);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09157 2026-03-11 cs.AI 86%

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

基于TrustBench的安全代理行为实时信任验证

Tavishi Sharma, Vinayak Sharma, Pragya Sharma

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度

Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 83%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08853 2026-03-11 econ.GN q-fin.EC 82%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08036 2026-03-11 cs.DB 78%

Samyama: A Unified Graph-Vector Database with In-Database Optimization, Agentic Enrichment, and Hardware Acceleration

Samyama:一个统一的图-向量数据库,具有数据库内优化、代理增强和硬件加速

Madhulatha Mandarapu, Sandeep Kunkunuru

专题命中 Agent评测 :agentic(title,abstract)

AI总结 Samyama是一款统一的图-向量数据库,结合了数据库内优化、代理增强和硬件加速,通过Rust实现高性能和内存安全性。

Comments 16 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 77%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15943 2026-03-11 cs.AI 76%

Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning

小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型

Polaris Jhandi, Owais Kazi, Shreyas Subramanian, Neel Sendas

专题命中 Agent评测 :agentic(title,comments);分类 cs.AI

AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。

Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08640 2026-03-11 cs.SE cs.AI cs.LG 75%

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?

Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen, Matthias Bethge, Maksym Andriushchenko

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00718 2026-03-11 cs.CL cs.SE 73%

SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?

SkillCraft: 能否让大语言模型代理学会灵活使用工具?

Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 SkillCraft基准通过测试代理形成和重用高阶工具组合的能力,评估大语言模型在工具使用中的效率提升与技能积累。

Comments 21 pages. Code: https://github.com/shiqichen17/SkillCraft ; Project page: https://skillcraft-website.github.io/page

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08999 2026-03-11 cs.CR cs.AI 70%

MCP Bridge: A Lightweight, LLM-Agnostic RESTful Proxy for Model Context Protocol Servers

MCP Bridge:一种轻量级、LLM无关的RESTful代理,用于模型上下文协议服务器

Arash Ahmadi, Sarah Sharif, Yaser M. Banad

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 MCP Bridge是一种轻量级RESTful代理,通过统一API连接多个MCP服务器,支持任意后端,提升安全性和跨平台兼容性,优化模型在MCPToolBench++上取得73.0%的F1分数。

Comments 42 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09043 2026-03-11 cs.AI 70%

Time, Identity and Consciousness in Language Model Agents

时间、身份与语言模型代理的意识

Elija Perrier, Michael Timothy Bennett

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出一种基于时间间隙的框架,用于评估语言模型代理的身份持续性,通过分离成分发生与共存,建立身份形态空间并提供保守的评估工具。

Comments Accepted at AAAI 2026 Spring Symposium - Machine Consciousness: Integrating Theory, Technology, and Philosophy

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 70%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09452 2026-03-11 cs.CR cs.CL 57%

CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?

CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?

Xiangsen Chen, Xuan Feng, Shuo Chen, Matthieu Maitre, Sudipto Rakshit, Diana Duvieilh, Ashley Picone, Nan Tang

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。

Comments Accepted at TMLR

Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09331 2026-03-11 cs.LG 57%

Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning

Reward-Zero: 语言嵌入驱动的隐式奖励机制用于强化学习

Heng Zhang, Haddy Alchaer, Arash Ajoudani, Yu She

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 Reward-Zero通过语言嵌入驱动的隐式奖励机制,提升强化学习的样本效率、泛化能力和可扩展性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00172 2026-03-11 cs.CL 57%

DRBench: A Realistic Benchmark for Enterprise Deep Research

DRBench:企业深度研究的现实基准

Amirhossein Abaskohi, Tianyi Chen, Miguel Muñoz-Mármol, Curtis Fox, Amrutha Varshini Ramesh, Étienne Marcotte, Xing Han Lù, Nicolas Chapados, Spandana Gella, Peter West, Giuseppe Carenini, Christopher Pal, Alexandre Drouin, Issam H. Laradji

机构 * ServiceNow Research(ServiceNow 研究所) University of British Columbia(不列颠哥伦比亚大学) Mila – Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Polytechnique Montreal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 DRBench是一个针对企业深度研究任务的现实基准,通过多步骤查询评估AI代理在复杂问题中的表现,涵盖10个领域,验证不同模型和策略的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09569 2026-03-11 math.LO 50%

Ignorance with(out) Grasping

无知(与)抓取

Ekaterina Kubyshkina, Mattia Petrolo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种基于主题敏感语义学的框架,用于形式化和分析无知的不同形式,并通过重新解释逻辑全知问题来展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06959 2026-03-11 physics.soc-ph nlin.CD 50%

Discerning media bias within a network of political allies: an analytic condition for disruption by partisans

在政治盟友网络中辨别媒体偏见:一种用于党派破坏的分析条件

Jarra Horstman, Andrew Melatos, Farhad Farokhi

专题命中 Agent评测 :agent(abstract)

AI总结 研究在政治盟友网络中辨别媒体偏见的条件,通过概率框架分析党派分子对代理体观点的影响,推导出湍流非收敛与渐近学习的区分条件。

Comments 37 pages, 8 figures

Journal ref Physica A: Statistical Mechanics and its Applications Volume 673, 1 September 2025, 130679

详情

展开后加载摘要…

URL PDF HTML 收藏