arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-11 至 2026-03-11 共收录 136 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 20 篇

2603.08853 2026-03-11 econ.GN q-fin.EC 82%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08036 2026-03-11 cs.DB 78%

Samyama: A Unified Graph-Vector Database with In-Database Optimization, Agentic Enrichment, and Hardware Acceleration

Samyama:一个统一的图-向量数据库,具有数据库内优化、代理增强和硬件加速

Madhulatha Mandarapu, Sandeep Kunkunuru

专题命中 Agent评测 :agentic(title,abstract)

AI总结 Samyama是一款统一的图-向量数据库,结合了数据库内优化、代理增强和硬件加速,通过Rust实现高性能和内存安全性。

Comments 16 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 77%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15943 2026-03-11 cs.AI 76%

Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning

小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型

Polaris Jhandi, Owais Kazi, Shreyas Subramanian, Neel Sendas

专题命中 Agent评测 :agentic(title,comments);分类 cs.AI

AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。

Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08640 2026-03-11 cs.SE cs.AI cs.LG 75%

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?

Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen, Matthias Bethge, Maksym Andriushchenko

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00718 2026-03-11 cs.CL cs.SE 73%

SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?

SkillCraft: 能否让大语言模型代理学会灵活使用工具?

Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 SkillCraft基准通过测试代理形成和重用高阶工具组合的能力,评估大语言模型在工具使用中的效率提升与技能积累。

Comments 21 pages. Code: https://github.com/shiqichen17/SkillCraft ; Project page: https://skillcraft-website.github.io/page

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08999 2026-03-11 cs.CR cs.AI 70%

MCP Bridge: A Lightweight, LLM-Agnostic RESTful Proxy for Model Context Protocol Servers

MCP Bridge:一种轻量级、LLM无关的RESTful代理,用于模型上下文协议服务器

Arash Ahmadi, Sarah Sharif, Yaser M. Banad

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 MCP Bridge是一种轻量级RESTful代理,通过统一API连接多个MCP服务器,支持任意后端,提升安全性和跨平台兼容性,优化模型在MCPToolBench++上取得73.0%的F1分数。

Comments 42 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09043 2026-03-11 cs.AI 70%

Time, Identity and Consciousness in Language Model Agents

时间、身份与语言模型代理的意识

Elija Perrier, Michael Timothy Bennett

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出一种基于时间间隙的框架,用于评估语言模型代理的身份持续性,通过分离成分发生与共存,建立身份形态空间并提供保守的评估工具。

Comments Accepted at AAAI 2026 Spring Symposium - Machine Consciousness: Integrating Theory, Technology, and Philosophy

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 70%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09452 2026-03-11 cs.CR cs.CL 57%

CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?

CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?

Xiangsen Chen, Xuan Feng, Shuo Chen, Matthieu Maitre, Sudipto Rakshit, Diana Duvieilh, Ashley Picone, Nan Tang

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。

Comments Accepted at TMLR

Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09331 2026-03-11 cs.LG 57%

Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning

Reward-Zero: 语言嵌入驱动的隐式奖励机制用于强化学习

Heng Zhang, Haddy Alchaer, Arash Ajoudani, Yu She

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 Reward-Zero通过语言嵌入驱动的隐式奖励机制,提升强化学习的样本效率、泛化能力和可扩展性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00172 2026-03-11 cs.CL 57%

DRBench: A Realistic Benchmark for Enterprise Deep Research

DRBench:企业深度研究的现实基准

Amirhossein Abaskohi, Tianyi Chen, Miguel Muñoz-Mármol, Curtis Fox, Amrutha Varshini Ramesh, Étienne Marcotte, Xing Han Lù, Nicolas Chapados, Spandana Gella, Peter West, Giuseppe Carenini, Christopher Pal, Alexandre Drouin, Issam H. Laradji

机构 * ServiceNow Research(ServiceNow 研究所) University of British Columbia(不列颠哥伦比亚大学) Mila – Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Polytechnique Montreal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 DRBench是一个针对企业深度研究任务的现实基准,通过多步骤查询评估AI代理在复杂问题中的表现,涵盖10个领域,验证不同模型和策略的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09569 2026-03-11 math.LO 50%

Ignorance with(out) Grasping

无知(与)抓取

Ekaterina Kubyshkina, Mattia Petrolo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种基于主题敏感语义学的框架,用于形式化和分析无知的不同形式,并通过重新解释逻辑全知问题来展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06959 2026-03-11 physics.soc-ph nlin.CD 50%

Discerning media bias within a network of political allies: an analytic condition for disruption by partisans

在政治盟友网络中辨别媒体偏见:一种用于党派破坏的分析条件

Jarra Horstman, Andrew Melatos, Farhad Farokhi

专题命中 Agent评测 :agent(abstract)

AI总结 研究在政治盟友网络中辨别媒体偏见的条件,通过概率框架分析党派分子对代理体观点的影响,推导出湍流非收敛与渐近学习的区分条件。

Comments 37 pages, 8 figures

Journal ref Physica A: Statistical Mechanics and its Applications Volume 673, 1 September 2025, 130679

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2603.09209 2026-03-11 cs.AI 57%

Abundant Intelligence and Deficient Demand: A Macro-Financial Stress Test of Rapid AI Adoption

过剩智能与匮乏需求:快速AI采纳的宏观金融压力测试

Xupeng Chen

机构 * Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系)

专题命中 其他Agent :AI agent(abstract);分类 cs.AI

AI总结 本文提出快速AI采纳的宏观金融压力测试,揭示AI生成的过剩与需求匮乏并存的机制,通过三种传导路径分析其对金融系统的影响,并提出可检验的预测与模拟条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09020 2026-03-11 cs.HC cs.AI 57%

AI Phenomenology for Understanding Human-AI Experiences Across Eras

人工智能现象学:理解跨时代的以人为本的AI体验

Bhada Yun, Evgenia Taranova, Dana Feng, Renn Su, April Yi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) University of Bergen(卑尔根大学) Stanford University(斯坦福大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文提出人工智能现象学,通过研究用户与AI交互的主观体验,促进双向人机对齐,并提供可重复的方法论工具。

Comments This is an accepted workshop paper at CHI '26, "W37: Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures", or https://bialign-workshop.github.io/2026/cfp

详情

展开后加载摘要…

URL PDF HTML 收藏