arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-26 至 2026-03-26 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2603.23749 2026-03-26 cs.AI 85%

Efficient Benchmarking of AI Agents

高效评估AI代理

Franck Ndzomga

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文研究通过小任务子集降低评估成本,保持代理排名稳定,提出基于项目反应理论的中间难度筛选方法,提升排名可靠性。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23801 2026-03-26 cs.CR 85%

AgentRFC: Security Design Principles and Conformance Testing for Agent Protocols

AgentRFC:关于智能体协议的安全设计原则与合规性测试

Shenghan Zheng, Qifan Zhang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出AgentProtocolStack、Agent-AgnosticSecurityModel和AgentConform,旨在为智能体协议提供系统性的安全框架,解决协议合规性测试问题,并揭示协议组合时的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07150 2026-03-26 cs.LG cs.AI cs.SE 82%

On Randomness in Agentic Evals

关于代理评估中的随机性

Bjarni Haukur Bjarnason, André Silva, Martin Monperrus

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究通过分析6万条轨迹发现单次运行的pass@1分数存在显著波动,建议采用多轮运行、统计分析和多指标评估以提高代理系统评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12412 2026-03-26 econ.GN q-fin.EC 78%

Macroeconomic Forecasting from Input-Output Tables Alone: A Darwinian Agent-Based Approach with FIGARO Data

仅依靠投入产出表进行宏观经济预测:一种达尔文式基于代理的模拟方法与FIGARO数据

Martin Jaraiz

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出利用达尔文式基于代理的模拟方法,仅通过投入产出表进行宏观经济预测,展示了其在不同国家的准确性和跨国家的可移植性,以及对经济冲击的传播机制。

Comments 50 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 77%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23937 2026-03-26 cs.CL cs.LG 76%

Dialogue to Question Generation for Evidence-based Medical Guideline Agent Development

对话到问题生成用于基于证据的医疗指南代理开发

Zongliang Ji, Ziyang Zhang, Xincheng Tan, Matthew Thompson, Anna Goldenberg, Carl Yang, Rahul G. Krishnan, Fan Zhang

机构 * Google Research(谷歌研究) University of Toronto(多伦多大学) Vector Institute Canada(加拿大向量研究所) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG

AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。

Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025

Journal ref Proceedings of Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 73%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23811 2026-03-26 cs.HC 67%

AI Fortune-Teller: Juxtaposing Shaman and AI to Reveal Human Agency in the Age of AI

AI预言家:将萨满与AI并置,揭示人工智能时代的主体性

Soonho Kwon, Dong Whi Yoo, Younah Kang

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文通过展示参与者与AI职业咨询代理互动的视频,揭示参与者在得知回复源自韩国传统萨满后对建议态度的转变,探讨人工智能可解释性与准确性的认知问题。

Comments Disclaimer: This document is an unofficial commentary on AI Fortune-Teller by its creators. While the work was introduced and received an Honorary Mention at Prix Ars Electronica 2024, this document is not an officially published or affiliated record of the festival

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19808 2026-03-26 cs.LG math.AP stat.ML 57%

Two-Time-Scale Learning Dynamics: A Population View of Neural Network Training

双时间尺度学习动态:神经网络训练的群体视角

Giacomo Borghi, Hyesung Im, Lorenzo Pareschi

机构 * Maxwell Institute for Mathematical Sciences and School of Mathematical and Computer Sciences Heriot–Watt University, Edinburgh, UK(麦克斯韦数学科学研究所和赫里奥特-沃特大学数学与计算机科学学院,爱丁堡,英国) Department of Mathematics and Computer Science University of Ferrara, Italy(费拉拉大学数学与计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于双时间尺度群体动态的理论框架,分析神经网络训练中参数与超参数的演化机制,揭示群体学习与双层优化的关系,并探讨噪声与多样性在优化与探索中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11304 2026-03-26 cs.IR cs.AI cs.CR 57%

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

CryptoAnalystBench: 多工具长文本LLM分析中的失败

Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出CryptoAnalystBench,通过198个加密和DeFi查询评估多工具LLM在复杂输入中的表现,揭示七类高阶错误类型,并提供评估框架和缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10051 2026-03-26 cs.CL 57%

GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt

GraphIF: 通过关系图提示增强大语言模型的多轮指令遵循

Zhenhe Li, Can Lin, Ling Zheng, Wen-Da Wei, Junli Liang, Qi Song

机构 * Zhenhe Li 1(李振和1) Can Lin 1(林灿1) Ling Zheng 1(郑凌1) Wen-Da Wei 2(韦文达2) Junli Liang 1(梁俊利1) Qi Song 1(宋琪1)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GraphIF通过构建关系图结构,利用图提示提升大语言模型的多轮指令遵循能力,实验表明其在多轮对话评估指标上表现优异。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24433 2026-03-26 math.CO 50%

On a stable partnership problem with integer choice functions

关于具有整数选择函数的稳定伙伴关系问题

Alexander V. Karzanov

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了稳定伙伴关系问题的扩展形式,提出了一种求解稳定解的算法,并探讨了整数选择函数在非二分图中的应用。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24381 2026-03-26 physics.soc-ph cs.SY eess.SY 50%

On a Co-evolving Opinion-Leadership Model in Social Networks

社会网络中共演的意见领袖模型研究

Martina Alutto, Lorenzo Zino, Karl H. Johansson, Angela Fontan

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种动态系统,探讨意见与领导力在社会网络中的共演机制,扩展了Friedkin-Johnsen框架,分析了领导力与说服力的平衡关系及收敛条件。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24321 2026-03-26 cs.CY 50%

Usability Evaluation and Improvement of a Tool for Self-Service Learning Analytics

自助学习分析工具的可用性评估与改进

Shoeb Joarder, Mohamed Amine Chatti, Louis Born

专题命中 Agent评测 :workflow(abstract)

AI总结 本文评估并改进了用于创建学习分析指标的无代码SSLA工具,通过用户研究和原型评估,提出设计改进方案以提升工具的可用性。

Comments Paper accepted at CSEDU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 50%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23849 2026-03-26 cs.IR 50%

VILLA: Versatile Information Retrieval From Scientific Literature Using Large LAnguage Models

VILLA:利用大语言模型从科学文献中进行多用途信息检索

Blessy Antony, Amartya Dutta, Sneha Aggarwal, Vasu Gatne, Ozan Gökdemir, Samantha Grimes, Adam Lauring, Brian R. Wasik, Anuj Karpatne, T. M. Murali

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出VILLA框架,通过构建病毒突变提取任务,解决复杂开放任务中科学信息提取的挑战,展示其在信息检索中的优越性能。

Comments Under review at ACM KDD 2026 (AI for Sciences Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03803 2026-03-26 quant-ph 50%

Approximate Amplitude Encoding with the Adaptive Interpolating Quantum Transform

近似振幅编码与自适应插值量子变换

Gekko Budiutama, Shunsuke Daimon, Xinchi Huang, Hirofumi Nishi, Yu-ichiro Matsushita

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出自适应插值量子变换用于稀疏振幅编码,通过学习数据自适应基底提升信息保留度和重建精度,实验证明在金融时间序列和图像数据集上分别降低40%和50%的重建误差,同时保持高效性。

Comments 12 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07768 2026-03-26 eess.SY cs.SY 50%

AURORA: Autonomous Updating of ROM and Controller via Recursive Adaptation

AURORA:通过递归适应实现ROM和控制器的自主更新

Jiachen Li, Shihao Li, Dongmei Chen

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出AURORA框架,通过递归适应实现高维非线性系统ROM控制器的自动更新,结合诊断触发的结构适应,五种专用代理协作迭代生成、判断、修订,通过性能退化分类实现纠正措施,实验表明其在跟踪精度上优于专家基线和经典自适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏