Efficient Benchmarking of AI Agents
高效评估AI代理
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI
AI总结 本文研究通过小任务子集降低评估成本,保持代理排名稳定,提出基于项目反应理论的中间难度筛选方法,提升排名可靠性。
Comments 22 pages, 7 figures, 5 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
高效评估AI代理
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI
AI总结 本文研究通过小任务子集降低评估成本,保持代理排名稳定,提出基于项目反应理论的中间难度筛选方法,提升排名可靠性。
Comments 22 pages, 7 figures, 5 tables
AgentRFC:关于智能体协议的安全设计原则与合规性测试
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);autonomous agent(abstract)
AI总结 本文提出AgentProtocolStack、Agent-AgnosticSecurityModel和AgentConform,旨在为智能体协议提供系统性的安全框架,解决协议合规性测试问题,并揭示协议组合时的安全隐患。
关于代理评估中的随机性
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究通过分析6万条轨迹发现单次运行的pass@1分数存在显著波动,建议采用多轮运行、统计分析和多指标评估以提高代理系统评估的可靠性。
仅依靠投入产出表进行宏观经济预测:一种达尔文式基于代理的模拟方法与FIGARO数据
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出利用达尔文式基于代理的模拟方法,仅通过投入产出表进行宏观经济预测,展示了其在不同国家的准确性和跨国家的可移植性,以及对经济冲击的传播机制。
Comments 50 pages, 6 figures, 10 tables
GTO Wizard 评估基准
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。
对话到问题生成用于基于证据的医疗指南代理开发
机构 * Google Research(谷歌研究) ; University of Toronto(多伦多大学) ; Vector Institute Canada(加拿大向量研究所) ; Emory University(埃默里大学)
专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG
AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。
Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025
Journal ref Proceedings of Machine Learning Research 2025
CUA-Suite:大规模人工标注的视频演示用于计算机使用代理
机构 * ServiceNow ; University of Waterloo(多伦多大学) ; Mila ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。
Comments Project Page: https://cua-suite.github.io/
AI预言家:将萨满与AI并置,揭示人工智能时代的主体性
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 本文通过展示参与者与AI职业咨询代理互动的视频,揭示参与者在得知回复源自韩国传统萨满后对建议态度的转变,探讨人工智能可解释性与准确性的认知问题。
Comments Disclaimer: This document is an unofficial commentary on AI Fortune-Teller by its creators. While the work was introduced and received an Honorary Mention at Prix Ars Electronica 2024, this document is not an officially published or affiliated record of the festival
双时间尺度学习动态:神经网络训练的群体视角
机构 * Maxwell Institute for Mathematical Sciences and School of Mathematical and Computer Sciences Heriot–Watt University, Edinburgh, UK(麦克斯韦数学科学研究所和赫里奥特-沃特大学数学与计算机科学学院,爱丁堡,英国) ; Department of Mathematics and Computer Science University of Ferrara, Italy(费拉拉大学数学与计算机科学系)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出基于双时间尺度群体动态的理论框架,分析神经网络训练中参数与超参数的演化机制,揭示群体学习与双层优化的关系,并探讨噪声与多样性在优化与探索中的作用。
CryptoAnalystBench: 多工具长文本LLM分析中的失败
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本文提出CryptoAnalystBench,通过198个加密和DeFi查询评估多工具LLM在复杂输入中的表现,揭示七类高阶错误类型,并提供评估框架和缓解策略。
GraphIF: 通过关系图提示增强大语言模型的多轮指令遵循
机构 * Zhenhe Li 1(李振和1) ; Can Lin 1(林灿1) ; Ling Zheng 1(郑凌1) ; Wen-Da Wei 2(韦文达2) ; Junli Liang 1(梁俊利1) ; Qi Song 1(宋琪1)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 GraphIF通过构建关系图结构,利用图提示提升大语言模型的多轮指令遵循能力,实验表明其在多轮对话评估指标上表现优异。
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI-2026)
关于具有整数选择函数的稳定伙伴关系问题
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了稳定伙伴关系问题的扩展形式,提出了一种求解稳定解的算法,并探讨了整数选择函数在非二分图中的应用。
Comments 25 pages, 1 figure
社会网络中共演的意见领袖模型研究
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出一种动态系统,探讨意见与领导力在社会网络中的共演机制,扩展了Friedkin-Johnsen框架,分析了领导力与说服力的平衡关系及收敛条件。
Comments 8 pages, 6 figures
自助学习分析工具的可用性评估与改进
专题命中 Agent评测 :workflow(abstract)
AI总结 本文评估并改进了用于创建学习分析指标的无代码SSLA工具,通过用户研究和原型评估,提出设计改进方案以提升工具的可用性。
Comments Paper accepted at CSEDU 2026
人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估
专题命中 Agent评测 :agentic(abstract)
AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。
VILLA:利用大语言模型从科学文献中进行多用途信息检索
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出VILLA框架,通过构建病毒突变提取任务,解决复杂开放任务中科学信息提取的挑战,展示其在信息检索中的优越性能。
Comments Under review at ACM KDD 2026 (AI for Sciences Track)
近似振幅编码与自适应插值量子变换
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出自适应插值量子变换用于稀疏振幅编码,通过学习数据自适应基底提升信息保留度和重建精度,实验证明在金融时间序列和图像数据集上分别降低40%和50%的重建误差,同时保持高效性。
Comments 12 pages, 7 figures, 3 tables
AURORA:通过递归适应实现ROM和控制器的自主更新
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出AURORA框架,通过递归适应实现高维非线性系统ROM控制器的自动更新,结合诊断触发的结构适应,五种专用代理协作迭代生成、判断、修订,通过性能退化分类实现纠正措施,实验表明其在跟踪精度上优于专家基线和经典自适应方法。