ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
ArbiGraph:用于评估上下文管理的任意可扩展可验证任务图
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
AI总结 ArbiGraph作为基准生成器,将任务表示为带Python求解器的自然语言问题,通过类型化中间状态组合任务。用多种任务类别实例化并评估智能体,发现其在孤立任务和复杂相关任务上表现不同,揭示了单任务评估无法发现的问题。