2604.21199
2026-05-04
cs.LG
cs.CV
ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response
ARFBench: 用于软件事件响应的时间序列问题回答能力基准测试
Stephan Xie, Ben Cohen, Mononito Goswami, Junhong Shen, Emaad Khwaja, Chenghao Liu, David Asker, Othmane Abou-Amal, Ameet Talwalkar
机构
*
Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系)
;
Datadog AI Research(Datadog AI研究)
;
Amazon Web Services(亚马逊网络服务)
AI总结
本文提出ARFBench基准测试,评估多模态基础模型对软件事件数据中时间序列异常的理解能力,发现前沿VLM表现优异,提出混合模型并建立模型-专家 oracle,达到超人类水平。