Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle
像真正的研究者一样行动:一套评估前沿LLM和研究生命周期中智能体框架的基准测试套件
机构 * Xi’an Jiaotong University(西安交通大学) ; Xidian University(西安电子科技大学)
AI总结 提出AARR基准系列,通过AARRI-Bench评估智能体在细粒度研究场景中模拟人类研究者的专业性、全面性和细微推理能力,发现最佳配置成功率仅68.3%。