AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
AgentGym2:在去理想化真实世界环境中评测大语言模型智能体
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghaijiaotong University(上海交通大学) ; Peking University(北京大学)
AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。
Comments Accepted as a main conference paper at ACL 2026