ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents
ClawTrack:面向真实世界智能体的追踪级评估与改进
机构 * Meituan(美团)
AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。
大厂专区
ClawTrack:面向真实世界智能体的追踪级评估与改进
机构 * Meituan(美团)
AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。
元任务:将终端任务综合转化为可扩展智能体训练的终端任务
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 Meta-Task框架将终端任务综合转化为Terminal-Bench格式任务,通过多阶段机制等提升任务质量,生成3221条轨迹微调Qwen3系列模型,效果优于同期方法且训练数据更少。
Comments 17 pages, 5 figures