TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning
TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包
机构 * The Chinese University of Hong Kong(香港中文大学) ; Macao Polytechnic University(澳门理工大学)
AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。
Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning