From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents
从相关性到执行效用:面向基于技能的大语言模型智能体的奖励感知动态执行门控
机构 * Tongji University(同济大学) ; The University of Sydney(悉尼大学) ; University of Science and Technology of China(中国科学技术大学) ; Nankai University(南开大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City University of Hong Kong(香港城市大学) ; University of Surrey(萨里大学)
AI总结 针对基于技能的LLM智能体执行决策难题,提出RADEG轻量型决策层,通过学习代理模型预测执行效用,在288个rollout的评估中减少不必要执行并优于基线方法