Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning
通过不确定性对齐强化学习探索智能体工具调用决策
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对智能体工具调用中错误累积问题,提出TRUST方法,将不确定性量化作为排斥力融入奖励设计,并标注轻量关键轮次用于多轮轨迹统一后训练,显著提升决策质量与智能体性能。