Look Before You Leap: Autonomous Exploration for LLM Agents
先看再跳:面向LLM代理的自主探索
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。
大厂专区
先看再跳:面向LLM代理的自主探索
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。
生成长期用户兴趣建模用于点击通过率预测
机构 * MeiTuan Beijing China(美团北京中国)
AI总结 本文提出GenLI模型,通过生成兴趣模块、行为检索模块和兴趣融合模块,提升CTR预测的准确性和效率,解决传统方法中长期兴趣建模不完整和效率低的问题。
SKILL0:基于上下文的代理强化学习用于技能内化
机构 * Zhejiang University(浙江大学) ; Meituan(美团) ; Tsinghua University(清华大学)
AI总结 SKILL0通过在训练时逐步减少技能上下文,使模型在无任务检索情况下实现自主行为,实验显示在多个任务中性能提升显著。