Learning to Present: Inverse Specification Rewards for Agentic Slide Generation
学习呈现:用于代理幻灯片生成的逆规范奖励
机构 * Tavus Inc.(Tavus公司) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Texas A&M University(德克萨斯农工大学)
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI
AI总结 本文提出一个兼容OpenEnv的强化学习环境,通过工具使用训练LLM代理生成专业HTML幻灯片,引入多组件奖励系统,包括结构验证、渲染质量评估、LLM审美评分、内容质量指标和逆规范奖励,实验显示细调模型在质量与工具使用合规性上表现优异。
Comments 12 pages, 11 figures, 13 tables, 26 references. Code: https://github.com/pushing-the-frontier/slide-forge-llm Dataset: https://huggingface.co/datasets/KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts