CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs
CARL:用于大语言模型规划的约束感知强化学习
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; City University of Hong Kong(香港城市大学) ; College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) ; School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。
Comments ACL 2026 Findings