Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning
先规划正确,再规划紧凑:面向高效具身推理的符号强化学习
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯) ; University of London(伦敦大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract)
AI总结 针对具身任务规划中缺乏低成本确定性验证的问题,提出基于BDDL规范的符号强化学习框架,通过视频解析、LLM验证和轻量符号引擎提供毫秒级密集反馈,并引入难度感知长度调度GroupAdapt,在BEHAVIOR-1000上实现97.3的严格通过率,相对Qwen3-8B提升25.9%。
Comments 18 pages, 10 figures, 14 tables; includes appendix