STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO
STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误
机构 * Guangdong University of Finance and Economics(广东财经大学) ; Chongqing University(重庆大学) ; Westlake University(西湖大学) ; The University of Hong Kong(香港大学)
专题命中 偏好对齐 :alignment(title);DPO(title)
AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。
Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026