RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
RTPO:用于稳定智能体强化学习训练的反向回合策略优化
Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu
机构
*
Adelaide University(阿德莱德大学)
;
The University of Sydney(悉尼大学)
;
Curtin University(科廷大学)
;
School of CSIT(计算机科学与信息技术学院)
;
ACFR(澳大利亚空间研究中心)
;
School of EECMS(电子工程、计算机与数学科学学院)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室)
;
Tianjin University(天津大学)
;
Institute of Computing and Intelligence(计算与智能研究所)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)
;
Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院)
;
School of Future Technology(未来技术学院)
;
Shanghai University(上海大学)
Comments15 pages. Submitted to Formal Methods for Autonomous Systems 2026 (FMAS 2026). Reproducibility artefact: DOI https://doi.org/10.5281/zenodo.21981425
机构
*
Zhejiang University \& Northwestern Polytechnical University China
;
Northwestern Polytechnical University China
;
Nantong University China
;
Zhejiang University China
;
Monash University Australia
;
Singapore Management University Singapore
;
Zhejiang University \& Northwestern Polytechnical University
;
Northwestern Polytechnical University
;
Nantong University
;
Zhejiang University
;
Monash University
;
Singapore Management University
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments11 pages, 3 figures. Extended English version of an earlier two-study Spanish-language paper published in Neutrosophic Computing and Machine Learning (2026); this version adds Study 3 (journal x institution prestige) and bootstrap confidence intervals throughout