CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考
机构 * Georgia Tech(佐治亚理工学院) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Microsoft(微软公司)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。
Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/