Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
在黑暗中寻求:通过测试时实例级策略梯度进行潜在空间推理
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; NLCo Lab, Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院NLCo实验室) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Shanghai Jiao Tong University(上海交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LatentSeek通过测试时实例级策略梯度在潜在空间中提升LLM推理能力,展现高效且可扩展的性能。