Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs
双轨CoT:面向小语言模型的预算感知逐步引导
专题命中 测试时计算 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出双轨CoT方法,旨在通过预算感知的逐步引导提升小语言模型的多步推理能力,解决传统方法在计算和token预算限制下的性能瓶颈。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
双轨CoT:面向小语言模型的预算感知逐步引导
专题命中 测试时计算 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出双轨CoT方法,旨在通过预算感知的逐步引导提升小语言模型的多步推理能力,解决传统方法在计算和token预算限制下的性能瓶颈。
更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL
机构 * Gena Co.(Gena公司) ; Cornell University(康奈尔大学)
专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。
一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southeast University(东南大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。
Comments Accepted to ACL26
大语言模型输出的令人惊讶的普遍性:一种实时验证原语
机构 * Evolutionairy AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 研究发现大语言模型输出的词频分布符合Mandelbrot分布,提出一种无需GPU的快速验证方法,用于模型指纹识别和黑盒输出评估。
Comments 25 pages, 6 figures, 6 tables, 37 references. Code and data: https://github.com/Evolutionairy-AI/Ranking-Inference