Learning to Rank Chain-of-Thought: Using a Small Model
专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);verifier(abstract)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);verifier(abstract)
机构 * Huawei Advanced Computing and Storage Lab(华为高级计算与存储实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
基于验证器的热能存储控制推理模型强化微调
机构 * The University of Tokyo(东京大学) ; Tokyo University of Science(东京理科大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title);planning(abstract);分类 cs.LG
AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。
Comments 29 pages, 8 figures
引导验证器:通过动态过程监督实现协作多模态推理
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL
AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。
PaCoRe: 通过并行协调推理学习扩展测试时间计算
机构 * StepFun ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.LG
AI总结 PaCoRe通过并行协调推理框架,实现大规模测试时间计算扩展,提升数学推理能力至94.5%
通过情感推理验证器实现多模态大语言模型的情感一致性推理
机构 * Corresponding author(通讯作者)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI
AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。
Comments 15 pages, 11 figures
xVerify:用于推理模型评估的高效答案验证器
机构 * China Telecom Research Institute(中国电信研究院) ; MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司) ; College of Software, Nankai University(南开大学软件学院) ; Center for Data Science, Peking University(北京大学数据科学中心) ; Peking University(北京大学) ; Data Development Center of China Telecom(中国电信数据开发中心)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL
AI总结 xVerify是一种高效答案验证器,通过VAR数据集训练,能够准确评估推理模型的等价性判断和最终答案提取,实验表明其在多个任务中表现优异。
Comments 35 pages
机构 * UIUC(伊利诺伊大学香槟分校) ; Princeton University(普林斯顿大学) ; Cornell University(康奈尔大学) ; ByteDance(字节跳动)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL
Comments Accepted by NeurIPS 2025. Project: https://github.com/Gen-Verse/ReasonFlux
机构 * TogetherAI ; Cornell University(康奈尔大学) ; University of Geneva(日内瓦大学) ; Princeton University(普林斯顿大学)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);chain-of-thought(abstract);分类 cs.LG
Comments Code is available https://github.com/jxiw/M1
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Kuaishou Technology(快手科技) ; Zhejiang University(浙江大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Alibaba International Group(阿里巴巴国际集团) ; Division of AMC and Department of ECE, HKUST(HKUST电子工程系与AMC division)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL
Comments 19 pages, 9 figures, Project Link: https://github.com/HITsz-TMG/VerIPO
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL
AdaThink-Med:通过不确定性量化优化医学推理的推理时计算
机构 * SJTU(上海交通大学) ; SII(上海信息所) ; Shanghai AI Lab(上海人工智能实验室) ; FDU(复旦大学)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AdaThink-Med框架,通过不确定性引导长度校准优化医学推理的推理时计算,在六大医学基准上降低4.7-6.4倍推理token消耗且性能损失极小,无需外部分类器即可实现资源高效分配。
RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯
机构 * Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。
CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考
机构 * Georgia Tech(佐治亚理工学院) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Microsoft(微软公司)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。
Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/
通过前缀一致性提升可靠性的链式思维
机构 * Nagoya University(名古屋大学) ; Nara Institute of Science and Technology(奈良科学技術大學) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; RIKEN AIP(理化学研究所(AIP))
专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通过前缀一致性来提升链式思维的可靠性,利用再生过程中答案的重复频率作为权重,无需访问token对数概率或自我评价提示,在多个模型和基准测试中表现出色,减少至21倍的token使用量。
Comments See our project page at https://naoto-iwase.github.io/prefix-consistency-page
更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL
机构 * Gena Co.(Gena公司) ; Cornell University(康奈尔大学)
专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);math reasoning(abstract);verifier(abstract)
ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理
机构 * LMU Munich(慕尼黑大学) ; Harvard University(哈佛大学) ; University of Cambridge(剑桥大学) ; Mina AI ; Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))
专题命中 测试时计算 :reasoning(title,abstract);logical reasoning(abstract,comments);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。
Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure
基于证据的Actor-验证者推理用于超声波代理
机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; Southwest Jiaotong University(西南交通大学) ; Purdue University(普渡大学) ; Chengdu University of Information Technology(成都信息工程大学) ; Harvard Medical School(哈佛医学院) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract)
AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。
Comments cvprw 2026(AIMS)
StructReward:用于自修正多模态推理的高效结构化过程奖励
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);self-correction(abstract)
AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。
Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally
理解并缓解过早自信以提升大语言模型推理能力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);test-time compute(abstract);分类 cs.AI
AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。
CritiqueDriveVLM:从验证器引导的强化学习到自动驾驶的潜在思想蒸馏
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; School of Digital Media & Design Arts(数字媒体与设计艺术学院) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 提出CritiqueDriveVLM框架解决自动驾驶中推理幻觉等问题,先通过验证器引导的强化学习培养强大教师模型,再用潜在思想蒸馏压缩能力到学生模型,提升性能并大幅降低推理延迟。
Comments Accepted by ECCV 2026
深入思考,而非仅靠长度:通过深度思考令牌测量大语言模型推理工作量
机构 * University of Virginia(弗吉尼亚大学) ; Google(谷歌)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)
AI总结 研究通过识别深度思考令牌量化推理时间工作量,在多个基准和模型上验证深度思考比例与准确率正相关,据此引入Think@n策略提升推理效率并降低成本。
Comments Accepted to ICML 2026
停止奖励幻觉步骤:面向小型推理模型的忠实感知步骤级强化学习
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) ; Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(中国电信人工智能研究院) ; College of Integrated Circuits, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学集成电路学院) ; Zhongguancun Academy, Beijing, China(中关村学院)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 针对小型推理模型在中间推理步骤中容易产生忠实性幻觉的问题,提出忠实感知步骤级强化学习(FaithRL),通过过程奖励模型提供步骤级监督和隐式截断重采样策略,减少幻觉并提高推理可靠性。
通过层交换重新思考多语言推理差距
机构 * LightOn ; Inria(法国国家科学研究中心)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 本文通过构建多语言推理数据集并微调专家模型,发现本地推理与英语枢轴推理的性能差距远小于先前报道,并提出层交换方法将英语专家的推理中间层迁移到本地专家,以缩小差距。
潜在的链式思维提升结构化数据转换器
专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);test-time compute(abstract)
AI总结 本文研究了链式思维对时间序列和表格数据的影响,并提出了一种递归方案,通过压缩查询位置的隐藏状态生成反馈标记,从而在预测前进行多次潜在计算,从而提升结构化数据转换器的性能。
interwhen:一种可泛化的引导推理模型进行测试时验证的框架
机构 * Microsoft Research(微软研究院) ; IIT Bombay(印度理工学院班加罗尔分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Arizona State University(亚利桑那州立大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(summary_cn,abstract);分类 cs.AI
AI总结 interwhen提出一种单轨迹验证框架,通过反馈中间推理轨迹引导模型行为,解决验证状态获取和 verifier 缺乏的问题,提升推理代理的任务完成和政策合规性。
Comments 56 pages, 6 figures
OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型
机构 * Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。
解码多图像理解任务中推理视觉语言模型的脉冲
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。
Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work