Prompting Test-Time Scaling Is A Strong LLM Reasoning Data Augmentation
机构 * MBZUAI
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Our code and data are available at https://github.com/VILA-Lab/PTTS
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * MBZUAI
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Our code and data are available at https://github.com/VILA-Lab/PTTS
机构 * Nanyang Technological University(南洋理工大学) ; DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 18 pages, 5 figures, Project website: https://shengliu66.github.io/fractreason/
机构 * Department of Electrical Engineering and Computer Science, MIT(麻省理工学院电气工程与计算机科学系) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * King’s College London(伦敦国王学院) ; The Alan Turing Institute(艾伦·图灵研究所) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 pages, 5 tables, 12 figures. accepted to EMNLP 2025
机构 * Google(谷歌)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :verifier(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref International Conference on Autonomous Agents and Multiagent Systems 2024
原生推理模型:训练语言模型在不可验证数据上进行推理
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。
Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models
机构 * UC Berkeley(加州大学伯克利分校) ; UCSF(旧金山大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Accepted at COLM 2025. Code, model, and data are available at https://github.com/Parallel-Reasoning/APR. The first three authors contributed equally to this work
大语言模型中的早期停止思维链
机构 * University of Delaware(德克萨斯大学) ; Peking University(北京大学)
专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种在推理阶段减少思维链生成长度的方法ES-CoT,通过检测答案收敛并提前停止来降低推理成本,同时保持与标准思维链相当的准确性。
面向高效测试时推理的声明级可靠性评估
机构 * Sina Weibo Inc.(新浪微博公司)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出无需训练的CLR框架,将测试时计算从解决方案采样重分配至声明级语义证伪,在匹配预算下于四个LLM及四个推理基准上提升了推理性能,减少了标记使用量。
SpecRoll:用于投机强化学习rollout的快慢校验器反馈自适应方法
机构 * VNU University of Engineering and Technology(越南国家大学河内理工大学) ; Viettel AI(越南电信人工智能公司)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 SpecRoll是一种投机强化学习rollout引擎,通过快慢双时间尺度自适应结合相关校验机制,在5个1.5B-14B模型和3个数学推理数据集上,相比普通GRPO和FastGRPO实现了生成与端到端速度的显著提升。
作为陪审团的语言模型:跨模型共识在语言模型推理方面可超越过程奖励模型
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究在语言模型推理中从候选推理链选正确答案的问题,提出跨模型共识方法,将其视为语言模型陪审团,通过错误去相关机制工作,在多个基准测试中表现出色,能预先表征,有定律和下限。
思维叙述:大型语言模型中可废止伦理推理的推理时支架
机构 * Department of Computer Science(计算机科学系) ; University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。
Comments 24 pages, 8 figures, 16 tables
最优自一致性:用于大语言模型高效推理
机构 * Yale University(耶鲁大学) ; Inria(法国国家信息与自动化研究所) ; com(42.com)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文分析自一致性(SC)的缩放行为,提出动态分配样本的Blend-ASC变体,平均减少4.8倍样本量,实现最先进的样本效率。
Comments Accepted at ICML 2026
PolicyGuard: 一种基于对话的子代理验证器,用于确保LLM代理遵循策略
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出PolicyGuard子代理验证器,通过共享对话上下文、策略推理和可操作反馈,在tau²-BENCH航空数据集上使PASS4提升12个百分点,同时误拦率降低约一半。
Comments 20 pages, 8 figures
CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。
Comments Code: https://github.com/ashwinn-v/CalVerT
UniT:统一多模态思维链测试时扩展
机构 * Stanford University(斯坦福大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。
Comments CVPR 2026
在你挣扎处采样:通过熵引导的幂采样增强基础模型推理
机构 * Hasso Plattner Institut(霍普夫纳研究所) ; German University of Digital Science(德国数字科学大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出熵引导的幂采样(EGPS),一种无需训练和验证器的采样方法,通过利用前向传播中的token级熵将MCMC移动定位到高熵区域,在多个基准上以高达12.6倍加速达到最优或并列最优准确率。
摆脱验证者:通过示范学习推理
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RARO方法,通过逆强化学习从专家示范中学习强大的推理能力,无需任务特定的验证者,从而在多个评估任务中实现了显著的性能提升。
量化大型推理模型中的忠实置信表达
机构 * Yale University(耶鲁大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 针对大型推理模型(LRM)在长链思维输出中难以忠实表达内在置信度的问题,提出基于令牌概率、隐藏状态和响应一致性的框架,系统量化其语言决断性与内部不确定性之间的对齐程度。
Comments Code: https://github.com/yale-nlp/faithful_lrm
InftyThink+:通过强化学习实现高效且有效的无限时域推理
机构 * Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出InftyThink+框架,通过强化学习优化迭代推理的总结时机、保留内容和恢复策略,在DeepSeek-R1-Distill-Qwen-1.5B上提升AIME24准确率21%,并降低推理延迟。
Comments ICML 2026: https://openreview.net/forum?id=tyul8kXaJU Project Page: https://zju-real.github.io/InftyThink-Plus Code: https://github.com/ZJU-REAL/InftyThink-Plus Models: https://huggingface.co/collections/yanyc/inftythink
冻结嵌入模型在测试时通过智能体程序搜索的计算
机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种智能体程序搜索方法,通过大语言模型编写程序操作冻结编码器API,在推理时提升小嵌入模型的检索质量,无需训练参数且跨任务迁移。
Comments 15 pages, 7 figures, 4 tables
无需训练的视频推理
机构 * Qualcomm AI Research(高通AI研究) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 提出V-Reason方法,利用输出分布熵作为信号,通过轻量级控制器在推理时自适应调整值缓存,无需强化学习或微调即可提升视频推理性能。
Comments CVPR Findings 2026. Project Page https://deepaksridhar.github.io/vreason.github.io/
T1:小语言模型测试时计算扩展的工具集成验证
机构 * KAIST(韩国科学技术院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; KRAFTON
专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 针对小语言模型在测试时扩展中验证能力不足的问题,提出T1框架,通过外部工具过滤候选输出后由小语言模型进行最终验证,显著提升验证准确率和测试时扩展性能。
Comments ICLR 2026
解锁大型语言模型的工作记忆以实现潜在推理
机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz, Austria(林茨ELLIS单元和LIT AI实验室,机器学习研究所,约翰·凯撒大学林茨,奥地利) ; NXAI GmbH, Linz, Austria(NXAI公司,林茨,奥地利)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI
AI总结 提出一种名为RiM的潜在推理方法,通过固定记忆块替代自回归生成中间推理步骤,在单次前向传播中实现计算高效的潜在推理。
Comments Preprint
耦合变分强化学习用于语言模型通用推理
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出CoVRL方法,通过混合采样策略耦合先验和后验分布,将变分推理与强化学习结合,以解决无验证器强化学习中探索效率低和推理轨迹与答案不一致的问题,在数学和通用推理基准上提升性能。
Comments Accepted to ICML 2026
偏离以诱导提示:多理性诱导用于零样本推理
机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国家台湾大学计算机科学与信息工程系) ; Institute of Information Science, Academia Sinica, Taiwan(学术院信息科学研究所) ; AI Research Center (AINTU), National Taiwan University, Taiwan(国家台湾大学人工智能研究中心(AINTU))
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出DIP框架,通过生成多个多样化的高层理由并诱导最终计划,以提升零样本推理的准确性,克服了传统链式思考提示中推理路径不稳定的问题。
Comments Accepted to Findings of IJCNLP-AACL 2025
EndoCogniAgent: 闭环代理推理与自我一致性验证用于内窥镜诊断
机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) ; Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室) ; State Key Laboratory of Digital Medical Engineering, Southeast University(国家数字医学工程重点实验室) ; The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) ; Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Jiangsu Provincial Joint International Research Laboratory of Medical Information Processing(江苏省联合国际医学信息处理联合实验室) ; Laboratory of Image Science and Technology, the School of Computer Science and Engineering, Southeast University(图像科学与技术实验室,东南大学计算机科学与工程学院)
专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出EndoCogniAgent框架,通过闭环代理推理和自我一致性验证提升内窥镜诊断的准确性与可靠性,其核心方法是将诊断过程建模为受控状态更新过程,并引入EndoAgentBench基准进行评估。
Comments 10 pages, 8 figures, 2 tables. Revised version with major updates on methodology and extended evaluation on EndoAgentBench. Code and data are available at https://github.com/Tyyds-ai/EndoCogniAgent