When Independent Sampling Outperforms Agentic Reasoning
独立采样优于代理推理
机构 * Princeton University(普林斯顿大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文研究在固定预算下如何分配推理时间计算以提高编程竞赛表现,发现独立采样在准确率与成本、查询数的权衡上优于代理推理,且在资源受限条件下独立探索更有效。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
独立采样优于代理推理
机构 * Princeton University(普林斯顿大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文研究在固定预算下如何分配推理时间计算以提高编程竞赛表现,发现独立采样在准确率与成本、查询数的权衡上优于代理推理,且在资源受限条件下独立探索更有效。
VecCISC:通过推理轨迹聚类和候选答案选择改进置信度引导的自一致性
机构 * Computer Science Department, Brandeis University(布拉德雷大学计算机科学系)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 VecCISC通过推理轨迹聚类和候选答案筛选优化置信度引导的自一致性方法,减少计算开销并保持高精度。
Comments Accepted to Findings of ACL 2026
大型语言模型自我一致性与推理努力对自动化评分准确性和成本的影响
机构 * Khan Academy(可汗学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究探讨了LLM自我一致性和推理努力对自动化评分准确性和成本的影响,发现策略性模型选择和推理设置比集成更有效,且推理努力与评分准确性呈正相关。
Comments 14 pages, 10 tables, 2 figures. Presented at the 2026 National Council on Measurement in Education (NCME) Annual Meeting, April 11, 2026, Los Angeles, CA
一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southeast University(东南大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。
Comments Accepted to ACL26
沉默也重要:无关音频对大音频-语言模型文本推理的影响
机构 * National Taiwan University(国立台湾大学) ; NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。
Comments Accepted to ICASSP 2026
无监督的置信度校准用于推理语言模型:从单次生成出发
机构 * Columbia University(哥伦比亚大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出一种无监督置信度校准方法,通过单次生成数据提升推理语言模型的置信度估计,经多任务评估显著优于基线方法,提升下游任务表现。
Comments 41 pages, 14 tables, 12 figures
语义步预测:通过步采样进行LLM推理轨迹中的多步潜在预测
机构 * Home Team Science and Technology Agency(家庭团队科技机构)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文通过步采样改进语义管预测方法,提升多步潜在预测的准确性,并提出新的评估指标。
SPREG:基于熵引导的测试时干预的结构化计划修复用于大语言模型推理
机构 * Meituan(美团)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 SPREG通过熵引导的测试时干预,解决大语言模型在长链推理中的逻辑幻觉和随机漂移问题,通过动态修复机制提升推理准确性。
灵活的推理赋能与扩展的Best-of-N采样
机构 * National Institute of Informatics and The Graduate University for Advanced Studies, SOKENDAI Japan(日本信息处理研究所和高级研究大学研究院(SOKENDAI))
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出一种结合赋能的推理方法,通过扩展Best-of-N采样解决探索-利用困境,改进了传统奖励函数中延迟学习的问题。
Comments 15 pages, 4 figures
通过去噪过程奖励推进扩散语言模型的推理能力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。
WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理
机构 * LMU Munich(慕尼黑大学) ; Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。
Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments
SELFDOUBT:通过Hedge-to-Verify比率对推理大语言模型进行不确定性量化
机构 * Independent Researcher(独立研究员) ; Zillow Group(Zillow集团)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 SELFDOUBT是一种单次通过的不确定性框架,通过从推理轨迹中提取行为信号解决推理大语言模型的不确定性量化问题,其核心信号Hedge-to-Verify比率能检测推理轨迹中的不确定性标记及自我检查行为,适用于任何私有API的部署。
Comments 9 pages, 4 figures, 4 tables, plus appendix. Submitted to COLM 2026
理解并行采样与顺序采样在大推理模型中的性能差距
机构 * Google DeepMind(谷歌DeepMind) ; National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文研究大推理模型中并行与顺序采样性能差异,发现并行采样表现更优,提出探索不足是主要原因。
Comments Under review
CODA:面向自适应推理的难度感知计算分配
机构 * Fudan University(复旦大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出CODA,通过难度感知信号动态分配计算资源,实现自适应推理。在易任务中降低token成本,在难任务中提升性能。
推理时的结构推理用于组合性视觉-语言理解
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出统一评估和增强框架,评估四种架构各异的VLMs在Winoground基准上的表现,通过结构化关系先验提升模型能力,发现SG增强对已有能力强的模型有益。
Power-SMC:低延迟序列级功率采样用于训练自由LLM推理
机构 * University of Southern California(南加州大学) ; Intel Labs(英特尔实验室)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出Power-SMC,一种低延迟的序列级功率采样方法,用于训练自由的大语言模型推理,通过并行粒子集和重要权重修正提升推理效率。
为推理密集型检索代理进行计算分配
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究通过BRIGHT基准和Gemini 2.5模型家族,探讨推理密集型检索管道中的计算分配,发现重排阶段受益于更强模型和更深候选池,而查询扩展在轻量模型后效果递减。
推理缓存:通过短期限强化学习实现长周期的持续改进
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出RC算法,通过利用LLM的响应生成与总结能力差异,实现长周期的持续改进,实验显示其在HMMT 2025任务中性能显著提升。
Comments preprint v2; revised 2026-03-22 (updated IMO-AnswerBench results)
CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。
∇-Reasoner: 通过潜在空间中的测试时间梯度下降进行LLM推理
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; UC San Diego(圣地亚哥大学) ; TTIC ; Georgia Tech(佐治亚理工学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 ∇-Reasoner通过潜在空间中的测试时间梯度下降提升LLM推理能力,实现20%以上的准确率提升并减少模型调用次数。
Comments ICLR 2026
SPEED-RL: 通过在线课程学习加速推理模型训练
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 SPEED-RL通过在线课程学习方法,提升推理模型训练效率,实现2-6倍的加速,同时保持准确性。
Comments There are some bugs in the experiments, and we cannot fix them to make it satisfactory to us
基于语义槽聚合的token压缩:用于十亿像素病理推理
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; University of Nottingham NingBo(诺丁汉大学宁波学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 TC-SSA通过语义槽聚合实现token压缩,提升十亿像素病理推理的效率与诊断性能
Comments 8 pages, 4 figures, 2 tables
用于LLM代理的验证器绑定通信:对隐蔽信号的认证界限
机构 * umd(马里兰大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 本文提出CLBC协议,通过验证器绑定通信限制LLM代理的隐蔽信号,确保安全性和可验证性。
将过程与结果联系起来:用于大语言模型推理的条件奖励建模
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出条件奖励建模(CRM),通过将LLM推理视为时间过程,解决奖励分配模糊性和奖励黑客问题,提升推理性能。
离线推理用于高效推荐:基于LLM的个性化-属性化物品索引
机构 * Yonsei University(延世大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 Persona4Rec通过离线推理构建物品个性化表示,实现高效且可解释的推荐系统,减少推理时间并提供直观解释。
Comments Under review
共享本质,独特培养:通过上下文结构建模实现多元推理的PRISM
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Yale University(耶鲁大学) ; University of California Santa Cruz(加州大学圣克鲁兹分校)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 PRISM通过上下文结构建模实现多元推理,提升创造力和科学发现能力,展现独特认知轨迹的多元AI新范式。
推进移动GUI代理:一种以验证器驱动的方法用于实际部署
机构 * Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率
Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026
基于大语言模型的知识蒸馏的时序知识图谱推理
机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) ; School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。
APR:通过基于锚点的过程奖励惩罚大型推理模型中的结构冗余
机构 * NiuTrans Research(尼utoff研究)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 APR通过基于锚点的过程奖励方法,有效惩罚大型推理模型中的结构冗余,提升推理效率与性能。
Comments Under Review
推理时的推理选择性减少大语言模型中的隐性社会偏见
机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。