ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
Comments 11 pages, 5 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
Comments 11 pages, 5 figures
专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.CL
专题命中 测试时计算 :CoT(title,abstract);reasoning(abstract);分类 cs.CL
Comments Accepted to EMNLP 2024
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
Comments Accepted by ECCV 2024
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
Comments 17 pages, 14 figures, accepted by LREC-COLING 2024
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL
Comments Work in progress
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
Comments 18 pages, 3 figures
基于组分布鲁棒优化的强化学习用于大语言模型推理
机构 * Tencent AI Lab in Bellevue WA USA(腾讯AI实验室(西雅图华盛顿州))
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出多对手组分布鲁棒优化框架,通过动态调整训练分布提升大语言模型推理性能,实现训练后精度提升10.6%和10.1%。
Comments Keywords: Large Language Models, Reasoning Models, Reinforcement Learning, Distributionally Robust Optimization, GRPO
分层多智能体大语言模型推理用于自主功能材料发现
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MASTER通过多代理协作提升材料发现的自主性,利用大语言模型进行推理驱动的原子模拟优化,减少90%的计算需求。
Comments Keywords: Multi-agent reasoning; Large language models; Active learning; AI-driven simulation; Materials discovery; Density functional theory; Surface chemistry
循环、思考与泛化:递归深度变换器中的隐式推理
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了隐式推理能力,探讨了递归深度变换器在系统泛化和深度扩展中的作用,发现其能有效提升多跳推理能力,但过度递归会导致泛化能力下降。
Comments 21 pages, 21 figures. Accepted at COLM 2026
推理模型在知识密集型任务中的测试时间扩展效果有限
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现测试时间扩展在知识密集型任务中效果有限,主要因模型回答意愿和确认偏见导致幻觉增加,且无法提升真实答案的信息量。
Comments COLM 2026. 10+27 pages, 9 figures, 11 tables
用于多轮迭代推理的链式递归语言模型
机构 * University of Maryland(马里兰大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM长上下文推理易传播早期错误的问题,提出Chained RLM推理架构,通过分阶段管理上下文提升多轮迭代推理准确率,验证其相比直接LLM回答的性能增益。
幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码
专题命中 测试时计算 :verifier(title,abstract)
AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。
MORES:通过分布式大语言模型推理时间缩放实现移动推理即服务
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 研究针对大语言模型推理时间缩放的计算和内存开销问题,提出MORES框架,利用隐式推理递归结构及基于语义MoE的DRL算法优化资源分配,实现边缘设备协作推理,提升系统吞吐量约18%。
ThinkJEPA:赋予潜在世界模型大型视觉-语言推理能力
机构 * Northeastern University(东北大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Maryland(马里兰大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Washington(华盛顿大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ThinkJEPA框架,结合密集JEPA分支与稀疏VLM思考者分支,通过分层金字塔表示提取模块,实现细粒度运动建模与长程语义引导,在手部操作轨迹预测任务上超越基线。
Comments 10 pages, 5 figures
失败推理轨迹告诉你什么是可修复的(但仅凭阅读它们不行)
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; CHU Sainte-Justine(圣约斯特医院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过失败推理轨迹的分布特征而非文本内容来识别可修复的失败,并设计无训练的路由规则提升测试时干预效果。
Mid-Think: 通过词元级触发器实现无需训练的中间预算推理
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过分析注意力机制和提示实验,发现推理行为主要由少量触发词元控制,并据此提出Mid-Think方法,通过组合触发词元实现中间预算推理,在准确率-长度权衡上优于基线,并能在强化学习训练中减少时间并提升性能。
无意义帮助:提示空间扰动拓宽推理探索
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LoPE框架,通过任务无关的提示空间扰动提升LLM推理能力,实验显示其在不同规模模型上均优于传统重采样方法。
学习以细化:LLMs中并行推理的自我细化
机构 * Microsoft(微软) ; Peking University(北京大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Generative Self-Refinement方法,通过并行生成候选答案并细化最终答案,提升LLM推理性能,实验显示其在多个数学基准测试中表现优异。
测试时计算的战略扩展:一种多臂学习方法
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种多臂学习方法,通过动态分配计算资源提升大语言模型性能,针对不同查询难度优化计算分配,实验表明在多个基准数据集上显著提升性能。
Comments To appear at ICLR 2026
大型语言模型是否编码了推理标记的功能重要性?
机构 * Grainger College of Engineering(格雷格纳工程学院) ; University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了大型语言模型是否内部编码了推理标记的功能重要性,提出贪心剪枝方法,在保持模型似然的前提下剪除对答案生成影响最小的推理标记,验证了模型在压缩推理链时的功能重要性结构。
Comments Updated after ACL Main 2026 acceptance; 25 pages, 8 figures, 4 tables;
Nemotron-Cascade:基于级联强化学习的通用推理模型规模化
机构 * NVIDIA(英伟达)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。
Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade
超越模式:语言模型中的分布推理强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种多答案强化学习方法,使语言模型在推理时能生成多个可能的假设并评估其置信度,提升多样性和准确性。
测试时强化学习中的放大效应:安全性和推理漏洞
机构 * Penn State University(宾夕法尼亚州立大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Mitsubishi Electric Research Laboratories(三菱电机研究实验室)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。
检验推理LLM作为裁判在不可验证LLM后续训练中的表现
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。
基于LLM的生成推荐的可验证推理
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract)
AI总结 VRec通过引入推理-验证-推荐范式,提升LLM生成推荐的准确性和可扩展性。
DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解
机构 * Fudan University(复旦大学)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract)
AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。
具有显著性意识的多路由思考:重新审视视觉-语言推理
机构 * University of Virginia(弗吉尼亚大学)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract)
AI总结 本文提出Saliency-Aware Principle(SAP)方法,通过高层次推理原则提升视觉-语言推理的稳定性与效率,减少幻觉并提升响应速度。
Comments preprint 10 pages, 4 figures
RuleReasoner: 基于领域感知动态采样的强化规则推理
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 RuleReasoner通过领域感知动态采样方法提升规则推理性能,优于现有大型推理模型。
Comments ICLR 2026 camera ready, 28 pages, 10 figures, 15 tables
通过流匹配引导大型推理模型实现紧凑推理
机构 * LMU Munich(慕尼黑莱茵河大学) ; Amazon(亚马逊)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过流匹配引导大型推理模型实现紧凑推理,提出非线性引导方法提升推理效率和任务性能。
Comments This paper has been accepted to Transactions on Machine Learning Research (TMLR)