GR2: Generative Reasoning Re-ranker
生成式推理重排序器
机构 * Meta AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。
Comments 31 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
生成式推理重排序器
机构 * Meta AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。
Comments 31 pages
SCI-PRM:用于科学推理验证的工具感知过程奖励模型
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; Tongji University(同济大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 针对科学推理中工具使用和事实一致性问题,提出Sci-PRM模型,通过构建包含工具链轨迹的数据集SCIPRM70K并训练过程奖励模型,在测试时扩展和强化学习中提供细粒度监督,提升基础模型性能。
Comments Accepted by KDD 2026 AI4Science Track
通过解耦证明者-验证者游戏减轻可读性代价
机构 * KAIST(韩国科学技术院)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 提出解耦证明者-验证者游戏(DPVG),通过分离正确性与可检查性训练一个翻译器模型,将固定求解器的解转化为可检查形式,在保持答案正确性的同时提高可检查性,解决了可读性代价问题。
Comments ICLR 2026 Workshop Trustworthy AI
形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理
机构 * University of Michigan(密歇根大学) ; Amazon(亚马逊)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。
Comments Accepted to KDD 2026
基于自适应工人分配的多智能体推理用于立场检测
机构 * Kansas State University(堪萨斯州立大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出一种Manager-Worker多智能体框架,通过自适应分配工人智能体进行推理级合成,而非标签级投票,在隐式和上下文依赖的立场检测上显著提升性能。
面向叙事任务的轻量级潜在推理
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; CIFAR Fellow
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。
Ishigaki-IDS:一种面向建筑信息模型中信息交付规范起草的开放权重验证器感知模型
机构 * ONESTRUCTION Inc.(ONESTRUCTION公司) ; AWS GenAI Innovation Center(AWS生成式AI创新中心)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL
AI总结 针对BIM项目中IDS编写瓶颈,提出开放权重LLM Ishigaki-IDS,结合持续预训练、监督微调和基于验证器奖励的强化学习,生成可通过外部验证器检查的IDS草案,在基准上显著优于基线,并减少54.7%工作时间。
Comments 8 pages, 2 figures, 5 tables. Preprint
重回正轨:在扩散大语言模型中对齐奖励与状态以进行推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Tongyi Lab(通义实验室) ; Northeastern University(东北大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 针对扩散大语言模型强化学习中过程奖励与状态轨迹的双重错位问题,提出PAPO框架,通过步骤感知过程奖励和熵引导历史重演实现对齐,在四个基准上取得显著提升。
简单、困难与可学习:面向LLM推理的置信度与难度自适应策略优化
机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) ; Stanford University(斯坦福大学) ; Sydney AI Centre, The University of Sydney(悉尼大学人工智能中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 针对GRPO训练中均匀采样导致计算效率低的问题,提出CoDaPO方法,通过置信度和难度自适应重加权与重采样,在固定预算下提升可学习问题的发现,在12个基准上优于现有RL方法。
Comments Published in ICML 2026
无教师自训练放大但不复合:自由验证器域上的 Pass@$K$ 交叉
机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 在自由验证器域上,使用无教师自训练(STaR)和批评者指导的选择,发现自训练放大模型能力但不复合,通过 Pass@$K$ 交叉诊断证实。
推理的影子价格:LLM最优预算分配的经济学视角
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文从经济学视角将推理预算分配建模为全局约束优化问题,提出基于影子价格的CLEAR方法,通过理性放弃和资源再分配,在资源稀缺下显著提升总token成本与平均准确率的帕累托前沿。
世界模型遇见语言模型:论具体推理与抽象推理的互补性
机构 * Nanyang Technological University(南洋理工大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。
跨语言自一致性:面向语言模型的多语言推理
机构 * HiTZ Center, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心) ; Reka AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出无监督强化学习方法,通过强制模型对跨语言等价问题产生相同答案来增强多语言推理,在MGSM上平均提升21.7%,并展现出强泛化能力。
Comments Paper under review
FineVerify: 通过细粒度自验证扩展智能搜索的测试时计算
机构 * National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL
AI总结 提出FineVerify细粒度自验证框架,将问题分解为可检查的子问题,对候选答案逐项验证并聚合得分,在四个智能搜索基准上显著优于标准扩展基线。
Comments 8+18 pages, 6 tables, 11 figures
认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) ; South China Agricultural University(华南农业大学) ; South China Normal University(华南师范大学) ; Monash University(莫纳什大学) ; Jishou University(吉首大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。
Comments TPAMI under review
语言模型推理中带有重置的信用分配
机构 * Meta AI ; Columbia University(哥伦比亚大学) ; Meta Superintelligence Labs(Meta超智能实验室) ; Tel Aviv University(特拉维夫大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出随机重置策略优化(RRPO)和自重置策略优化(SRPO)两种方法,通过重置到中间状态并重新采样反事实延续来改进语言模型多步推理中的信用分配,SRPO在多个推理基准上优于标准GRPO和RRPO。
ARBITER:测试时采样中的推理轨迹盆地与多数投票失败
机构 * School of Computing and Information Systems(计算与信息系统学院) ; University of Melbourne(墨尔本大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文发现语言模型测试时采样的推理轨迹会聚集成少数“推理盆地”,导致多数投票选择最稳定而非最准确的盆地,并提出ARBITER方法通过保守加性证据修正共识,从样本池中恢复部分正确性。
Comments Preprint. 34 pages, 2 figures
使用推理型大语言模型从临床笔记中提取社会健康决定因素事件
机构 * Department of Population Health Sciences, Weill Cornell Medicine(流行病学与公共卫生系,韦尔·科恩医学中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出一种基于推理型大语言模型的提示工程方法,通过四个模块(简洁提示、少样本学习、自一致性机制和后处理)从临床笔记中提取结构化SDOH事件,取得0.866的微平均F1分数,展示了简单实现与强性能的平衡。
更好、更快:利用大型推理模型的自我改进
机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) ; Alibaba Group, China(中国阿里巴巴集团) ; School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; AGH University of Science and Technology, Poland(波兰AGH科学与技术大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 针对自我改进训练中数据不平衡和过度思考问题,提出HSIR方法,通过验证后退出采样和内在多样性评分提升推理性能与效率。
Comments Accepted by ICML2026
Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理
机构 * NVIDIA
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。
生成性递归推理
机构 * KAIST(韩国科学技术院) ; Mila – Québec AI Institute(魁北克人工智能研究所) ; New York University(纽约大学) ; Université de Montréal(蒙特利尔大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出Gram框架,通过将递归潜在推理转化为概率多轨迹计算,解决了传统递归推理模型的确定性问题,实现了条件推理和无条件生成。
通过元步骤解码实现验证器引导的代码翻译
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Google(谷歌)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 本研究提出了一种元步骤解码框架DTV,通过在生成过程中整合验证器调用,提高了代码翻译的通过率,同时减少了token的使用。
Comments 31 pages, 8 figures
从自我辩论中学习:为多智能体辩论准备推理模型
机构 * Department of Computer Science(计算机科学系)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出SDRL框架,通过自我辩论训练使模型具备独立问题解决能力和多智能体辩论中的多样化推理处理能力,实验表明其在多辩论协议和智能体配置下均能提升多智能体辩论性能和单模型推理能力。
具有科学逻辑性的方法论:LLM推理的实践:物理学
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China ; Beijing Wenge Technology Co., Ltd, Beijing, China ; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出了一种增强科学逻辑性的方法论,旨在提升LLM在科学推理中的逻辑正确性与任务表现,通过物理学中的多样逻辑结构和形式化进行实践验证。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
利用多模态自一致性推理进行编码动机访谈以减少酒精使用
机构 * Department of Computer Science, University of Memphis(密苏里大学计算机科学系) ; Veterans Affairs Health Care System(退伍军人事务医疗系统) ; Department of Psychiatry and Behavioral Sciences, University of California San Francisco(旧金山大学精神病学与行为科学系) ; Department of Psychology, University of Memphis(密苏里大学心理学系) ; Department of Psychology, Washington State University Vancouver(华盛顿州立大学温哥华分校心理学系)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出基于音频语言模型的自动动机访谈编码方法,通过多模态自一致性推理提升编码鲁棒性,实验显示其在准确率、精确率和召回率上均优于基线方法。
嵌入扰动可能更好地反映大语言模型推理中的中间步骤不确定性
机构 * University of Arizona(亚利桑那大学) ; Michigan State University(密歇根州立大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文研究了大语言模型推理中中间步骤不确定性的量化方法,发现基于嵌入扰动的指标在不确定性评估中表现更优,具有更高的效率和简洁性。
基于开放属性等价验证器的奖励加权在线策略蒸馏用于自然语言到SVA生成
机构 * National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 本文提出RWOPD方法,通过开放属性等价检查器提升SVA生成性能,使模型在多个评估指标上超越现有最佳模型。
GridProbe: 为长视频VLMs中的自适应测试时间计算进行后验探测
机构 * King Abdullah University of Science and Technology (KAUST)(卡尔斯塔德大学科学与技术学院) ; Department of Computer Science, Edge Hill University(埃奇希尔大学计算机科学系)
专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI
AI总结 GridProbe通过后验探测方法在无需训练的情况下选择相关帧,减少注意力成本,同时保持高精度。
基于探索的优化用于测试时大语言模型推理
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出EDO框架,通过扩展奖励偏差探索目标到迭代后训练,提升大语言模型推理中的探索与利用平衡,实验表明ED-iDPO和ED-GRPO在推理能力和多样性上优于基线模型。
Comments Accepted by TMLR 2026
基于混合策略蒸馏的推理压缩
机构 * Technical University of Munich(慕尼黑技术大学) ; GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) ; Northeastern University(东北大学) ; LMU Munich(慕尼黑大学) ; Siemens AG(西门子股份公司) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Mina AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。