Scaling Speculative Decoding with Lookahead Reasoning
机构 * UCSD(加州大学圣地亚哥分校) ; Shanghai Jiao Tong University(上海交通大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * UCSD(加州大学圣地亚哥分校) ; Shanghai Jiao Tong University(上海交通大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG
机构 * MiniMax
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
Comments A technical report from MiniMax. The authors are listed in alphabetical order. We open-source our MiniMax-M1 at https://github.com/MiniMax-AI/MiniMax-M1
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft Research NYC(微软研究院纽约)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
Comments ICML 2025
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
Comments 9 page paper plus Appendices. Accepted to ICML 2025
机构 * IBM Research AI(IBM人工智能研究)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments 8 pages, 3 figures (including appendix)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
Comments 43 pages, 3 figures. for associated repository, see https://github.com/modulo-research/findtheflaws
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
Comments 17 pages, 6 figures
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL 2025 Main Conference
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments accepted to the 22nd International Conference on Artificial Intelligence in Medicine (AIME'24)
专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.LG
专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments ICLR 2024
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Published at ICLR 2023. V2: added PaLM results; V3: added UL2 results; V4: camera ready version at ICLR 2023
推理微调诱导持久的潜在策略状态
机构 * University of Oxford(牛津大学) ; University of Utah(犹他大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL;CoT(comments)
AI总结 研究推理微调对语言模型的影响,将思维链推理建模为切换动态系统,通过时间感知对比表征学习等方法恢复潜在策略。发现推理微调使模型有更丰富的潜在策略组织,恢复的状态有功能意义,SDS引导的剪枝效果良好,为推理模型分析和控制提供新视角。
Comments Accepted at the Conference on Language Modeling (COLM) 2026. 45 pages, including appendices; 24 figures and 12 tables. Code: https://github.com/withmartian/mi-cot
机构 * Instituto de Matemática, Estatística e Ciência da Computação, Universidade de São Paulo(圣保罗大学数学、统计与计算机科学研究所) ; Escola Politécnica, Universidade de São Paulo(圣保罗大学理工学院)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG
Comments Accepted at NeurIPS 2025 Workshop on Efficient Reasoning
通过对比互信息实现高效的进程奖励建模
机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔大学电气与计算机工程系) ; Department of Computer Science and Engineering, Konkuk University(建国大学计算机科学与工程系)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)
AI总结 本文提出CPMI方法,通过模型内部概率推断步骤监督,减少标注计算负担,提升过程级评估和数学推理准确性。
Comments Accepted at ACL 2026 Main Conference
SPARK:基于过程的奖励机制用于无参考强化学习
机构 * Amazon AGI(亚马逊人工智能实验室) ; UCLA(大学)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)
AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。
基于无验证器共识选择的CAD生成测试时缩放
专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。
VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法
机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。
Comments European Conference on Computer Vision 2026
用于推理的思维级束搜索
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Meta AI
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI
AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。
Comments Add the author Jiawei Zhao in Meta Data
MentorCollab: 选择性大到小推理时指导以实现高效推理
机构 * UIUC(伊利诺伊大学香槟分校) ; University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL
AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。
具有自适应验证器的多模态强化学习
机构 * Microsoft Research(微软研究院) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; ETH Zurich(苏黎世联邦理工学院) ; UW–Madison(威斯康星大学麦迪逊分校)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。
仅精确动作值不够:针对多区域VAV控制的推理模型的展开验证强化微调
机构 * The University of Tokyo(东京大学) ; Tokyo University of Science(东京理科大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG
AI总结 该研究针对多区域VAV控制,测试前沿LLM的控制能力及TD3引导的RFT效果,发现RFT未产生持续改进,需先开展状态转移聚焦的监督微调。
Comments 34 pages, 14 figures
潜在记忆宫殿:作为自回归变分推理的控制推理
机构 * University of Washington(华盛顿大学) ; Toyota Research Institute(丰田研究院)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 研究将语言模型的推理能力应用于连续控制策略的问题,提出潜在记忆宫殿(LMP)方法,通过自回归潜在空间组织信息进行变分推理,推导强化学习技术优化下限,该方法在模拟和现实领域表现良好,还产生高性能动作分词器,为控制的潜在推理提供新视角。
用于ARC-AGI-1上抽象推理和泛化的经济高效智能体框架
机构 * Dartmouth College(达特茅斯学院)
专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI
AI总结 研究ARC-AGI-1上在严格预算下非思考模式的开放权重模型,构建智能体框架,包括探索者-定义者管道和反思协调器,通过特定架构提升基线成绩,分析了管道特性,确定思考工具是重要组件。
通过大师蒸馏实现语言模型中的接地国际象棋推理
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Queen’s University(皇后大学) ; Coolwei AI Lab(Coolwei人工智能实验室)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出大师蒸馏框架,将专家系统推理过程蒸馏为自然语言思维链,使4B参数模型C1在国际象棋中达到48.1%准确率,超越所有开源模型和多数前沿闭源系统。