arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2506.19830 2025-06-25 cs.LG cs.CL 84%

Scaling Speculative Decoding with Lookahead Reasoning

Yichao Fu, Rui Ge, Zelei Shao, Zhijie Deng, Hao Zhang

机构 * UCSD(加州大学圣地亚哥分校) Shanghai Jiao Tong University(上海交通大学) UIUC(伊利诺伊大学香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13585 2025-06-17 cs.CL cs.LG 84%

MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention

MiniMax, :, Aili Chen, Aonian Li, Bangwei Gong, Binyang Jiang, Bo Fei, Bo Yang, Boji Shan, Changqing Yu, Chao Wang, Cheng Zhu, Chengjun Xiao, Chengyu Du, Chi Zhang, Chu Qiao, Chunhao Zhang, Chunhui Du, Congchao Guo, Da Chen, Deming Ding, Dianjun Sun, Dong Li, Enwei Jiao, Haigang Zhou, Haimo Zhang, Han Ding, Haohai Sun, Haoyu Feng, Huaiguang Cai, Haichao Zhu, Jian Sun, Jiaqi Zhuang, Jiaren Cai, Jiayuan Song, Jin Zhu, Jingyang Li, Jinhao Tian, Jinli Liu, Junhao Xu, Junjie Yan, Junteng Liu, Junxian He, Kaiyi Feng, Ke Yang, Kecheng Xiao, Le Han, Leyang Wang, Lianfei Yu, Liheng Feng, Lin Li, Lin Zheng, Linge Du, Lingyu Yang, Lunbin Zeng, Minghui Yu, Mingliang Tao, Mingyuan Chi, Mozhi Zhang, Mujie Lin, Nan Hu, Nongyu Di, Peng Gao, Pengfei Li, Pengyu Zhao, Qibing Ren, Qidi Xu, Qile Li, Qin Wang, Rong Tian, Ruitao Leng, Shaoxiang Chen, Shaoyu Chen, Shengmin Shi, Shitong Weng, Shuchang Guan, Shuqi Yu, Sichen Li, Songquan Zhu, Tengfei Li, Tianchi Cai, Tianrun Liang, Weiyu Cheng, Weize Kong, Wenkai Li, Xiancai Chen, Xiangjun Song, Xiao Luo, Xiao Su, Xiaobo Li, Xiaodong Han, Xinzhu Hou, Xuan Lu, Xun Zou, Xuyang Shen, Yan Gong, Yan Ma, Yang Wang, Yiqi Shi, Yiran Zhong, Yonghong Duan, Yongxiang Fu, Yongyi Hu, Yu Gao, Yuanxiang Fan, Yufeng Yang, Yuhao Li, Yulin Hu, Yunan Huang, Yunji Li, Yunzhi Xu, Yuxin Mao, Yuxuan Shi, Yuze Wenren, Zehan Li, Zelin Li, Zhanxu Tian, Zhengmao Zhu, Zhenhua Fan, Zhenzhen Wu, Zhichao Xu, Zhihang Yu, Zhiheng Lyu, Zhuo Jiang, Zibo Gao, Zijia Wu, Zijian Song, Zijun Sun

机构 * MiniMax

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

Comments A technical report from MiniMax. The authors are listed in alphabetical order. We open-source our MiniMax-M1 at https://github.com/MiniMax-AI/MiniMax-M1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12123 2025-06-09 cs.CL cs.LG 84%

On the Query Complexity of Verifier-Assisted Language Generation

Edoardo Botta, Yuchen Li, Aashay Mehta, Jordan T. Ash, Cyril Zhang, Andrej Risteski

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research NYC(微软研究院纽约)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04824 2025-06-06 cs.CL cs.AI 84%

A Reasoning-Based Approach to Cryptic Crossword Clue Solving

Martin Andrews, Sam Witteveen

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments 9 page paper plus Appendices. Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19621 2025-05-27 cs.AI cs.CL 84%

Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models

George Kour, Itay Nakash, Ateret Anaby-Tavor, Michal Shmueli-Scheuer

机构 * IBM Research AI(IBM人工智能研究)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00163 2025-04-02 cs.CL cs.AI 84%

Does "Reasoning" with Large Language Models Improve Recognizing, Generating, and Reframing Unhelpful Thoughts?

Yilin Qi, Dong Won Lee, Cynthia Breazeal, Hae Won Park

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 3 figures (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22989 2025-04-01 cs.AI cs.CL 84%

FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research

Gabriel Recchia, Chatrik Singh Mangat, Issac Li, Gayatri Krishnakumar

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments 43 pages, 3 figures. for associated repository, see https://github.com/modulo-research/findtheflaws

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05944 2025-03-11 cs.AI cs.LG 84%

Enhancing Reasoning with Collaboration and Memory

Julie Michelman, Nasrin Baratalipour, Matthew Abueg

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20372 2025-03-03 cs.CL cs.AI 84%

LLM2: Let Large Language Models Harness System 2 Reasoning

Cheng Yang, Chufan Shi, Siheng Li, Bo Shui, Yujiu Yang, Wai Lam

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02864 2024-11-06 cs.CL cs.AI cs.IR 84%

Graph-DPEP: Decomposed Plug and Ensemble Play for Few-Shot Document Relation Extraction with Graph-of-Thoughts Reasoning

Tao Zhang, Ning Yan, Masood Mortazavi, Hoang H. Nguyen, Zhongfen Deng, Philip S. Yu

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09671 2024-10-15 cs.AI cs.CL 84%

OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models

Jun Wang, Meng Fang, Ziyu Wan, Muning Wen, Jiachen Zhu, Anjie Liu, Ziqin Gong, Yan Song, Lei Chen, Lionel M. Ni, Linyi Yang, Ying Wen, Weinan Zhang

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13149 2024-08-30 cs.CL cs.AI 84%

Beyond Self-Consistency: Ensemble Reasoning Boosts Consistency and Accuracy of LLMs in Cancer Staging

Chia-Hsuan Chang, Mary M. Lucas, Yeawon Lee, Christopher C. Yang, Grace Lu-Yao

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments accepted to the 22nd International Conference on Artificial Intelligence in Medicine (AIME'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03314 2024-08-07 cs.LG cs.CL 84%

Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Charlie Snell, Jaehoon Lee, Kelvin Xu, Aviral Kumar

专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03748 2024-02-20 cs.CL cs.AI 84%

Applying Large Language Models and Chain-of-Thought for Automatic Scoring

Gyeong-Geon Lee, Ehsan Latif, Xuansheng Wu, Ninghao Liu, Xiaoming Zhai

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10480 2024-01-22 cs.CL cs.AI 84%

Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning

Yiwei Li, Peiwen Yuan, Shaoxiong Feng, Boyuan Pan, Xinglin Wang, Bin Sun, Heda Wang, Kan Li

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02336 2023-05-25 cs.CL cs.AI 84%

Making Large Language Models Better Reasoners with Step-Aware Verifier

Yifei Li, Zeqi Lin, Shizhuo Zhang, Qiang Fu, Bei Chen, Jian-Guang Lou, Weizhu Chen

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11171 2023-03-08 cs.CL cs.AI 84%

Self-Consistency Improves Chain of Thought Reasoning in Language Models

Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, Denny Zhou

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Published at ICLR 2023. V2: added PaLM results; V3: added UL2 results; V4: camera ready version at ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18532 2026-07-22 cs.CL 新提交 84%

Reasoning Fine-Tuning Induces Persistent Latent Policy States

推理微调诱导持久的潜在策略状态

Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi

机构 * University of Oxford(牛津大学) University of Utah(犹他大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL;CoT(comments)

AI总结 研究推理微调对语言模型的影响,将思维链推理建模为切换动态系统,通过时间感知对比表征学习等方法恢复潜在策略。发现推理微调使模型有更丰富的潜在策略组织,恢复的状态有功能意义,SDS引导的剪枝效果良好,为推理模型分析和控制提供新视角。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. 45 pages, including appendices; 24 figures and 12 tables. Code: https://github.com/withmartian/mi-cot

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21067 2025-10-27 cs.LG 84%

The Virtues of Brevity: Avoid Overthinking in Parallel Test-Time Reasoning

Raul Cavalcante Dinardi, Bruno Yamamoto, Anna Helena Reali Costa, Artur Jordao

机构 * Instituto de Matemática, Estatística e Ciência da Computação, Universidade de São Paulo(圣保罗大学数学、统计与计算机科学研究所) Escola Politécnica, Universidade de São Paulo(圣保罗大学理工学院)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10660 2026-04-14 cs.CL cs.AI cs.LG 83%

Efficient Process Reward Modeling via Contrastive Mutual Information

通过对比互信息实现高效的进程奖励建模

Nakyung Lee, Sangwoo Hong, Jungwoo Lee

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔大学电气与计算机工程系) Department of Computer Science and Engineering, Konkuk University(建国大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出CPMI方法,通过模型内部概率推断步骤监督,减少标注计算负担,提升过程级评估和数学推理准确性。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03244 2025-12-04 cs.LG cs.AI cs.CL 83%

SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning

SPARK:基于过程的奖励机制用于无参考强化学习

Salman Rahman, Sruthi Gorantla, Arpit Gupta, Swastik Roy, Nanyun Peng, Yang Liu

机构 * Amazon AGI(亚马逊人工智能实验室) UCLA(大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09706 2026-08-17 cs.CE cs.LG 版本更新 83%

Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection

基于无验证器共识选择的CAD生成测试时缩放

Aaron Haag, Altay Kacan, Bertram Fuchs, Oliver Lohse

专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交 83%

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08020 2026-08-12 cs.AI 版本更新 83%

Thought-Level Beam Search for Reasoning

用于推理的思维级束搜索

Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Meta AI

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。

Comments Add the author Jiawei Zhao in Meta Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05307 2026-08-12 cs.CL 版本更新 83%

MentorCollab: Large-to-Small Inference-Time Mentorship for Concise Reasoning in Language Models

MentorCollab: 选择性大到小推理时指导以实现高效推理

Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * UIUC(伊利诺伊大学香槟分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03438 2026-08-03 cs.AI 版本更新 83%

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

具有自适应验证器的多模态强化学习

Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

机构 * Microsoft Research(微软研究院) UMass Amherst(马萨诸塞大学阿默斯特分校) ETH Zurich(苏黎世联邦理工学院) UW–Madison(威斯康星大学麦迪逊分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27914 2026-07-31 cs.LG cs.SY eess.SY 新提交 83%

Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control

仅精确动作值不够:针对多区域VAV控制的推理模型的展开验证强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 该研究针对多区域VAV控制,测试前沿LLM的控制能力及TD3引导的RFT效果,发现RFT未产生持续改进,需先开展状态转移聚焦的监督微调。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08724 2026-07-10 cs.LG cs.RO 新提交 83%

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference

潜在记忆宫殿:作为自回归变分推理的控制推理

Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Toyota Research Institute(丰田研究院)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 研究将语言模型的推理能力应用于连续控制策略的问题,提出潜在记忆宫殿(LMP)方法,通过自回归潜在空间组织信息进行变分推理,推导强化学习技术优化下限,该方法在模拟和现实领域表现良好,还产生高性能动作分词器,为控制的潜在推理提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06764 2026-07-09 cs.AI 新提交 83%

Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1

用于ARC-AGI-1上抽象推理和泛化的经济高效智能体框架

Kabir Moghe, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI

AI总结 研究ARC-AGI-1上在严格预算下非思考模式的开放权重模型,构建智能体框架,包括探索者-定义者管道和反思协调器,通过特定架构提升基线成绩,分析了管道特性,确定思考工具是重要组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20510 2026-06-24 cs.AI 版本更新 83%

Grounded Chess Reasoning in Language Models via Master Distillation

通过大师蒸馏实现语言模型中的接地国际象棋推理

Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Queen’s University(皇后大学) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出大师蒸馏框架,将专家系统推理过程蒸馏为自然语言思维链,使4B参数模型C1在国际象棋中达到48.1%准确率,超越所有开源模型和多数前沿闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏