arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2601.03969 2026-05-15 cs.AI cs.CL 84%

Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models

反长度偏移:动态异常截断用于训练高效的推理模型

Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态异常截断方法,通过在训练时抑制冗余token,提升推理模型的效率与性能,实验显示在AIME-24上推理token使用减少78%且准确率提升。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21839 2026-05-11 cs.CY cs.AI cs.GT cs.LG 84%

Test-Time Compute Games

测试时计算博弈

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Hasso Plattner Institute(哈索·普拉特纳研究所)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型作为服务市场的社会效率问题,提出反第二种价格拍卖机制以减少计算量浪费,通过实验验证了该机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG 84%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07666 2026-04-10 cs.LG cs.AI 84%

An Imperfect Verifier is Good Enough: Learning with Noisy Rewards

完美验证者并非必需:在有噪声奖励下学习

Andreas Plesner, Francisco Guzmán, Anish Athalye

机构 * Handshake AI ETH Zurich(苏黎世联邦理工学院)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过引入噪声探讨强化学习在有噪声奖励下的鲁棒性,发现15%的噪声率下验证准确率接近干净基线,表明不完美验证不影响RLVR效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10887 2026-03-12 cs.LG cs.AI 84%

Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models

动态预测采样用于主动强化学习微调大推理模型

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17633 2026-02-20 cs.LG cs.AI stat.ML 84%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08030 2026-02-11 cs.AI cs.CL 84%

Free(): Learning to Forget in Malloc-Only Reasoning Models

Free(): 学会遗忘的仅malloc推理模型

Yilun Zheng, Dongyang Ma, Tian Liang, Jiahao Xu, Xinting Huang, Lihui Chen, Haitao Mi, Yan Wang

机构 * Tencent AI Lab(腾讯AI实验室) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 Free()LM通过引入内在自我遗忘机制,解决推理模型中过多思考标记导致性能下降的问题,实现模型在不同规模上的性能提升,并在长周期任务中恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07032 2026-02-10 cs.AI cs.AR cs.CL 84%

LLM-FSM: Scaling Large Language Models for Finite-State Reasoning in RTL Code Generation

LLM-FSM: 通过大规模语言模型扩展有限状态推理用于RTL代码生成

Yuheng Wu, Berk Gokmen, Zhouhua Xie, Peijing Li, Caroline Trippel, Priyanka Raina, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 LLM-FSM通过大规模语言模型评估有限状态机在RTL代码生成中的表现,展示了模型在复杂性增加时的准确性下降及训练和测试扩展的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17813 2026-02-04 cs.CL cs.AI 84%

Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning

不要过度思考。为改进大语言模型推理而偏好更短的思考链

Michael Hassid, Gabriel Synnaeve, Yossi Adi, Roy Schwartz

机构 * FAIR Team, Meta(Meta FAIR团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出short-m@k方法,通过并行生成较短的思考链提高大语言模型推理效率,实验表明其在低计算环境下表现优于传统多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21590 2026-01-30 cs.LG cs.AI 84%

Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening

可扩展的功率采样:通过分布锐化实现LLM的高效无训练推理

Xiaotong Ji, Rasul Tutunov, Matthieu Zimmer, Haitham Bou Ammar

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无训练、无验证器的算法,通过分布锐化提升LLM的推理效率,减少计算成本,实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17223 2026-01-27 cs.CL cs.AI 84%

Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning

超越结果验证:用于结构化推理的可验证过程奖励模型

Massimiliano Pronesti, Anya Belz, Yufang Hou

机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰) Dublin City University(都柏林城市大学) IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出可验证过程奖励模型,用于提升结构化推理的连贯性和准确性,实验显示其在医学证据评估中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11847 2026-01-12 cs.LG cs.AI 84%

Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute

在ARC-AGI-1上使用小型递归模型:归纳偏差、身份条件和测试时计算

Antonio Roye-Azar, Santiago Vargas-Naranjo, Dhruv Ghai, Nithin Balamurugan, Rayan Amir

机构 * Western University(西部大学) Varonova Tech Inc.(Varonova科技公司)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究分析了TRM在ARC-AGI-1上的表现,发现其性能源于效率、任务特定条件和测试时计算的相互作用,而非深度推理。

Comments 13 pages, 0 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13935 2026-01-08 cs.CL cs.AI 84%

Big Reasoning with Small Models: Instruction Retrieval at Inference Time

大模型的推理:推理时的指令检索

Kenan Alkiek, David Jurgens, Vinod Vydiswaran

机构 * School of Information University of Michigan(信息学院 华盛顿大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种在推理时通过检索结构化指令来增强小型模型推理能力的方法,通过领域背景与分步程序的配对,提升模型在医学、法律和数学等领域的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14417 2025-12-17 cs.AI cs.CL 84%

Inverse Scaling in Test-Time Compute

测试时计算的反比例关系

Aryo Pradipta Gema, Alexander Hägele, Runjin Chen, Andy Arditi, Jacob Goldman-Wetzler, Kit Fraser-Taliente, Henry Sleight, Linda Petrini, Julian Michael, Beatrice Alex, Pasquale Minervini, Yanda Chen, Joe Benton, Ethan Perez

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,延长大型推理模型的推理时间会降低准确性,揭示了测试时计算与性能之间的反比例关系,并指出需通过多样化评估识别和解决推理中的失败模式。

Comments Published in TMLR (12/2025; Featured Certification; J2C Certification), 78 pages

Journal ref Transactions on Machine Learning Research (TMLR); 12/2025; https://openreview.net/forum?id=NXgyHW1c7M

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13059 2025-12-16 cs.CL cs.LG 84%

Multipole Attention for Efficient Long Context Reasoning

多重注意力机制用于高效长上下文推理

Coleman Hooper, Sebastian Zhao, Luca Manolache, Sehoon Kim, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer, Amir Gholami

机构 * University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 多重注意力机制通过精确计算重要标记的注意力并近似其余标记,提升长上下文推理效率。

Comments 15 pages

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17979 2025-11-20 cs.AI cs.CL 84%

Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities

Weixiang Zhao, Xingyu Sui, Jiahe Guo, Yulin Hu, Yang Deng, Yanyan Zhao, Xuda Zhi, Yongbo Huang, Hao He, Wanxiang Che, Ting Liu, Bing Qin

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02651 2025-11-05 cs.LG cs.AI 84%

Apriel-H1: Towards Efficient Enterprise Reasoning Models

Oleksiy Ostapenko, Luke Kumar, Raymond Li, Denis Kocetkov, Joel Lamy-Poirier, Shruthan Radhakrishna, Soham Parikh, Shambhavi Mishra, Sebastien Paquet, Srinivas Sunkara, Valérie Bécaert, Sathwik Tejaswi Madhusudhan, Torsten Scholak

机构 * SLAM Lab(SLAM实验室) ServiceNow

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12838 2025-10-22 cs.CL cs.AI 84%

A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning

Qianben Chen, Jingyi Cao, Jiayu Zhang, Tianrui Qin, Xiaowan Li, King Zhu, Dingfeng Shi, He Zhu, Minghao Liu, Xiaobo Liang, Xin Gui, Ge Zhang, Jian Yang, Yuchen Eleanor Jiang, Wangchunshu Zhou

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13804 2025-10-16 cs.CV cs.AI cs.CL 84%

Generative Universal Verifier as Multimodal Meta-Reasoner

Xinchen Zhang, Xiaoying Zhang, Youbin Wu, Yanbin Cao, Renrui Zhang, Ruihang Chu, Ling Yang, Yujiu Yang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09535 2025-10-13 cs.CL cs.AI 84%

Mitigating Overthinking through Reasoning Shaping

Feifan Song, Shaohang Wei, Bofei Gao, Yejie Wang, Wen Luo, Wei Li, Linli Yao, Weimin Xiong, Liang Chen, Tianyu Liu, Houfeng Wang

机构 * State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02816 2025-10-06 cs.AI cs.CL 84%

NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning

Yulong Zhang, Li Wang, Wei Du, Peilin Li, Yuqin Dai Zhiyuan Zhao, Lingyong Fang, Ziniu Liu, Ru Zhang, Huijia Zhu, Gongshen Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Inner Mongolia Research Institute of SJTU(内蒙古大学SJTU研究所)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15674 2025-10-02 cs.CL cs.AI cs.CR 84%

Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers

Tommaso Green, Martin Gubri, Haritz Puerto, Sangdoo Yun, Seong Joon Oh

机构 * Parameter Lab(参数实验室) Data and Web Science Group(数据与网络科学小组) University of Mannheim(曼海姆大学) UKP Lab(UKP实验室) Technical University of Darmstadt(达姆施塔特技术大学) NAVER AI Lab(NAVER人工智能实验室) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24238 2025-09-30 cs.AI cs.CL 84%

Learning to Ponder: Adaptive Reasoning in Latent Space

Yixin He, Lumingyuan Tang

机构 * University of Southern California(南加州大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04475 2025-09-08 cs.CL cs.AI 84%

ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute

Hao Wen, Yifan Su, Feifei Zhang, Yunxin Liu, Yunhao Liu, Ya-Qin Zhang, Yuanchun Li

机构 * Institute for AI Industry Research (AIR) Tsinghua University(人工智能产业研究所(AIR)清华大学)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02208 2025-09-03 cs.LG cs.AI 84%

Baichuan-M2: Scaling Medical Capability with Large Verifier System

M2 Team, Chengfeng Dou, Chong Liu, Fan Yang, Fei Li, Jiyuan Jia, Mingyang Chen, Qiang Ju, Shuai Wang, Shunya Dang, Tianpeng Li, Xiangrong Zeng, Yijie Zhou, Chenzheng Zhu, Da Pan, Fei Deng, Guangwei Ai, Guosheng Dong, Hongda Zhang, Jinyang Tai, Jixiang Hong, Kai Lu, Linzhuang Sun, Peidong Guo, Qian Ma, Rihui Xin, Shihui Yang, Shusen Zhang, Yichuan Mo, Zheng Liang, Zhishou Zhang, Hengfu Cui, Zuyi Zhu, Xiaochuan Wang

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

Comments Baichuan-M2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00406 2025-08-22 cs.CL cs.AI 84%

VerifiAgent: a Unified Verification Agent in Language Model Reasoning

Jiuzhou Han, Wray Buntine, Ehsan Shareghi

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09726 2025-08-14 cs.CL cs.LG 84%

Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning

Vaishnavi Shrivastava, Ahmed Awadallah, Vidhisha Balachandran, Shivam Garg, Harkirat Behl, Dimitris Papailiopoulos

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18418 2025-08-11 cs.IR cs.CL cs.LG 84%

Rank1: Test-Time Compute for Reranking in Information Retrieval

Orion Weller, Kathryn Ricci, Eugene Yang, Andrew Yates, Dawn Lawrie, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

Comments Published at CoLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15844 2025-08-08 cs.AI cs.CL 84%

Hierarchical Budget Policy Optimization for Adaptive Reasoning

Shangke Lyu, Linjuan Wu, Yuchen Yan, Xingyu Wu, Hao Li, Yongliang Shen, Peisheng Jiang, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) SF Technology(SF科技)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/zju-real/hbpo Project Page:https://zju-real.github.io/hbpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01633 2025-06-26 cs.LG cs.AI 84%

Adversarial Reasoning at Jailbreaking Time

Mahdi Sabbaghi, Paul Kassianik, George Pappas, Yaron Singer, Amin Karbasi, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI、cs.LG

Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏