arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1974 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1974 篇

2502.18080 2025-10-14 cs.CL cs.AI 90%

Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning

Wenkai Yang, Shuming Ma, Yankai Lin, Furu Wei

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15868 2025-09-09 cs.CL cs.AI 90%

CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning

Wenqiao Zhu, Ji Liu, Rongjuncheng Zhang, Haipang Wu, Yulun Zhang

机构 * HiThink Research(HiThink研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 14 pages, to appear in EMNLP25

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14853 2026-04-17 cs.LG 89%

Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization

通过约束策略优化实现推理大语言模型的自适应推理时间计算分配

Zhiyuan Zhai, Bingcong Li, Bingnan Xiao, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院) Guangming Lab(光明实验室)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(title,abstract);分类 cs.LG

AI总结 本文提出通过约束优化问题解决推理时间计算分配问题,采用两阶段解决-学习流程,在解决阶段利用拉格朗日松弛分解全局约束,学习阶段训练轻量分类器预测 oracle 动作,实验证明方法在 MATH 和 GSM8K 数据集上优于均匀和启发式分配基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23184 2026-02-02 cs.CL 89%

ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought

ReGuLaR: 基于渲染思维链的变分潜在推理

Fanmeng Wang, Haotian Liu, Guojiang Zhao, Hongteng Xu, Zhifeng Gao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 ReGuLaR通过渲染思维链图像并利用视觉-语义表示正则化后验分布,实现高效的潜在推理,优于现有方法并在多模态推理中超越CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05566 2025-07-17 cs.AR cs.AI 89%

ScaleRTL: Scaling LLMs with Reasoning Data and Test-Time Compute for Accurate RTL Code Generation

Chenhui Deng, Yun-Da Tsai, Guan-Ting Liu, Zhongzhi Yu, Haoxing Ren

机构 * NVIDIA

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);chain-of-thought(abstract);分类 cs.AI

Comments Accepted to MLCAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20790 2025-03-03 cs.CL 89%

Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path Supervision

Dawei Zhu, Xiyu Wei, Guangxiang Zhao, Wenhao Wu, Haosheng Zou, Junfeng Ran, Xun Wang, Lin Sun, Xiangzheng Zhang, Sujian Li

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18179 2025-10-23 cs.MA 89%

Adaptive Coopetition: Leveraging Coarse Verifier Signals for Resilient Multi-Agent LLM Reasoning

Rui Jerry Huang, Wendy Liu, Anastasia Miin, Lei Ding

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);self-correction(abstract)

Comments 13 pages, 8 figures. Accepted for presentation at the 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01077 2026-08-11 cs.CL cs.LG 版本更新 89%

Message Passing Enables Efficient Reasoning

消息传递实现高效推理

Xuecheng Liu, Daman Arora, Gokul Swamy, Andrea Zanette

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出消息传递语言模型(MPLM),通过线程间直接通信和抢占机制,在Sudoku、3-SAT和长上下文问答任务中实现比串行CoT和并行FJ更高效的推理。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17912 2026-04-21 cs.LG cs.AI 89%

Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought

学习修正:校准强化学习用于多尝试链式推理

Muhammed Emrullah Ildiz, Halil Alperen Gozeten, Ege Onur Taga, Samet Oymak

机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡) Google Research(谷歌研究院)

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);verifier(abstract)

AI总结 本文提出Calibrated Attempt-Level (CAL) GRPO方法,通过校准每尝试的权重来提升多尝试链式推理的校准效果,实验证明其在合成和真实数据中优于传统GRPO和简单加权方法。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16004 2026-04-20 cs.CL cs.AI 89%

AgentV-RL: Scaling Reward Modeling with Agentic Verifier

AgentV-RL: 通过代理验证器扩展奖励建模

Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 测试时计算 :verifier(title,summary_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01317 2025-10-01 cs.CL cs.AI 89%

Adaptive Rectification Sampling for Test-Time Compute Scaling

Zhendong Tan, Xingjun Zhang, Chaoyi Hu, Yancheng Pan, Shaoxun Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);CoT(abstract);logical reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17775 2026-03-24 cs.CL cs.AI cs.LG 89%

CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution

CoVerRL: 通过生成器-验证器共进化打破无标签推理中的共识陷阱

Teng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Guiyang Hou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoVerRL通过生成器-验证器共进化机制,解决无标签强化学习中因自洽性最大化导致输出多样性下降的问题,提升数学推理能力。

Comments Project Page: https://zju-real.github.io/CoVerRL Code: https://github.com/ZJU-REAL/CoVerRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00296 2026-03-03 cs.CL cs.AI cs.LG 89%

Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning

逐步惩罚以实现高效推理链

Xintong Li, Sha Li, Rongmei Lin, Hongye Jin, Linwei Li, Hejie Cui, Sarah Zhang, Chia-Yuan Chang, Kewei Cheng, Besnik Fetahu, Priyanka Nigam, Jingbo Shang, Bing Yin

机构 * University of California, San Diego(加州大学圣地亚哥分校) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SWAP通过逐步自适应惩罚减少推理链长度并提升准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15034 2025-10-24 cs.LG cs.AI cs.CL 89%

RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning

Kaiwen Zha, Zhengqi Gao, Maohao Shen, Zhang-Wei Hong, Duane S. Boning, Dina Katabi

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15070 2026-06-16 cs.CL 新提交 89%

Stop When Further Reasoning Won't Help: Attention-State Adaptive Generation in Reasoning Models

当进一步推理无益时停止:推理模型中的注意力状态自适应生成

Jiakai Li, Ke Qin, Rongzheng Wang, Yizhuo Ma, Qizhi Chen, Muquan Li, Shuang Liang

机构 * University of Electronic Science and Technology of China(电子科技大学) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 ubiquitous 智能与可信服务重点实验室)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);test-time compute(abstract)

AI总结 针对大型推理模型过度思考导致冗余和准确率下降的问题,提出无需训练的注意力状态自适应生成方法ASAG,通过推断推理状态动态调整生成策略,在多个基准上平均准确率提升3.2%,生成token减少近40%。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12620 2026-05-14 cs.AI 89%

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

再思一次,行动一次:验证引导的动作选择用于具身智能体

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆斯塔特技术大学)

专题命中 测试时计算 :verifier(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出验证引导的动作选择框架,通过显式验证步骤提升基于MLLM的具身智能体的鲁棒性,实验证明在复杂任务中性能提升达36%。

Comments CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03093 2026-06-23 cs.LG cs.CL 版本更新 88%

ATLAS: Verifier-Guided Adaptive Latent Activation Steering for Efficient LLM Reasoning

ATLAS:验证器引导的自适应潜在激活引导用于高效LLM推理

Tuc Nguyen, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.LG

AI总结 提出ATLAS框架,通过轻量级验证器动态调整推理时潜在状态引导策略,实现每步自适应控制,在数学和编码推理任务上提升准确率并减少测试时token使用。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01993 2026-06-10 cs.CL cs.AI 版本更新 88%

SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning

SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang

机构 * Seoul National University(首尔国立大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11213 2026-06-03 cs.AI cs.CL 88%

FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration

FutureWeaver: 面向模块化协作的多智能体系统的测试时计算规划

Dongwon Jung, Peng Shi, Muhao Chen, Yi Zhang

机构 * University of California, Davis(加州大学戴维斯分校) University of Waterloo(滑铁卢大学) Greenshoe, Inc(Greenshoe公司)

专题命中 测试时计算 :planning(title,abstract);test-time compute(title,abstract);分类 cs.CL、cs.AI

AI总结 提出FutureWeaver框架,通过双层次规划架构和自诱导协作模块,在固定预算下优化多智能体系统的测试时计算分配,显著提升协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12579 2026-05-25 cs.LG cs.AI 88%

VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction

VI-CuRL: 通过置信度引导的方差缩减稳定与验证器无关的强化学习推理

Xin-Qiang Cai, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所高级研究所) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 提出VI-CuRL框架,利用模型内在置信度构建课程学习,在不依赖外部验证器的情况下通过降低动作和问题方差稳定训练,理论保证渐近无偏性,在数学和通用推理基准上超越依赖/不依赖验证器的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16745 2026-05-08 cs.LG cs.AI 88%

Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling

超越记忆:通过递归、记忆和测试时计算扩展推理深度

Ivan Rodkin, Daniil Orel, Konstantin Smirnov, Arman Bolatov, Bilal Elbouardi, Besher Hassan, Yuri Kuratov, Aydar Bulatov, Preslav Nakov, Timothy Baldwin, Artem Shelmanov, Mikhail Burtsev

机构 * MBZUAI(马克斯·普朗克智能研究院) MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过细胞自动机框架探讨多步推理机制,发现LLM在推理步骤增加时性能下降,递归、记忆和测试时计算能提升结果但有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05893 2026-05-08 cs.CL cs.AI 88%

Logic-Regularized Verifier Elicits Reasoning from LLMs

逻辑正则化的验证器激发大语言模型的推理

Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li

机构 * Department of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术系) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOVER,一种基于逻辑规则的无监督验证器,通过内在激活和三个逻辑约束提升LLM推理能力,实验表明其性能优于无监督基线,接近监督验证器水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13274 2026-03-17 cs.LG cs.AI 88%

Learning from Partial Chain-of-Thought via Truncated-Reasoning Self-Distillation

通过截断推理自蒸馏学习部分推理链

Gianluigi Silvestri, Edoardo Cetin

机构 * Radboud University(拉德堡德大学) Sakana AI(萨卡纳人工智能)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TRSD方法,通过自蒸馏提升模型在截断推理下的鲁棒性,减少计算开销并提高推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10756 2025-12-12 cs.CL cs.LG 88%

OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification

基于结果的过程验证器OPV用于高效长链式推理验证

Zijian Wu, Lingkai Kong, Wenwei Zhang, Songyang Gao, Yuzhe Gu, Zhongrui Cai, Tianyou Ma, Yuhong Liu, Zhi Wang, Runyuan Ma, Guangyu Wang, Wei Li, Conghui He, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学机器学习实验室)

专题命中 测试时计算 :verifier(title,abstract);chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 OPV通过基于结果的过程验证方法,实现对长链式推理的高效准确验证,提升大规模注释效率并优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14733 2025-11-11 cs.LG cs.AI 88%

The Energy Cost of Reasoning: Analyzing Energy Usage in LLMs with Test-time Compute

Yunho Jin, Gu-Yeon Wei, David Brooks

机构 * Harvard University(哈佛大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18673 2025-10-14 cs.CL cs.AI cs.MM 88%

Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum

Xinglong Yang, Quan Feng, Zhongying Pan, Xiang Chen, Yu Tian, Wentong Li, Shuofei Qiao, Yuxia Geng, Xingyu Zhao, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hunan Vanguard Group Corporation Co., Ltd.(湖南 Vanguard集团有限公司) Huaneng Information Technology Co., Ltd.(华能信息技术有限公司) Tsinghua University(清华大学) Zhejiang University(浙江大学) PowerChina Huadong Engineering Co., Ltd.(中国电建华东工程有限公司)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02076 2025-07-04 cs.AI cs.LG 88%

Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs

Mohammad Ali Alomrani, Yingxue Zhang, Derek Li, Qianyi Sun, Soumyasundar Pal, Zhanguang Zhang, Yaochen Hu, Rohan Deepak Ajwani, Antonios Valkanas, Raika Karimi, Peng Cheng, Yunzhou Wang, Pengyi Liao, Hanrui Huang, Bin Wang, Jianye Hao, Mark Coates

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05171 2025-02-18 cs.LG cs.CL 88%

Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach

Jonas Geiping, Sean McLeish, Neel Jain, John Kirchenbauer, Siddharth Singh, Brian R. Bartoldson, Bhavya Kailkhura, Abhinav Bhatele, Tom Goldstein

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments The model is available at https://huggingface.co/tomg-group-umd/huginn-0125. Code and data recipe can be found at https://github.com/seal-rg/recurrent-pretraining

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19681 2025-09-25 cs.AI 88%

Calibrated Reasoning: An Explanatory Verifier for Dynamic and Efficient Problem-Solving

Anisha Garg, Engin Tekin, Yash More, David Bick, Nishit Neema, Ganesh Venkatesh

机构 * Applied AI Research, Cerebras(应用人工智能研究,Cerebras)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12088 2026-08-03 cs.SE 版本更新 88%

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation

结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡

Honghao Tan, Haibo Wang, Shin Hwei Tan

专题命中 测试时计算 :reasoning(title,summary_cn);chain-of-thought(abstract)

AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。

Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736

详情

展开后加载摘要…

URL PDF HTML 收藏