arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2511.00640 2026-02-05 cs.AI cs.CL cs.LG 82%

DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching

DTS: 通过解码树草图增强大推理模型

Zicheng Xu, Xiuyi Lou, Guanchu Wang, Yu-Neng Chuang, Feng Luo, Guangyao Zheng, Alexander S. Szalay, Zirui Liu, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) University of North Carolina at Charlotte(北卡罗来纳大学教堂山分校) Rice University(莱斯大学) University of Minnesota(明尼苏达大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DTS通过解码树草图方法提升大推理模型的推理能力,显著提高准确性并减少重复生成,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20326 2026-01-29 cs.CL cs.AI cs.LG 82%

Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning

超越加速 -- 利用KV缓存进行采样与推理

Zeyu Xing, Xing Li, Hui-Ling Zhen, Mingxuan Yuan, Sinno Jialin Pan

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将KV缓存作为轻量级表示用于采样与推理,展示了其在链式嵌入和快速/缓慢思考切换任务中的有效性,显著提升了推理效率。

Comments Accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17498 2026-01-28 cs.LG cs.AI cs.CL 82%

Improving Value-based Process Verifier via Structural Prior Injection

通过结构先验注入改进基于价值的过程验证器

Zetian Sun, Dongfang Li, Baotian Hu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过注入结构先验改进基于价值的过程验证器,提升其性能并减少误差。

Comments This version is deprecated. Please refer to our new version: arXiv:2508.10539

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21825 2026-01-12 cs.LG cs.AI cs.CL 82%

Let Me Think! A Long Chain-of-Thought Can Be Worth Exponentially Many Short Ones

让我思考!一个长的推理链可能比许多短的链多出指数倍

Parsa Mirtaheri, Ezra Edelman, Samy Jelassi, Eran Malach, Enric Boix-Adsera

机构 * UC San Diego(UC圣地亚哥大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学)

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了推理链扩展策略,证明在特定图连通性问题中顺序扩展比并行扩展更有效。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01457 2025-12-24 cs.LG cs.AI cs.CL 82%

Zero-Overhead Introspection for Adaptive Test-Time Compute

无开销的适应性测试时间计算 introspection

Rohin Manvi, Joey Hong, Tim Seyde, Maxime Labonne, Mathias Lechner, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Liquid AI

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ZIP-RC通过无开销的实时自我反省预测奖励和成本,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18215 2025-12-23 cs.LG cs.AI cs.CL cs.CV 82%

Stable and Efficient Single-Rollout RL for Multimodal Reasoning

稳定且高效的多模态推理单次迭代强化学习

Rui Liu, Dian Yu, Lei Ke, Haolin Liu, Yujun Zhou, Zhenwen Liang, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学) University of Notre Dame(诺特大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MSSR通过熵基优势塑造机制,实现多模态推理中的稳定高效单次迭代强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17206 2025-12-22 cs.CV 82%

Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs

推理调色板:通过潜在上下文化调节推理以实现可控探索用于(V)LMs

Rujiao Long, Yang Li, Xingyao Zhang, Weixun Wang, Tianqianjin Lin, Xi Zhao, Yuchi Xu, Wenbo Su, Junchi Yan, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract)

AI总结 Reasoning Palette通过引入潜在变量调节模型推理策略,提升可控探索和持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16304 2025-12-19 cs.SD 82%

CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching

CogSR: 通过思维链引导的流匹配实现语义感知的语音超分辨率

Jiajun Yuan, Xiaochen Wang, Yuhang Xiao, Yulin Wu, Chenhao Hu, Xueyang Lv

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心、计算机科学学院、武汉大学、武汉) School of Artificial Intelligence, Jianghan University, Wuhan, China(人工智能学院、江汉大学、武汉) Xiaomi Corporation, Beijing, China(小米公司、北京)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 CogSR通过整合大型音频-语言模型和思维链推理,实现语义感知的语音超分辨率,提升低采样率录音的修复精度和语言准确性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17793 2025-11-20 cs.CL cs.AI cs.LG 82%

Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains

Austin Xu, Xuan-Phi Nguyen, Yilun Zhou, Chien-Sheng Wu, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 29 pages, 9 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03318 2025-10-30 cs.CV 82%

Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning

Yibin Wang, Zhimin Li, Yuhang Zang, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Hunyuan, Tencent(腾讯 Hunyuan)

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);CoT(abstract)

Comments [NeurIPS2025] Project Page: https://codegoat24.github.io/UnifiedReward/think

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00890 2025-10-23 cs.AI cs.CL cs.LG 82%

AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks

Fali Wang, Hui Liu, Zhenwei Dai, Jingying Zeng, Zhiwei Zhang, Zongyu Wu, Chen Luo, Zhen Li, Xianfeng Tang, Qi He, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02298 2025-10-21 cs.LG cs.AI cs.CL 82%

CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment

Guofu Xie, Yunsheng Shi, Hongtao Tian, Ting Yao, Xiao Zhang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学) Tencent Inc(腾讯公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22637 2025-10-16 cs.CL cs.AI cs.LG 82%

Variational Reasoning for Language Models

Xiangxin Zhou, Zichen Liu, Haonan Wang, Chao Du, Min Lin, Chongxuan Li, Liang Wang, Tianyu Pang

机构 * Sea AI Lab(海智实验室) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) NUS(新加坡国立大学) RUC(哈尔滨工业大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04439 2025-10-07 cs.AI cs.CL cs.LG 82%

ArcMemo: Abstract Reasoning Composition with Lifelong LLM Memory

Matthew Ho, Chen Si, Zhaoxiang Feng, Fangxu Yu, Yichi Yang, Zhijian Liu, Zhiting Hu, Lianhui Qin

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04405 2025-10-07 cs.CL cs.AI cs.LG 82%

MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science

Ran Xu, Yuchen Zhuang, Yishan Zhong, Yue Yu, Zifeng Wang, Xiangru Tang, Hang Wu, May D. Wang, Peifeng Ruan, Donghan Yang, Tao Wang, Guanghua Xiao, Xin Liu, Carl Yang, Yang Xie, Wenqi Shi

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21459 2025-09-29 cs.CL cs.AI cs.DB cs.LG 82%

A State-of-the-Art SQL Reasoning Model using RLVR

Alnur Ali, Ashutosh Baheti, Jonathan Chang, Ta-Chung Chi, Brandon Cui, Andrew Drozdov, Jonathan Frankle, Abhay Gupta, Pallavi Koppol, Sean Kulinski, Jonathan Li, Dipendra Misra, Krista Opsahl-Ong, Jose Javier Gonzalez Ortiz, Matei Zaharia, Yue Zhang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11343 2025-06-13 cs.LG cs.AI cs.CL stat.ML 82%

A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce

Wei Xiong, Jiarui Yao, Yuhui Xu, Bo Pang, Lei Wang, Doyen Sahoo, Junnan Li, Nan Jiang, Tong Zhang, Caiming Xiong, Hanze Dong

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07301 2025-06-06 cs.CL cs.AI cs.LG 82%

The Lessons of Developing Process Reward Models in Mathematical Reasoning

Zhenru Zhang, Chujie Zheng, Yangzhen Wu, Beichen Zhang, Runji Lin, Bowen Yu, Dayiheng Liu, Jingren Zhou, Junyang Lin

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14681 2025-05-28 cs.AI cs.CL cs.CV cs.IR cs.LG 82%

Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training

Mengru Wang, Xingyu Chen, Yue Wang, Zhiwei He, Jiahao Xu, Tian Liang, Qiuzhi Liu, Yunzhi Yao, Wenxuan Wang, Ruotian Ma, Haitao Mi, Ningyu Zhang, Zhaopeng Tu, Xiaolong Li, Dong Yu

机构 * Tencent(腾讯)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14398 2025-05-21 cs.CL cs.AI cs.LG 82%

Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation

Peter Baile Chen, Yi Zhang, Dan Roth, Samuel Madden, Jacob Andreas, Michael Cafarella

机构 * MIT(麻省理工学院) AWS AI(亚马逊人工智能) University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Data and code are available at https://peterbaile.github.io/lag/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08672 2025-04-14 cs.CL cs.AI cs.LG 82%

Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning

Fangzhi Xu, Hang Yan, Chang Ma, Haiteng Zhao, Qiushi Sun, Kanzhi Cheng, Junxian He, Jun Liu, Zhiyong Wu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00511 2025-02-14 cs.LG cs.AI cs.CL 82%

Bridging Internal Probability and Self-Consistency for Effective and Efficient LLM Reasoning

Zhi Zhou, Tan Yuhao, Zenan Li, Yuan Yao, Lan-Zhe Guo, Xiaoxing Ma, Yu-Feng Li

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preliminary work

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02441 2024-12-04 cs.AI cs.CL cs.LG 82%

Artificial Expert Intelligence through PAC-reasoning

Shai Shalev-Shwartz, Amnon Shashua, Gal Beniamini, Yoav Levine, Or Sharir, Noam Wies, Ido Ben-Shaul, Tomer Nussbaum, Shir Granot Peled

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18695 2024-10-10 cs.LG cs.AI cs.CL 82%

Learning to Correct for QA Reasoning with Black-box LLMs

Jaehyung Kim, Dongyoung Kim, Yiming Yang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages; EMNLP 2024 (long, main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11996 2024-06-12 cs.LG cond-mat.mes-hall cond-mat.mtrl-sci cond-mat.soft cs.AI cs.CL 82%

Accelerating Scientific Discovery with Generative Knowledge Extraction, Graph-Based Representation, and Multimodal Intelligent Graph Reasoning

Markus J. Buehler

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14100 2023-03-27 cs.RO 82%

Errors are Useful Prompts: Instruction Guided Task Programming with Verifier-Assisted Iterative Prompting

Marta Skreta, Naruki Yoshikawa, Sebastian Arellano-Rubach, Zhi Ji, Lasse Bjørn Kristensen, Kourosh Darvish, Alán Aspuru-Guzik, Florian Shkurti, Animesh Garg

专题命中 测试时计算 :verifier(title,abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04301 2023-02-21 cs.LG cs.AI cs.CL 82%

Unveiling Transformers with LEGO: a synthetic reasoning task

Yi Zhang, Arturs Backurs, Sébastien Bubeck, Ronen Eldan, Suriya Gunasekar, Tal Wagner

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13918 2026-07-16 math.ST cs.AI cs.LG stat.TH 新提交 82%

Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings

大语言模型工具中的部分相关验证级联:凹对数优势、多项式可靠性和盲点上限

Jiangang Han

机构 * Independent researcher(独立研究者)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型工具中部分相关验证级联,将生成器错误接受率建模为潜在变量,给出理论。包括凹对数优势、多项式可靠性等特性,可测量,通过合成测试对比不同方法效果,指出实际应通过去相关而非加门提升可靠性。

Comments 14 pages, 2 figures. Code and synthetic-recovery experiments: https://github.com/jianganghan/harness-verifier-cascades

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25140 2026-03-18 cs.AI cs.CL 82%

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory

ReasoningBank: 通过推理记忆扩展智能体自我进化

Siru Ouyang, Jun Yan, I-Hung Hsu, Yanfei Chen, Ke Jiang, Zifeng Wang, Rujun Han, Long T. Le, Samira Daruki, Xiangru Tang, Vishy Tirumalashetty, George Lee, Mahsan Rofouei, Hangfei Lin, Jiawei Han, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究) Yale University(耶鲁大学) Google Cloud AI(谷歌云人工智能)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReasoningBank,通过整合智能体自我评估的成功与失败经验,提升其持续学习能力,并引入MaTTS加速学习过程,提升任务表现与效率。

Comments Accepted to ICLR 2026; Code: https://github.com/google-research/reasoning-bank

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18311 2025-12-23 cs.AI cs.SE 81%

Monitoring Monitorability

监控可监控性

Melody Y. Guan, Miles Wang, Micah Carroll, Zehao Dou, Annie Y. Wei, Marcus Williams, Benjamin Arnav, Joost Huizinga, Ian Kivlichan, Mia Glaese, Jakub Pachocki, Bowen Baker

机构 * OpenAI

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 研究提出评估框架和指标,探讨了不同因素对AI系统可监控性的影响,发现更长的思维链和优化方法能提升监控效果。

详情

展开后加载摘要…

URL PDF HTML 收藏