arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2509.03581 2026-02-18 cs.AI 83%

Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents

学习何时计划:高效分配测试时计算用于LLM代理

Davide Paglieri, Bartłomiej Cupiał, Jonathan Cook, Ulyana Piterbarg, Jens Tuyls, Edward Grefenstette, Jakob Nicolaus Foerster, Jack Parker-Holder, Tim Rocktäschel

机构 * University of Warsaw(华沙大学) University of Oxford(牛津大学) New York University(纽约大学) Princeton University(普林斯顿大学) University College London(伦敦大学学院)

专题命中 测试时计算 :test-time compute(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种动态规划框架,通过两阶段训练提升LLM在长周期任务中的样本效率和复杂目标达成能力,同时展示人类计划对代理系统性能的增强作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05805 2026-02-06 cs.AI 83%

NEX: Neuron Explore-Exploit Scoring for Label-Free Chain-of-Thought Selection and Model Ranking

NEX: 无标签的神经元探索-利用评分用于无标签的思维链选择和模型排名

Kang Chen, Zhuoka Feng, Sihan Zhao, Kai Xiong, Junjie Nian, Yaoning Wang, Changyi Xiao, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 NEX通过神经元活动信号实现无标签的思维链选择和模型排名,通过探索与利用的交替阶段提升预测准确性。

Comments 21 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03975 2026-02-05 cs.AI 83%

Adaptive Test-Time Compute Allocation via Learned Heuristics over Categorical Structure

通过学习的启发式方法在分类结构上实现自适应测试时计算分配

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种基于学习启发式的自适应测试时计算分配方法,通过状态级选择性验证框架在MATH基准测试中实现更高的准确率,同时减少验证器调用次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02828 2026-02-04 cs.LG 83%

A Single Revision Step Improves Token-Efficient LLM Reasoning

一步修订提升令牌高效大语言模型推理

Yingchuan Zhang, Terry Ma, Wenxuan Zhong, Ping Ma

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Georgia(佐治亚大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 PACER通过轨迹间互相审查提升令牌高效大语言模型推理准确性,显著优于传统投票方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23596 2026-01-30 cs.CL 83%

Think Twice: Branch-and-Rethink Reasoning Reward Model

再思两次:分支与再思考推理奖励模型

Yizhu Jiao, Jiaqi Zeng, Julien Veron Vialard, Oleksii Kuchaiev, Jiawei Han, Olivier Delalleau

机构 * NVIDIA(NVIDIA公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL

AI总结 BR-RM通过两轮次的分支与再思考机制,改进奖励模型的判断准确性与敏感性,实现更精确的推理能力。

Comments Source Code: https://github.com/yzjiao/BR-RM. Model Checkpoints: https://huggingface.co/nvidia/Qwen3-Nemotron-14B-BRRM and https://huggingface.co/nvidia/Qwen3-Nemotron-8B-BRRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20649 2026-01-29 cs.CL 83%

P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering

P2S: 通用领域推理问答中的概率过程监督

Wenlin Zhong, Chengyuan Liu, Yiquan Wu, Bovin Tan, Changlong Sun, Yi Wang, Xiaozhong Liu, Kun Kuang

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 P2S通过概率过程监督提升通用领域推理问答性能,利用路径忠实度奖励解决奖励稀疏性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19249 2026-01-28 cs.AI 83%

GLOVE: Global Verifier for LLM Memory-Environment Realignment

GLOVE:LLM内存-环境重对齐的全局验证器

Xingkun Yin, Hongyang Du

机构 * University of Hong Kong(香港大学)

专题命中 测试时计算 :verifier(title,abstract);planning(abstract);分类 cs.AI

AI总结 GLOVE通过引入相对真理的概念,实现LLM内存与环境的自适应重对齐,无需地面真相监督或强依赖模型反思,提升代理在动态环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14290 2026-01-22 cs.CL 83%

Project Aletheia: Verifier-Guided Distillation of Backtracking for Small Language Models

项目Aletheia:指导验证的回溯蒸馏

Aradhya Dixit, Tianxi Liang, Jai Telang

机构 * Wake Technical Community College(韦克技术社区学院) Cornell University(康奈尔大学) Algoverse

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 项目Aletheia通过指导验证的蒸馏方法,使小型语言模型能够通过回溯和冲突检测提升其在约束满足问题上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01562 2026-01-21 cs.AI 83%

Logics-STEM: Empowering LLM Reasoning via Failure-Driven Post-Training and Document Knowledge Enhancement

Logics-STEM: 通过故障驱动的微调和文档知识增强赋能大语言模型推理

Mingyu Xu, Cheng Fang, Keyue Jiang, Yuqian Zheng, Yanghua Xiao, Baojian Zhou, Qifang Zhao, Suhang Zheng, Xiuwen Zhu, Jiyang Tang, Yongchi Zhao, Yijia Luo, Zhiqi Bai, Yuchi Xu, Wenbo Su, Wei Wang, Bing Zhao, Lin Qu, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团) Shanghai Key Laboratory of Data Science, Fudan University(上海数据科学国家重点实验室,复旦大学) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Logics-STEM通过故障驱动微调和文档知识增强,提升大语言模型在STEM领域的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08734 2026-01-14 cs.SE cs.AI 83%

TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback

TerraFormer:基于LLM的自动化基础设施即代码生成与变异框架

Prithwish Jana, Sam Davidson, Bhavana Bhasker, Andrey Kan, Anoop Deoras, Laurent Callot

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 测试时计算 :verifier(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 TerraFormer通过结合监督微调与验证器引导强化学习,提升LLM生成IaC的准确性与合规性,实现更高的正确率和安全性。

Comments The paper has been published at the 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE 2026), Rio de Janeiro, Brazil, April 12-18, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07238 2026-01-13 cs.AI 83%

Group Pattern Selection Optimization: Let LRMs Pick the Right Pattern for Reasoning

分组模式选择优化:让大推理模型选择正确的推理模式

Hanbin Wang, Jingwei Song, Jinpeng Li, Fei Mi, Lifeng Shang

机构 * Peking University(北京大学) The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 GPSO通过强化学习框架优化大推理模型的推理模式选择,提升其在不同问题上的推理性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00831 2025-12-10 cs.LG 83%

ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning

ReJump:一种用于分析和改进LLM推理的树跳表示

Yuchen Zeng, Shuibai Zhang, Wonjun Kang, Shutong Wu, Lynnix Zou, Ying Fan, Heeju Kim, Ziqian Lin, Jungtaek Kim, Hyung Il Koo, Dimitris Papailiopoulos, Kangwook Lee

机构 * UW-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) FuriosaAI Seoul National University(首尔国立大学) KRAFTON

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.LG

AI总结 ReJump通过树跳表示分析和改进LLM推理,揭示不同任务下的推理行为差异及学习策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17987 2025-11-24 cs.CR cs.AI cs.CV 83%

Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning

通过LLM推理进行文本到图像模型的劫持:Reason2Attack

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, An-An Liu

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 Reason2Attack通过将劫持攻击融入LLM后训练过程,提升生成对抗性提示的推理能力,实现更高效的文本到图像模型攻击

Comments Noted that This paper includes model-generated content that may contain offensive or distressing material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11373 2025-11-17 cs.AI 83%

MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism

Shulin Liu, Dong Du, Tao Yang, Yang Li, Boyu Qiu

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16449 2025-10-21 cs.CL 83%

TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model

Bin Yu, Xinming Wang, Shijie Lian, Haotian Li, Changti Wu, Ruina Hu, Bailing Wang, Yuliang Wei, Kai Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学) East China Normal University(东华大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

Comments 13 pages, 6 figures. Project website: https://zgca-ai4edu.github.io/TrajSelector

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10964 2025-10-14 cs.LG 83%

Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models

Junhyuck Kim, Ethan Ewer, Taehong Moon, Jongho Park, Dimitris Papailiopoulos

机构 * KRAFTON University of Wisconsin–Madison(威斯康星大学麦迪逊分校) UC Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09014 2025-10-13 cs.CL 83%

Learning to Reason Across Parallel Samples for LLM Reasoning

Jianing Qi, Xi Ye, Hao Tang, Zhigang Zhu, Eunsol Choi

机构 * CUNY Grad Center(纽约大学研究生中心) Princeton University(普林斯顿大学) BMCC(布鲁克林社区学院) CCNY(城市学院) New York University(纽约大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23250 2025-10-08 cs.AI cs.CV 83%

Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned

Brandon Ong, Tej Deep Pala, Vernon Toh, William Chandra Tjhi, Soujanya Poria

机构 * AI Singapore(AI新加坡) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24957 2025-09-30 cs.LG 83%

Intra-request branch orchestration for efficient LLM reasoning

Weifan Jiang, Rana Shahout, Yilun Du, Michael Mitzenmacher, Minlan Yu

机构 * Harvard University(哈佛大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01668 2025-06-17 cs.CL 83%

CoT-based Synthesizer: Enhancing LLM Performance through Answer Synthesis

Bohan Zhang, Xiaokang Zhang, Jing Zhang, Jifan Yu, Sijia Luo, Jie Tang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Tsinghua University(清华大学) Key Laboratory of Data Engineering and Knowledge Engineering, Beijing, China(数据工程与知识工程重点实验室)

专题命中 测试时计算 :CoT(title,abstract);reasoning(abstract);分类 cs.CL

Comments Accepted as Main of ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19475 2025-05-29 cs.CL 83%

Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection

Mohammad Mahdi Moradi, Hossam Amer, Sudhir Mudur, Weiwei Zhang, Yang Liu, Walid Ahmed

机构 * Department of Computer Science, Concordia University(计算机科学系,康科迪亚大学) Ascend Team, Huawei Technologies(华为技术有限公司Ascend团队)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11418 2025-05-29 cs.CL 83%

ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning

Liyu Zhang, Weiqi Wang, Tianqing Fang, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

Comments Findings of ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20820 2025-05-28 cs.AI 83%

MT-Mol:Multi Agent System with Tool-based Reasoning for Molecular Optimization

Hyomin Kim, Yunhui Jang, Sungsoo Ahn

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19735 2025-05-27 cs.CL 83%

R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning

Minggui He, Yilun Liu, Shimin Tao, Yuanchang Luo, Hongyong Zeng, Chang Su, Li Zhang, Hongxia Ma, Daimeng Wei, Weibin Meng, Hao Yang, Boxing Chen, Osamu Yoshie

机构 * First Author Affiliation(第一作者机构) Second Author Affiliation(第二作者机构)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18065 2025-05-26 cs.LG 83%

Reward Model Generalization for Compute-Aware Test-Time Reasoning

Zeen Song, Wenwen Qiang, Siyu Zhao, Changwen Zheng, Gang Hua

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13326 2025-05-20 cs.LG 83%

Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately

Yuhang Wang, Youhe Jiang, Bin Cui, Fangcheng Fu

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11966 2025-05-20 cs.AI 83%

Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier

Jianyuan Zhong, Zeju Li, Zhijian Xu, Xiangyu Wen, Kezhi Li, Qiang Xu

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23803 2025-04-09 cs.SE cs.AI 83%

Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute

Yingwei Ma, Yongbin Li, Yihong Dong, Xue Jiang, Rongyu Cao, Jue Chen, Fei Huang, Binhua Li

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12744 2025-02-19 cs.CL 83%

Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation

Yong Zhang, Bingyuan Zhang, Zhitao Li, Ming Li, Ning Cheng, Minchuan Chen, Tao Wei, Jun Ma, Shaojun Wang, Jing Xiao

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted by the 50th IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07191 2025-02-18 cs.AI 83%

Bag of Tricks for Inference-time Computation of LLM Reasoning

Fan Liu, Wenshuo Chao, Naiqiang Tan, Hao Liu

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏