arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2602.04254 2026-02-05 cs.CL 79%

Scaling Agentic Verifier for Competitive Coding

为竞争编程设计的扩展代理验证器

Zeyao Ma, Jing Zhang, Xiaokang Zhang, Jiaxi Yang, Zongmeng Zhang, Jiajun Zhang, Yuheng Jing, Lei Zhang, Hao Zheng, Wenting Zhao, Junyang Lin, Binyuan Hui

机构 * Renmin University of China(中国人民大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 本文提出Agentic Verifier,通过主动推理和高效测试输入生成,提升竞争编程问题解决的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01791 2026-02-03 cs.LG 79%

Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning

Grad2Reward: 从稀疏判断到密集奖励以提升开放性大语言模型推理

Zheng Zhang, Ao Lu, Yuanhao Zeng, Ziwei Shan, Jinjin Guo, Lufei Li, Yexin Li, Kan Ren

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 Grad2Reward通过从判断者模型推理过程中提取密集过程奖励,提升开放性大语言模型推理的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00154 2026-02-03 cs.CR cs.AI 79%

ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models

ReasoningBomb: 通过诱导病态长推理实现隐蔽的拒绝服务攻击

Xiaogeng Liu, Xinyan Wang, Yechao Zhang, Sanjay Kariyappa, Chong Xiang, Muhao Chen, G. Edward Suh, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) University of California, Davis(加州大学戴维斯分校) Cornell University(康奈尔大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 ReasoningBomb通过生成短自然提示诱导大型推理模型进入病态长推理,实现隐蔽的拒绝服务攻击,具有高放大率、隐蔽性和可优化性。

Comments Pre-print. Code is available at https://github.com/SaFo-Lab/ReasoningBomb

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00127 2026-02-03 cs.LG 79%

ALIGN: Aligned Delegation with Performance Guarantees for Multi-Agent LLM Reasoning

ALIGN: 多智能体LLM推理中的对齐委托与性能保证

Tong Zhu, Baiting Chen, Jin Zhou, Hua Zhou, Sriram Sankararaman, Xiaowu Dai

机构 * Department of Biostatistics, UCLA(生物统计学系,加州大学洛杉矶分校) Department of Statistics and Data Science, UCLA(统计学与数据科学系,加州大学洛杉矶分校) Department of Computer Science, UCLA(计算机科学系,加州大学洛杉矶分校) Departments of Statistics and Data Science, and of Biostatistics, UCLA(统计学与数据科学系和生物统计学系,加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 ALIGN通过多智能体对齐委托机制,提升大语言模型在复杂推理任务中的性能保障与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19171 2026-01-29 cs.CL 79%

JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation

JEPA-Reasoner:将潜在推理与标记生成解耦

Bingyang Kelvin Liu, Ziyu Patrick Chen, David P. Woodruff

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 JEPA-Reasoner通过解耦潜在推理与标记生成,提升模型在复杂推理任务中的准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19847 2026-01-28 cs.CL 79%

Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering

识别并转移推理关键神经元:通过激活引导提升LLM推理可靠性

Fangan Dong, Zuming Yan, Xuri Ge, Zhiwei Xu, Mengqi Zhang, Xuanang Chen, Ben He, Xin Xin, Zhumin Chen, Ying Zhou

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出AdaRAS,通过识别并引导推理关键神经元提升LLM推理可靠性,实验显示在数学和编程基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14140 2026-01-28 cs.AI 79%

RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning

思维强化学习:通过推理时间强化学习导航大语言模型推理

Qianyue Hao, Sibo Li, Jian Yuan, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 RL-of-Thoughts通过强化学习训练轻量级导航模型,提升大语言模型推理能力,实现多任务适应性和参数高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02846 2026-01-26 cs.LG physics.comp-ph 79%

Towards Reasoning for PDE Foundation Models: A Reward-Model-Driven Inference-Time-Scaling Algorithm

面向PDE基础模型的推理:一种基于奖励模型的推理时扩展算法

Siddharth Mansingh, James Amarel, Ragib Arnab, Arvind Mohan, Kamaljeet Singh, Gerd J. Kunde, Nicolas Hengartner, Benjamin Migliori, Emily Casleton, Nathan A. Debardeleben, Ayan Biswas, Diane Oyen, Earl Lawrence

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于奖励模型的推理时扩展算法,用于提升PDE基础模型在分布外情况下的预测准确性,减少对训练样本和模型规模的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06423 2026-01-13 cs.AI 79%

Does Inference Scaling Improve Reasoning Faithfulness? A Multi-Model Analysis of Self-Consistency Tradeoffs

推理扩展是否能提升推理的可靠性?对多模型自一致性权衡的分析

Deep Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨推理扩展对推理可靠性的影响,发现不同模型表现各异,自一致性并非普遍有效,需根据具体模型进行测试。

Comments 24 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 79%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12492 2025-12-17 cs.CV cs.CL 79%

Adaptive Detector-Verifier Framework for Zero-Shot Polyp Detection in Open-World Settings

面向开放世界设置的零样本息肉检测自适应检测-验证框架

Shengkai Xu, Hsiang Lun Kao, Tianxiang Xu, Honghui Zhang, Junqiao Wang, Runmeng Ding, Guanyu Liu, Tianyu Shi, Zhenyu Yu, Guofeng Pan, Ziqian Bi, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Columbia University(哥伦比亚大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Apon AI and Brain-Computer Engineering Research Institute(Apon人工智能与脑机工程研究院) Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院) Faculty of Applied Science and Engineering, University of Toronto(多伦多大学应用科学与工程学院) Faculty of Computer Science and Information Technology, University of Malaya(马来亚大学计算机科学与信息技术学院) Zhaolong Technology(智龙科技) Purdue University(普渡大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 本文提出AdaptiveDetector,通过自适应阈值调整和成本敏感强化学习,实现开放世界中零样本息肉检测,提升召回率并减少假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12967 2025-12-16 cs.CL 79%

QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management

QwenLong-L1.5: 长上下文推理与内存管理的训练配方

Weizhou Shen, Ziyi Yang, Chenliang Li, Zhiyuan Lu, Miao Peng, Huashan Sun, Yingcheng Shi, Shengyi Liao, Shaopeng Lai, Bo Zhang, Dayiheng Liu, Fei Huang, Jingren Zhou, Ming Yan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 QwenLong-L1.5通过长上下文数据合成、稳定强化学习和内存增强架构,提升长上下文推理能力及超长任务处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04558 2025-12-05 cs.LG 79%

On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference

在测试时间计算的极限:用于更好推理的顺序奖励过滤

Yue Yu, Qiwei Di, Quanquan Gu, Dongruo Zhou

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG

AI总结 本文提出顺序奖励过滤方法,通过选择高奖励生成物优化测试时间计算,提升大语言模型的推理性能。

Comments 45 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02217 2025-12-03 cs.LG physics.app-ph 79%

Uncertainty Reasoning with Photonic Bayesian Machines

基于光子贝叶斯机器的不确定性推理

F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02008 2025-12-02 cs.CL 79%

The Art of Scaling Test-Time Compute for Large Language Models

为大语言模型扩展推理时的计算艺术

Aradhye Agarwal, Ayan Sengupta, Tanmoy Chakraborty

机构 * Microsoft Research(微软研究院) Indian Institute of Technology Delhi(印度德里理工学院)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.CL

AI总结 本文研究了大语言模型推理时计算扩展策略的优化,发现不同模型类型和问题难度对性能有显著影响,并提出了基于计算预算的选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23262 2025-12-01 cs.AI 79%

Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning

像人类一样适应:具有测试时推理的元认知代理

Yang Li, Zhiyuan He, Yuxuan Huang, Zhuhanling Xiao, Chao Yu, Meng Fang, Kun Shao, Jun Wang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Oxford(牛津大学) Tsinghua University(清华大学) University of Liverpool(利物浦大学) University College London(伦敦大学学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出元认知测试时推理框架,通过元认知自我更新实现模型在测试时的高效适应,实验表明其在Atari游戏中表现出优于基线的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00762 2025-11-11 cs.AI 79%

Do We Truly Need So Many Samples? Multi-LLM Repeated Sampling Efficiently Scales Test-Time Compute

Jianhao Chen, Zishuo Xun, Bocheng Zhou, Han Qi, Hangfan Zhang, Qiaosheng Zhang, Yang Chen, Wei Hu, Yuzhong Qu, Wanli Ouyang, Shuyue Hu

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Auckland(奥克兰大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI

Journal ref AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18751 2025-11-07 cs.AI cs.CV 79%

Seg the HAB: Language-Guided Geospatial Algae Bloom Reasoning and Segmentation

Patterson Hsieh, Jerry Yeh, Mao-Chi He, Wen-Han Hsieh, Elvis Hsieh

机构 * UC San Diego(加州大学圣地亚哥分校) UC Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24198 2025-11-05 cs.CL 79%

TwT: Thinking without Tokens by Habitual Reasoning Distillation with Multi-Teachers' Guidance

Jingxian Xu, Mengyu Zhou, Weichang Liu, Hanbing Liu, Shi Han, Dongmei Zhang

机构 * Nankai University(南开大学) BeijingJiaoTong University(北京交通大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21473 2025-10-27 cs.CL 79%

MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization

Chenglong Wang, Yang Gan, Hang Zhou, Chi Hu, Yongyu Mu, Kai Song, Murun Yang, Bei Li, Chunliang Zhang, Tongran Liu, Jingbo Zhu, Zhengtao Yu, Tong Xiao

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17472 2025-10-24 stat.ML cs.LG 79%

Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs

Paula Cordero-Encinar, Andrew B. Duncan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15440 2025-10-20 cs.CV cs.AI 79%

Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning

Xuchen Li, Xuzhao Li, Shiyu Hu, Kaiqi Huang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院自动化研究所) ZGCA(中钢集团自动化研究所) NTU(国立台湾大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12167 2025-10-20 cs.CL 79%

Towards Inference-time Scaling for Continuous Space Reasoning

Minghan Wang, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Submitted to AAAI 2026 on July 25, 2025. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14942 2025-10-17 cs.AI 79%

GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning

Yao Zhang, Yu Wu, Haowei Zhang, Weiguo Li, Haokun Chen, Jingpei Wu, Guohao Li, Zhen Han, Volker Tresp

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10494 2025-10-14 cs.AI 79%

Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning

Martina G. Vilas, Safoora Yousefi, Besmira Nushi, Eric Horvitz, Vidhisha Balachandran

机构 * Goethe University Frankfurt(法兰克福歌德大学) Microsoft Research(微软研究院) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12399 2025-10-13 cs.LG stat.ML 79%

ROC-n-reroll: How verifier imperfection affects test-time scaling

Florian E. Dorner, Yatong Chen, André F. Cruz, Fanny Yang

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck ETH Center for Learning Systems(马克斯·普朗克ETH学习系统中心) Max Planck Institute for Intelligent Systems, Tübingen(图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

Comments 45 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07642 2025-10-10 cs.CL 79%

Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models

Đorđe Klisura, Joseph Khoury, Ashish Kundu, Ram Krishnan, Anthony Rios

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Louisiana State University(路易斯安那州立大学) Cisco Research(思科研究)

专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL

Comments 8 pages + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01032 2025-10-02 cs.LG 79%

Meaningless Tokens, Meaningful Gains: How Activation Shifts Enhance LLM Reasoning

Zeru Shi, Yingjia Wan, Zhenting Wang, Qifan Wang, Fan Yang, Elisa Kreiss, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) UCLA(加州大学洛杉矶分校) Meta AI Wake Forest University(威克森林大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23285 2025-10-01 cs.AI 79%

Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23621 2025-09-29 cs.CL 79%

Table-R1: Inference-Time Scaling for Table Reasoning

Zheyuan Yang, Lyuhao Chen, Arman Cohan, Yilun Zhao

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏