arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2601.22484 2026-02-02 cs.LG 85%

Mitigating Cognitive Inertia in Large Reasoning Models via Latent Spike Steering

通过潜在尖峰引导缓解大推理模型中的认知惯性

Seojin Lee, ByeongJeong Kim, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Korea(人工智能系, Chung-Ang 大学,首尔,韩国)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);self-correction(abstract);分类 cs.LG

AI总结 STARS通过监测潜在动态,实时引导大推理模型缓解认知惯性问题,提升推理准确性和效率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14773 2025-11-20 cs.CL 85%

Temporal Predictors of Outcome in Reasoning Language Models

Joey David

机构 * Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 4 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14153 2025-11-19 cs.CV cs.AI 85%

LENS: Learning to Segment Anything with Unified Reinforced Reasoning

Lianghui Zhu, Bin Ouyang, Yuxuan Zhang, Tianheng Cheng, Rui Hu, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Li Yu, Wenyu Liu, Xinggang Wang

机构 * vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Code is released at https://github.com/hustvl/LENS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17089 2025-11-18 cs.CL 85%

Chain-of-Thought Driven Adversarial Scenario Extrapolation for Robust Language Models

Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Ye Wang, Gang Tan, Shagufta Mehnaz

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments 19 pages, 5 figures. Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23845 2025-11-06 cs.CL 85%

Read Your Own Mind: Reasoning Helps Surface Self-Confidence Signals in LLMs

Jakub Podolak, Rajeev Verma

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL

Comments Presented at UncertaiNLP Workshop at EMNLP 2025 https://aclanthology.org/2025.uncertainlp-main.21.pdf

Journal ref UncertaiNLP Workshop at Empirical Methods in Natural Language Processing 2025 (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18454 2025-10-24 cs.CL 85%

Hybrid Latent Reasoning via Reinforcement Learning

Zhenrui Yue, Bowen Jin, Huimin Zeng, Honglei Zhuang, Zhen Qin, Jinsung Yoon, Lanyu Shang, Jiawei Han, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) LMU(莱比锡马克斯·普朗克研究所)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23196 2025-09-30 cs.CL 85%

From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs

Haonan Wang, Weida Liang, Zihang Fu, Nie Zheng, Yifan Zhang, Yao Tong, Tongyao Zhu, Hao Jiang, Chuang Li, Jiaying Wu, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) MiroMind AI University of Sydney(悉尼大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18341 2025-06-24 cs.CL 85%

Less Data Less Tokens: Multilingual Unification Learning for Efficient Test-Time Reasoning in LLMs

Kang Chen, Mengdi Zhang, Yixin Cao

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Meituan Group(美团集团)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17829 2025-05-26 cs.CL 85%

Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning

Zezhong Wang, Xingshan Zeng, Weiwen Liu, Yufei Wang, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu, Kam-Fai Wong

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14674 2025-05-21 cs.CL 85%

Reward Reasoning Model

Jiaxin Guo, Zewen Chi, Li Dong, Qingxiu Dong, Xun Wu, Shaohan Huang, Furu Wei

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02665 2025-05-09 cs.AI 85%

A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law

Qianjun Pan, Wenkai Ji, Yuyang Ding, Junsong Li, Shilian Chen, Junyi Wang, Jie Zhou, Qin Chen, Min Zhang, Yulan Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12501 2025-04-08 cs.CL 85%

Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge

Qiyuan Zhang, Yufei Wang, Yuxin Jiang, Liangyou Li, Chuhan Wu, Yasheng Wang, Xin Jiang, Lifeng Shang, Ruiming Tang, Fuyuan Lyu, Chen Ma

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13692 2024-08-02 cs.CL 85%

Prover-Verifier Games improve legibility of LLM outputs

Jan Hendrik Kirchner, Yining Chen, Harri Edwards, Jan Leike, Nat McAleese, Yuri Burda

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07532 2024-06-11 cs.CL 85%

It's Not Easy Being Wrong: Large Language Models Struggle with Process of Elimination Reasoning

Nishant Balepur, Shramay Palta, Rachel Rudinger

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments ACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21430 2026-06-05 cs.RO 85%

EVE: A Generator-Verifier System for Generative Policies

EVE: 一种生成策略的生成-验证系统

Yusuf Ali, Gryphon Patlin, Karthik Kothuri, Jeremiah Coholich, Muhammad Zubair Irshad, Wuwei Liang, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院) Toyota Research Institute(丰田研究院) Symbotic Inc.(Symbotic公司)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);test-time compute(abstract)

AI总结 本文提出EVE系统,通过生成-验证框架在测试时提升预训练生成策略的性能,利用零样本视觉语言模型验证者进行动作优化,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30085 2026-05-29 cs.AI cs.CL cs.LG stat.ML 85%

Conformal Certification of Reasoning Trace Prefixes

推理轨迹前缀的保形认证

Matt Y. Cheung, Ashok Veeraraghavan, Hanjie Chen, Guha Balakrishnan

机构 * Department of Electrical & Computer Engineering, Rice University(电气与计算机工程系,里士满大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CROP方法,通过保形校准选择阈值,返回最长无错前缀,并控制错误包含概率,平衡保留有效推理与丢弃误导后缀。

Comments Code available at https://github.com/matthewyccheung/crop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28805 2026-05-28 cs.CL cs.AI cs.CV cs.LG 85%

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学) Microcyto Princeton University(普林斯顿大学)

专题命中 测试时计算 :verifier(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。

Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14232 2026-04-16 cs.LG cs.AI cs.CL 85%

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models

通过扩展测试时间计算实现IOI金牌奖章的开放权重模型

Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

机构 * NVIDIA

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GenCluster框架,利用开放权重模型在有限预算下高效探索解决方案空间,实现IOI金牌级性能,缩小开放与闭合系统差距。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV 85%

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08985 2026-03-27 cs.CV 85%

Verifier Threshold: An Efficient Test-Time Scaling Approach for Image Generation

验证阈值:一种高效的测试时间扩展方法用于图像生成

Vignesh Sundaresha, Akash Haridas, Vikram Appia, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD(超威半导体公司) Stony Brook University(石溪大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);test-time compute(abstract)

AI总结 本文提出Verifier-Threshold方法,通过自动重新分配测试时间计算,提升图像生成模型的效率,在GenEval基准上实现2-4倍的计算时间减少。

Comments ICLR 2026 ReALM-Gen and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19328 2026-03-23 cs.CR 85%

The Verifier Tax: Horizon Dependent Safety Success Tradeoffs in Tool Using LLM Agents

验证者税:工具使用LLM代理中地平线依赖的安全成功权衡

Tanmay Sah, Vishal Srivastava, Dolly Sah, Kayden Jordan

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);planning(abstract)

AI总结 研究运行时强制执行对多步骤工具使用大语言模型代理端到端任务性能的影响,发现安全调解虽能拦截94%的非合规动作,但难以保证安全完成,凸显了需要具备基础身份验证和后干预推理能力的代理。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19118 2026-03-20 cs.AI cs.CL cs.LG 85%

How Uncertainty Estimation Scales with Sampling in Reasoning Models

推理模型中不确定性估计随采样规模的变化

Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel

机构 * Institute of Computer Science(计算机科学研究所) University of Tartu(塔尔图大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理模型中不确定性估计随采样规模变化的机制,通过平行采样方法分析自一致性与置信度信号的扩展链式推理表现,发现信号组合能显著提升AUROC性能,且领域依赖性明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21497 2026-03-10 cs.CV 85%

See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理

Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen

机构 * Southeast University(东南大学) University of Oxford(牛津大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18672 2026-03-03 cs.LG cs.AI cs.CL 85%

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

混合专家语言模型在推理任务中的最优稀疏性

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura, Takumi Okamoto, Daisuke Nohara, Jun Suzuki, Rio Yokota

机构 * Institute of Science Tokyo(东京科学研究院) NII LLMC(国家信息研究所语言模型中心) Tohoku University(东北大学) RIKEN(日本研究机构)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析MoE模型的稀疏性对记忆和推理任务的影响,发现推理任务需在活跃FLOPs和TPP之间找到最优平衡。

Comments Accepted as an oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11683 2026-02-13 cs.AI cs.CL cs.LG 85%

ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces

ThinkRouter: 通过潜在空间与离散空间之间的路由思维实现高效推理

Xin Xu, Tong Yu, Xiang Chen, Haoliang Wang, Julian McAuley, Saayan Mitra

机构 * Adobe Research(Adobe研究)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ThinkRouter通过在低信心时路由至离散空间,高信心时路由至潜在空间,提升推理效率和准确性,平均提高Pass@1 19.70分,减少生成长度15.55%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05325 2025-12-08 cs.CL cs.AI cs.LG 85%

LYNX: Learning Dynamic Exits for Confidence-Controlled Reasoning

LYNX: 为置信度控制推理学习动态退出

Ömer Faruk Akgül, Yusuf Hakan Kalaycı, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL(美国陆军战争研究所)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LYNX通过利用模型自身隐藏状态实现置信度控制的提前退出,提升推理效率和准确性,适用于多种任务和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12396 2025-11-24 cs.IR 85%

LLM-CoT Enhanced Graph Neural Recommendation with Harmonized Group Policy Optimization

基于协同群体策略优化的LLM-CoT增强图神经推荐

Hailong Luo, Bin Wu, Hongyong Jia, Qingqing Zhu, Lianlei Shan

专题命中 测试时计算 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 LGHRec通过结合LLM的CoT推理能力与协同群体策略优化,提升图神经推荐系统的信息密度和对比学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05362 2025-11-04 cs.CL cs.AI cs.LG 85%

On the Bias of Next-Token Predictors Toward Systematically Inefficient Reasoning: A Shortest-Path Case Study

Riccardo Alberghi, Elizaveta Demyanenko, Luca Biggio, Luca Saglietti

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19477 2025-10-29 cs.CL cs.AI cs.LG 85%

Provable Scaling Laws for the Test-Time Compute of Large Language Models

Yanxi Chen, Xuchen Pan, Yaliang Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14901 2025-10-17 cs.LG cs.AI cs.CL 85%

Reasoning with Sampling: Your Base Model is Smarter Than You Think

Aayush Karan, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏