arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-08 至 2026-05-08 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 14 篇

2508.16745 2026-05-08 cs.LG cs.AI 88%

Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling

超越记忆:通过递归、记忆和测试时计算扩展推理深度

Ivan Rodkin, Daniil Orel, Konstantin Smirnov, Arman Bolatov, Bilal Elbouardi, Besher Hassan, Yuri Kuratov, Aydar Bulatov, Preslav Nakov, Timothy Baldwin, Artem Shelmanov, Mikhail Burtsev

机构 * MBZUAI(马克斯·普朗克智能研究院) MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过细胞自动机框架探讨多步推理机制,发现LLM在推理步骤增加时性能下降,递归、记忆和测试时计算能提升结果但有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05893 2026-05-08 cs.CL cs.AI 88%

Logic-Regularized Verifier Elicits Reasoning from LLMs

逻辑正则化的验证器激发大语言模型的推理

Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li

机构 * Department of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术系) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOVER,一种基于逻辑规则的无监督验证器,通过内在激活和三个逻辑约束提升LLM推理能力,实验表明其性能优于无监督基线,接近监督验证器水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06116 2026-05-08 cs.AI 87%

Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning

基于策略的分步模型路由以实现高效推理

Wenwen Si, Insup Lee, Osbert Bastani

机构 * Department of Computer and Information Science(计算机与信息科学系)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出了一种基于策略的分步模型路由方法,通过强化学习和阈值校准优化性能与效率的平衡,提升了数学基准测试中的准确率与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05561 2026-05-08 cs.AI 83%

BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models

BitCal-TTS:用于量化推理模型的位校准测试时间缩放

Sai Babu Patarlapalli, Surya Teja Avvaru

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出BitCal-TTS,一种轻量级运行时控制器,通过在线代理、位条件置信度重缩放和位感知后标记确认范围,提升量化推理模型的准确率和稳定性。

Comments 17 pages, 5 figures, 4 tables. Code and reproducibility materials at https://github.com/Saibabu7770/bitcal-tts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05566 2026-05-08 cs.AI cs.CL cs.LG 82%

Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

无意义帮助:提示空间扰动拓宽推理探索

Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LoPE框架,通过任务无关的提示空间扰动提升LLM推理能力,实验显示其在不同规模模型上均优于传统重采样方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19918 2026-05-08 cs.AI cs.LG 81%

Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models

Meta-Reasoner:用于大型语言模型推理时间优化的动态指导

Yuan Sui, Yufei He, Tri Cao, Simeng Han, Yulin Chen, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yale University(耶鲁大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Meta-Reasoner框架,通过动态调整推理策略提升大语言模型的推理效率,实验显示在数学和科学任务中准确率提升9-12%,推理时间减少28-35%。

Comments Accepted by ACL'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05810 2026-05-08 cs.CV 67%

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

CXR-ContraBench:医疗视觉语言模型中否定选项吸引力的基准测试

Zhengru Fang, Yanan Ma, Yu Guo, Senkang Hu, Yixian Zhang, Hangcheng Cao, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 测试时计算 :chain-of-thought(abstract);verifier(abstract)

AI总结 研究医疗视觉语言模型在否定选项吸引力问题上的表现,通过CXR-ContraBench基准测试发现模型在面对矛盾图像和问题时易产生极性反转,提出QCCV-Neg方法有效修复极性混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05873 2026-05-08 stat.ML cs.AI cs.LG math.ST stat.ME stat.TH 62%

CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency

CITE: 在大语言模型自我一致性中实现任意时间有效的统计推断

Hirofumi Ota, Naoto Iwase, Yuki Ichihara, Junpei Komiyama, Masaaki Imaizumi

机构 * Komaba Institute for Science, Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术科学研究生院Komaba研究所) Nagoya University(名古屋大学) NARA Institute of Science and Technology (NAIST) / Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(NAIST科学与技术研究所 / 摩洛哥本·泽德人工智能大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) / RIKEN AIP(摩洛哥本·泽德人工智能大学 / RIKEN AIP) Graduate School of Arts and Sciences, The University of Tokyo / RIKEN AIP / Kyoto University(东京大学艺术科学研究生院 / RIKEN AIP / 京都大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CITE算法,通过交并检验与E过程实现任意时间有效的模型响应分布唯一模式认证,无需预先知道可能答案集,并在扩散尾设置中提升认证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03379 2026-05-08 cs.LG cs.CL 62%

Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference

两次调用、两次矩与重复LLM推理的投票准确性曲线

Yi Liu

机构 * York University(约克大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 研究重复LLM推理的二元正确性层,在条件独立同分布调用下,通过两次调用确定第二矩和相同示例正确性相关性,从而为固定多数投票预算提供分布无关的两调用区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00751 2026-05-08 cs.AI cs.CL 62%

Self-Consistency Is Losing Its Edge: Diminishing Returns and Rising Costs in Modern LLMs

自一致性正在失去优势:现代大语言模型中的边际效益递减与成本上升

Chiyan Loo

机构 * Chiyan Loo

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究指出,随着模型增强,自一致性技术变得低效且可能降低性能,通过实验显示增加推理路径数量带来的准确率提升有限,而成本却显著增加,建议仅在单次可靠度不足的问题上使用多路径采样。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23629 2026-05-08 cs.AI cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.soc-ph 62%

Emergent Slow Thinking in LLMs as Inverse Tree Freezing

大语言模型中涌现的慢思考作为逆树冻结

Sihan Hu, Xiansheng Cai, Yuan Huang, Zhiyuan Yao, Linfeng Zhang, Pan Zhang, Youjin Deng, Kun Chen

机构 * Hefei National Laboratory, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室) Hefei National Laboratory for Physical Sciences at the Microscale and Department of Modern Physics, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室和现代物理系) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS(杭州高等研究院基础物理与数学科学学院) DP Technology(DP技术) Lanzhou Center for Theoretical Physics, Key Laboratory of Theoretical Physics of Gansu Province, Key Laboratory of Quantum Theory and Applications of MoE, Gansu Provincial Research Center for Basic Disciplines of Quantum Physics, Lanzhou University(兰州理论物理中心、甘肃省理论物理重点实验室、教育部量子理论与应用重点实验室、甘肃省量子物理基础学科省重点实验室、兰州大学) AI for Science Institute, Beijing(北京人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统计物理视角揭示大语言模型中慢思考的涌现机制,提出逆树冻结结构,并提出Annealed-RLVR方法提升模型性能。

Comments 34 pages, 17 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05777 2026-05-08 cs.CL 57%

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

通过分布对齐对抗蒸馏估计黑盒大语言模型的不确定性

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang

机构 * School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院) School of Future Technology, Tianjin University, China(天津大学未来技术学院) Georgia Tech Shenzhen Institute, Tianjin University, China(Georgia Tech深圳研究院) School of Artificial Intelligence, Tianjin University, China(天津大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DisAAD方法,通过生成-判别架构引导轻量级代理模型学习黑盒LLM的输出分布高质量区域,从而有效估计其不确定性。实验表明,即使代理模型仅占目标LLM大小的1%,也能实现可靠的不确定性量化。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06847 2026-05-08 cs.SE 50%

Characterizing Faults in Agentic AI: A Taxonomy of Types, Symptoms, and Root Causes

代理AI中的故障特征化:故障类型、症状和根本原因的分类

Mehil B Shah, Mohammad Mehdi Morovati, Mohammad Masudur Rahman, Foutse Khomh

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文通过实证研究,提出代理AI系统故障的分类体系,涵盖34种故障类型,揭示其在结构化输出解释、工具调用、运行时执行和异常处理中的表现,以及数据模式不匹配、依赖漂移等根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05501 2026-05-08 cs.CR 50%

SOCpilot: Verifying Policy Compliance for LLM-Assisted Incident Response

SOCpilot: 验证LLM辅助事件响应中的政策合规性

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

专题命中 测试时计算 :verifier(abstract)

AI总结 SOCpilot通过固定事件包、行动目录、政策规则和验证器,验证LLM辅助事件响应计划的合规性,评估两个LLM提供商在金融行业案例中的表现,去除非合规动作并提供零成本准备检查。

详情

展开后加载摘要…

URL PDF HTML 收藏