arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2605.07442 2026-05-11 cs.LG 90%

GameGen-Verifier: Parallel Keypoint-Based Verification for LLM-Generated Games via Runtime State Injection

GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证

Chaobo Jia, Ruipeng Wan, Ting Sun, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu

机构 * CUHK(香港中文大学) HUST(华中科技大学) Lionrock AI Lab(Lionrock人工智能实验室) NTU(国立新加坡大学) HKU(香港大学)

专题命中 测试时计算 :verifier(title,title_cn);分类 cs.LG

AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07654 2026-05-11 stat.ML cs.CL cs.LG 88%

Reliable Chain-of-Thought via Prefix Consistency

通过前缀一致性提升可靠性的链式思维

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama

机构 * Nagoya University(名古屋大学) Nara Institute of Science and Technology(奈良科学技術大學) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP(理化学研究所(AIP))

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过前缀一致性来提升链式思维的可靠性,利用再生过程中答案的重复频率作为权重,无需访问token对数概率或自我评价提示,在多个模型和基准测试中表现出色,减少至21倍的token使用量。

Comments See our project page at https://naoto-iwase.github.io/prefix-consistency-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 87%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23032 2026-05-11 cs.CL cs.AI cs.LG 87%

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

链式推理真的不可解释性吗?链式推理可以在不提示 verbalization 的情况下保持忠实

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :chain-of-thought(title);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文挑战了链式推理的忠实性定义,指出基于提示注入的偏差特征指标过于狭隘,通过新指标显示推理预算影响提示 verbalization,并通过因果中介分析证明非 verbalized 提示可通过链式推理影响预测,呼吁更广泛的可解释性工具。

Comments Accepted to ACL 2026. 23 pages, 29 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21839 2026-05-11 cs.CY cs.AI cs.GT cs.LG 84%

Test-Time Compute Games

测试时计算博弈

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Hasso Plattner Institute(哈索·普拉特纳研究所)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型作为服务市场的社会效率问题,提出反第二种价格拍卖机制以减少计算量浪费,通过实验验证了该机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07461 2026-05-11 cs.CL 83%

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

基于评分标准的思考:从外部评估者到内部推理指导

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07153 2026-05-11 cs.CL 83%

Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs

超越推理:强化学习解锁大语言模型中的参数知识

Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang, Xueqi Cheng, Fei Sun

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究强化学习在零样本、单跳、封闭书 QA 任务中提升参数知识直接回忆的能力,发现其平均相对提升达27%,揭示 RL 通过重新分配概率质量解锁潜在知识而非获取新事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08070 2026-05-11 cs.AI 79%

VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

VecCISC:通过推理轨迹聚类和候选答案选择改进置信度引导的自一致性

James Petullo, Sonny George, Dylan Cashman, Nianwen Xue

机构 * Computer Science Department, Brandeis University(布拉德雷大学计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 VecCISC通过推理轨迹聚类和候选答案筛选优化置信度引导的自一致性方法,减少计算开销并保持高精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05439 2026-05-11 cs.AI cs.FL 74%

BEAVER: An Efficient Deterministic LLM Verifier

BEAVER:一种高效的确定性大语言模型验证器

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :verifier(title);分类 cs.AI

AI总结 BEAVER 提出了一种计算大语言模型安全属性确定性概率界限的框架,通过新颖的 Token trie 和 Frontier 数据结构系统探索模型输出空间,提供可靠保证并识别更多高风险实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09782 2026-05-11 cs.LG cs.AI cs.CL 67%

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

在RLVR中采用梯度保持视角实现灵活熵控制

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从梯度保持裁剪角度出发,提出动态裁剪阈值机制和动态熵控制策略,有效缓解熵崩溃问题并提升多基准性能。

Comments https://github.com/Kwen-Chen/Flexible-Entropy-Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00663 2026-05-11 cs.RO cs.CV 50%

Affordance Agent Harness: Verification-Gated Skill Orchestration

可及性代理框架:验证门控技能协调

Haojian Huang, Jiahao Shi, Yinchuan Li, Yingcong Chen

机构 * HKUST(GZ)(香港理工大学(广州)) Knowin AI Harbin Engineering University(哈尔滨工程大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。

Comments 43 pages, 22 figures, 8 tables. Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏