arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-02 至 2026-04-02 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2604.00018 2026-04-02 cs.CL cs.AI 81%

Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning

再三思考后再写作——一种基于熵的解码策略以增强大语言模型推理

Jiashu He, Meizhu Liu, Olaitan P Olaleye, Amit Agarwal, M. Avendi, Yassi Abbasi, Matthew Rowe, Hitesh Laxmichand Patel, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI Science(甲骨文人工智能科学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于熵的解码策略,通过在生成过程中引入令牌级适应性,提高大语言模型的推理能力,实验表明在GSM8K等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14275 2026-04-02 cs.CL 70%

Let the Model Distribute Its Doubt: Confidence Estimation through Verbalized Probability Distribution

让模型分配其怀疑:通过 verbalized 概率分布进行置信度估计

Ante Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过生成 verbalized 概率分布提升置信度估计,系统实验显示其在多个 LLM 和任务中表现优异,推理效率高且计算节省显著,但也揭示了特定任务的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00356 2026-04-02 cs.AI cs.CL 62%

Signals: Trajectory Sampling and Triage for Agentic Interactions

信号:代理互动的轨迹采样与优先级排序

Shuguang Chen, Adil Hafeez, Salman Paracha

机构 * DigitalOcean Holdings, Inc.(DigitalOcean控股公司)

专题命中 测试时计算 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于信号的轻量框架,用于高效筛选代理交互轨迹,通过计算低成本信号提升采样效率,实验证明其在不同任务中均能有效提升信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00072 2026-04-02 cs.LG cs.AI stat.ML 62%

Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates

对AI安全闸门中分类-验证二元对立的实证验证

Arsenios Scrivens

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究通过实证表明,基于分类器的安全闸门在AI系统经过数百次迭代后无法维持可靠监管,且结构上无法实现。

Comments 21 pages, 9 figures. Companion theory paper: doi:10.5281/zenodo.19237451

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01220 2026-04-02 cs.CL 57%

Universal YOCO for Efficient Depth Scaling

通用YOCO用于高效深度扩展

Yutao Sun, Li Dong, Tianzhu Ye, Shaohan Huang, Jianyong Wang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通用YOCO(YOCO-U),结合递归计算与YOCO解码器解码器架构,实现更高效的推理效率与深度扩展能力,通过参数共享和浅层高效注意力层提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02966 2026-04-02 cs.PL cs.AI cs.MA 57%

Lumos: Let there be Language Model System Certification

Lumos: 让语言模型系统认证成为可能

Isha Chaudhary, Vedaant Jain, Prineet Parhar, Kavya Sachdeva, Avaljot Singh, Sayan Ranu, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 Lumos提出首个系统化框架,通过概率编程DSL实现语言模型系统行为的正式认证,支持复杂关系和时间规格,揭示了先进视觉语言模型在自动驾驶场景中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏