arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-15 至 2026-05-15 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2605.14450 2026-05-15 cs.IR 87%

Stop Overthinking: Unlocking Efficient Listwise Reranking with Minimal Reasoning

停止过度思考:通过最小推理解锁高效的列表级重排序

Danyang Liu, Kan Li

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出Length-Regularized Self-Distillation框架,通过合成高效推理数据集,减少推理成本,提升列表级重排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03969 2026-05-15 cs.AI cs.CL 84%

Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models

反长度偏移:动态异常截断用于训练高效的推理模型

Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态异常截断方法,通过在训练时抑制冗余token,提升推理模型的效率与性能,实验显示在AIME-24上推理token使用减少78%且准确率提升。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14175 2026-05-15 cs.AI 83%

Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations

grounded continuation: 一种线性时间的运行时验证器用于大语言模型对话

Qisong He, Yi Dong, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool, UK(利兹大学计算机科学与信息学学院)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出一种线性时间的运行时验证器,用于检测大语言模型对话中基于已废弃前提的延续。通过显式依赖图验证,该方法在LongMemEval-KU和LoCoMo基准上表现出色,准确率显著高于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14163 2026-05-15 cs.AI 83%

Agentic Systems as Boosting Weak Reasoning Models

代理系统作为增强弱推理模型

Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti

机构 * Texas A&M University(德克萨斯A&M大学) MIT(麻省理工学院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 研究通过验证器支持的委员会搜索方法提升弱推理模型性能,证明通过多次采样可增强覆盖度,但需额外局部正确性信号以生成可靠批评者和比较者,实验显示弱模型提案池中存在大量正确补丁,关键挑战在于有效选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02427 2026-05-15 cs.LG 79%

Embedding Perturbation may Better Reflect Intermediate-Step Uncertainty in LLM Reasoning

嵌入扰动可能更好地反映大语言模型推理中的中间步骤不确定性

Qihao Wen, Jiahao Wang, Yang Nan, Pengfei He, Ravi Tandon, Han Xu

机构 * University of Arizona(亚利桑那大学) Michigan State University(密歇根州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究了大语言模型推理中中间步骤不确定性的量化方法,发现基于嵌入扰动的指标在不确定性评估中表现更优,具有更高的效率和简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13907 2026-05-15 stat.ML cs.AI cs.LG 73%

AIS: Adaptive Importance Sampling for Quantized RL

AIS: 量化强化学习中的自适应重要性采样

Jiajun Zhou, Wei Shao, Lingchao Zheng, Yuwei Fan, Ngai Wong

机构 * Huawei(华为) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIS方法,通过动态调整重要性采样强度,解决量化强化学习中 rollout 与训练不匹配导致的策略梯度偏差问题,在保持FP8加速优势的同时,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 62%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14037 2026-05-15 cs.LG cs.CL 62%

Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

自修剪键值注意机制:通过预测未来效用学习何时写作

Gergely Szilvasy, Manuel Faysse, Maria Lomeli, Matthijs Douze, Pierre-Emmanuel Mazaré, Loïc Cabannes, Wen-tau Yih, Hervé Jégou

机构 * Meta FAIR

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 本文提出自修剪键值注意机制,通过预测未来效用减少长序列的KV缓存大小,提升内存使用和解码速度,同时保持验证损失和下游任务性能。

Comments 28 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15051 2026-05-15 cs.LG cs.PF 57%

An Interpretable Latency Model for Speculative Decoding in LLM Serving

为LLM服务中的推测解码开发一个可解释的延迟模型

Linghao Kong, Megan Flynn, Michael Peng, Nir Shavit, Mark Kurtz, Alexandre Marques

机构 * MIT(麻省理工学院) Red Hat AI(红帽人工智能)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出一个可解释的延迟模型,用于LLM服务中的推测解码,通过Little定律推断有效批处理大小,并分解预填充、草稿和验证的请求需求,以解释延迟变化及系统配置影响。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14907 2026-05-15 cs.AI 57%

KGPFN: Unlocking the Potential of Knowledge Graph Foundation Model via In-Context Learning

KGPFN:通过上下文学习解锁知识图谱基础模型的潜力

Yisen Gao, Jiaxin Bai, Haoyu Huang, Zhongwei Xie, Yufei Li, Hong Ting Tsang, Sirui Han, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong, China(香港科技大学计算机科学与工程系) Department of Computer Science and Engineering, HKBU, Hong Kong, China(香港城市大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 KGPFN通过结合先验数据拟合网络与上下文学习,统一了可转移关系规律与推理时的上下文学习,有效提升知识图谱推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏