arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-24 至 2026-04-24 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2506.12721 2026-04-24 cs.AI cs.CL cs.LG stat.ML 82%

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

测试时计算的战略扩展:一种多臂学习方法

Bowen Zuo, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多臂学习方法,通过动态分配计算资源提升大语言模型性能,针对不同查询难度优化计算分配,实验表明在多个基准数据集上显著提升性能。

Comments To appear at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21611 2026-04-24 cs.CL cs.AI 81%

Process Supervision via Verbal Critique Improves Reasoning in Large Language Models

通过口头批评过程监督提高大语言模型的推理能力

Hao-Yuan Chen

机构 * Mindify AI Research(Mindify AI研究院) University of London(伦敦大学) Senate House, Malet Street, London WC1E 7HU, United Kingdom(伦敦大学 Senate House, 马莱特街, 伦敦 WC1E 7HU, 英国)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过外部口头监督提升大语言模型推理能力的方法,通过结构化自然语言批评指导生成-批评-完善循环,提升推理性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20860 2026-04-24 cs.IR cs.AI 70%

RealRoute: Dynamic Query Routing System via Retrieve-then-Verify Paradigm

RealRoute:通过检索-验证范式实现动态查询路由系统

Jiahe Liu, Qinkai Yu, Jingcheng Niu, Xi Zhu, Zirui He, Zhen Xiang, Fan Yang, Jinman Zhao

机构 * Technical University of Denmark(技术大学) University of Exeter(埃克塞特大学) University of Toronto(多伦多大学) Rutgers University(罗格斯大学) NJIT(新 jersey 工业技术学院) University of Georgia(佐治亚大学) Wake Forest University(威克森林大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 RealRoute引入一种鲁棒的检索-验证机制,通过并行源无关检索和动态验证器确保证据完整性,优于预测基线,在多跳RAG推理任务中表现更佳。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21525 2026-04-24 cs.CL 57%

Job Skill Extraction via LLM-Centric Multi-Module Framework

通过以LLM为中心的多模块框架进行工作技能提取

Guojing Li, Zichuan Fu, Junyi Li, Faxue Liu, Wenxia Zhou, Yejing Wang, Jingtong Gao, Maolin Wang, Rungen Liu, Wenlin Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出SRICL框架,结合语义检索、上下文学习和监督微调,解决长尾术语和跨域迁移下的工作广告技能提取问题,提升F1指标并减少无效标签。

Comments 5 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏