arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-24 至 2026-03-24 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 13 篇

2603.17775 2026-03-24 cs.CL cs.AI cs.LG 89%

CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution

CoVerRL: 通过生成器-验证器共进化打破无标签推理中的共识陷阱

Teng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Guiyang Hou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoVerRL通过生成器-验证器共进化机制,解决无标签强化学习中因自洽性最大化导致输出多样性下降的问题,提升数学推理能力。

Comments Project Page: https://zju-real.github.io/CoVerRL Code: https://github.com/ZJU-REAL/CoVerRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20224 2026-03-24 cs.CL 87%

Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference

超越测试时计算策略:倡导语言模型推理中的能耗-token指标

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao

机构 * Technische Universität Berlin(柏林技术大学)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文探讨了在小模型中测试时计算策略的能耗-准确率权衡,提出能耗-token指标和受控推理策略,以实现可持续的AI部署。

Journal ref EuroMLSys2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21301 2026-03-24 cs.CL cs.AI 86%

Enhancing reasoning accuracy in large language models during inference time

在推理过程中增强大语言模型的推理准确性

Vinay Sharma, Manish Jain

机构 * Firstsource

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了提升大语言模型推理准确性的推理时技术,通过自一致性、双模型推理一致性和自反思三种策略,发现自一致性在核采样和受控温度下能显著提高准确性,适用于低风险领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11549 2026-03-24 cs.LG cs.AI 84%

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

原生推理模型:训练语言模型在不可验证数据上进行推理

Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。

Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10273 2026-03-24 stat.ML cs.LG 79%

Power-SMC: Low-Latency Sequence-Level Power Sampling for Training-Free LLM Reasoning

Power-SMC:低延迟序列级功率采样用于训练自由LLM推理

Seyedarmin Azizi, Erfan Baghaei Potraghloo, Minoo Ahmadi, Souvik Kundu, Massoud Pedram

机构 * University of Southern California(南加州大学) Intel Labs(英特尔实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Power-SMC,一种低延迟的序列级功率采样方法,用于训练自由的大语言模型推理,通过并行粒子集和重要权重修正提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14635 2026-03-24 cs.IR cs.AI 79%

Compute Allocation for Reasoning-Intensive Retrieval Agents

为推理密集型检索代理进行计算分配

Sreeja Apparaju, Nilesh Gupta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过BRIGHT基准和Gemini 2.5模型家族,探讨推理密集型检索管道中的计算分配,发现重排阶段受益于更强模型和更深候选池,而查询扩展在轻量模型后效果递减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03773 2026-03-24 cs.LG 79%

Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL

推理缓存:通过短期限强化学习实现长周期的持续改进

Ian Wu, Yuxiao Qu, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出RC算法,通过利用LLM的响应生成与总结能力差异,实现长周期的持续改进,实验显示其在HMMT 2025任务中性能显著提升。

Comments preprint v2; revised 2026-03-22 (updated IMO-AnswerBench results)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04559 2026-03-24 cs.CV 78%

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI 73%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20215 2026-03-24 cs.CL cs.LG 73%

Multi-Agent Debate with Memory Masking

具有记忆掩码的多智能体辩论

Hongduan Tian, Xiao Feng, Ziyuan Zhao, Xiangyu Zhu, Rolan Yan, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团队) Search Algorithm Group, WeChat, Tencent(微信搜索算法团队,腾讯)

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MAD-M$^2$框架,通过在每轮辩论前屏蔽错误记忆以提升多智能体辩论的鲁棒性,实验证明其在数学和逻辑推理任务中表现更优。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02375 2026-03-24 cs.CL cs.AI cs.LG 67%

Pretraining with hierarchical memories: separating long-tail and common knowledge

预训练与层次记忆:区分长尾知识与常识

Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof, Oncel Tuzel

机构 * Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于层次记忆的预训练方法,通过分离长尾知识与常识,提升模型性能。实验显示,使用内存银行可使小模型性能媲美大模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-03-24 cs.LG cs.PL 57%

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 50%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏