arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2606.11537 2026-06-19 cs.AI cs.CE 新提交 83%

MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning

MoCA-Agent: 一种用于金融和数值推理的声明市场代码智能体

Abdelrahman Abdallah, AbdelRahim A. Elmadany, Sameh Al Natour, Hasan Cavusoglu, Adam Jatowt, Muhammad Abdul-Mageed

机构 * University of Innsbruck(因斯布鲁克大学) University of British Columbia(不列颠哥伦比亚大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出MoCA-Agent,通过声明级验证和代码生成解决金融表格问答中的数值推理错误,在十个基准上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04678 2026-06-16 cs.LG 版本更新 83%

Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

基于深度条件循环Transformer的ASR测试时计算缩放

Yacouba Kaloga, Shashi Kumar, Shakeel A. Sheikh, Driss Khalil, Petr Motlicek, Ina Kodrasi

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(瑞士联邦理工学院) BUT(布拉格技术大学) Novartis Institute of Biomedical Research(诺华生物医学研究 institute)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 提出LARM模型,通过深度条件循环Transformer将循环编码器深度变为可控的测试时计算轴,结合稀疏CTC检查点、监督时钟嵌入、FiLM深度条件和延迟软后验反馈,在LibriSpeech上随推理循环次数增加提升WER,实现测试时计算缩放从自回归语言模型推理扩展到连续非自回归语音识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06245 2026-06-05 cs.RO cs.AI 83%

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作

Boyang Zhang, Lianlei Shan

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Computer Science, Tsinghua University(清华大学计算机系)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。

Comments 14 pages, 5 figures, submitted to CoRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04402 2026-06-04 cs.AI 83%

Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation

并非所有错误都同等重要:后果感知的推理计算分配

Jingbo Wen, Liang He, Ziqi He

机构 * The University of Sydney(悉尼大学) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 提出后果感知的测试时计算分配方法,通过轻量级预测器估计任务错误成本,在相同预算下将高后果任务路由到更多计算资源,在SWE-bench上降低22%-33%的成本加权损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03782 2026-06-03 cs.CL 83%

Reasoning over Grammar: Can Synthetic Linguistic Reasoning Traces Enhance Low-Resource Machine Translation?

基于语法的推理:合成语言推理轨迹能否增强低资源机器翻译?

Renhao Pei, Yihong Liu, Sampo Pyysalo, Hinrich Schütze, Shaoxiong Ji

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出自动生成语言推理轨迹的方法,通过上下文学习、监督微调和强化微调评估其对低资源机器翻译的影响,发现推理轨迹在推理时指导效果显著,但作为训练数据收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02835 2026-06-03 cs.AI 83%

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

超越答案的思考:评估大型推理模型中的有害过度思考

Simone Caldarella, Davide Talon, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) Toyota Motor Europe(丰田欧洲公司) Fondazione Bruno Kessler(布鲁诺·凯塞林基金会)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出前缀级轨迹评估协议,通过定义推理充分性来区分冗余但无害的冗长过度思考和导致正确轨迹偏离的有害过度思考,发现当前模型不仅受限于推理能力,还受限于无法在适当时机停止。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12176 2026-06-03 cs.AI 83%

Evaluating Relational Reasoning in LLMs with REL

使用REL评估大语言模型中的关系推理能力

Lukas Fesser, Yasha Ektefaie, Ada Fang, Sham M. Kakade, Marinka Zitnik

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文通过关系复杂度(RC)定义推理难度,构建涵盖代数、化学和生物学的生成式基准REL,发现前沿大语言模型在RC增加时性能持续下降,表明模型在高元关系绑定上存在固有局限。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13602 2026-06-02 cs.CV cs.LG 83%

Towards Sparse Video Understanding and Reasoning

迈向稀疏视频理解与推理

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Dolby Laboratories(杜比实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。

Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30757 2026-06-01 cs.LG 83%

Chain-of-Thought and Compressed Looped Transformers: A Memory-Budget Separation

思维链与压缩循环Transformer:记忆预算分离

Haozhou Zhang

机构 * Department of Mathematics and Statistics(数学与统计学系)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文通过比较三种记忆机制(压缩潜在循环、全序列状态循环和思维链暂存区),证明压缩循环Transformer的记忆预算限制其推理能力,而思维链通过扩展上下文实现更强的问题求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30713 2026-06-01 cs.LG cs.CV cs.MM 83%

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

多样性至关重要:重新审视视觉-语言模型中的测试时计算

Yijie Tong, Yifan Hou, Shaobo Cui, Antoine Bosselut, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 针对视觉-语言模型(VLM)中测试时计算(TTC)策略应用不足的问题,提出基于预测熵的ETTC方法,通过利用模型间的置信度差异提升集成性能,理论证明并实验验证其优于多数投票和最佳单模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30451 2026-06-01 cs.LG 83%

VeriGate: Verifier-Gated Step-Level Supervision for GRPO

VeriGate: 验证器门控的步骤级监督用于GRPO

Aakriti Agrawal, Minghui Liu, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 提出VeriGate方法,通过验证器门控的步骤级监督扩展GRPO,解决稀疏奖励和信用分配问题,在多个推理基准上显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10344 2026-05-20 cs.AI 83%

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

TMAS: 通过多智能体协同实现测试时间计算的扩展

George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

机构 * IQuest Research(IQuest研究) Beihang University(北航)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出TMAS框架,通过多智能体协同实现测试时间计算的扩展,利用层次化记忆和混合奖励强化学习提升推理能力和探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18851 2026-05-20 cs.LG 83%

STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

STRIDE: 用于LLM推理的可学习分步语言反馈

Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University, Singapore(生成式人工智能实验室,计算与数据科学学院,南洋理工大学,新加坡) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出STRIDE框架,通过可学习的分步语言反馈提升LLM推理能力,解决了传统方法在标注成本高、信息瓶颈等问题,实验显示其在多种推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15203 2026-05-18 cs.IR cs.AI cs.MA 83%

Agent4POI: Agentic Context-Conditioned Affordance Reasoning for Multimodal Point-of-Interest Recommendation

Agent4POI: 基于代理的上下文条件化 affordance 推理用于多模态兴趣点推荐

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Yongchao Liu, Xingjun Ma, Zhu Sun

机构 * Tongji University(同济大学) Swinburne University of Technology(斯威本理工大学) Southeast University(东南大学) Chengdu University of Information Technology(成都信息工程大学) Fudan University(复旦大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Agent4POI 提出一种新的兴趣点推荐框架,通过在推荐时生成上下文条件化的多模态表示,而非依赖静态兴趣点嵌入。该方法通过代理生成动态 affordance 查询并执行跨模态推理,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14175 2026-05-15 cs.AI 83%

Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations

grounded continuation: 一种线性时间的运行时验证器用于大语言模型对话

Qisong He, Yi Dong, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool, UK(利兹大学计算机科学与信息学学院)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出一种线性时间的运行时验证器,用于检测大语言模型对话中基于已废弃前提的延续。通过显式依赖图验证,该方法在LongMemEval-KU和LoCoMo基准上表现出色,准确率显著高于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14163 2026-05-15 cs.AI 83%

Agentic Systems as Boosting Weak Reasoning Models

代理系统作为增强弱推理模型

Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti

机构 * Texas A&M University(德克萨斯A&M大学) MIT(麻省理工学院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 研究通过验证器支持的委员会搜索方法提升弱推理模型性能,证明通过多次采样可增强覆盖度,但需额外局部正确性信号以生成可靠批评者和比较者,实验显示弱模型提案池中存在大量正确补丁,关键挑战在于有效选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10366 2026-05-12 cs.AI 83%

EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents

EGL-SCA:图推理代理中协同指令与工具的结构信用分配

Zike Yuan, Yukun Cao, Han Zhang, Jianzhi Yan, Le Liu, Cai ke, Yue Yu, Hui Wang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出EGL-SCA框架,通过结构信用分配机制协同优化指令与工具,提升图推理代理的结构正确性与执行效率,实验显示其在四个基准测试中达到92.0%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07461 2026-05-11 cs.CL 83%

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

基于评分标准的思考:从外部评估者到内部推理指导

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07153 2026-05-11 cs.CL 83%

Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs

超越推理:强化学习解锁大语言模型中的参数知识

Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang, Xueqi Cheng, Fei Sun

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究强化学习在零样本、单跳、封闭书 QA 任务中提升参数知识直接回忆的能力,发现其平均相对提升达27%,揭示 RL 通过重新分配概率质量解锁潜在知识而非获取新事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05561 2026-05-08 cs.AI 83%

BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models

BitCal-TTS:用于量化推理模型的位校准测试时间缩放

Sai Babu Patarlapalli, Surya Teja Avvaru

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出BitCal-TTS,一种轻量级运行时控制器,通过在线代理、位条件置信度重缩放和位感知后标记确认范围,提升量化推理模型的准确率和稳定性。

Comments 17 pages, 5 figures, 4 tables. Code and reproducibility materials at https://github.com/Saibabu7770/bitcal-tts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19295 2026-04-22 cs.LG 83%

TEMPO: Scaling Test-time Training for Large Reasoning Models

TEMPO:用于大规模推理模型的测试时训练扩展

Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

机构 * Tianjin University(天津大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 TEMPO通过交替策略优化和周期性批评者重校准提升测试时训练效果,显著提升模型在AIME 2024任务中的表现并保持高多样性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17654 2026-04-21 cs.AI 83%

Poly-EPO: Training Exploratory Reasoning Models

Poly-EPO:训练探索性推理模型

Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam, Shirley Wu, Hengyuan Hu, Noah Goodman, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16890 2026-04-21 cs.AI 83%

Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning

Step-GRPO:内化动态早期退出以实现高效推理

Benteng Chen, Weida Wang, Shufei Zhang, Mingbao Lin, Min Zhang

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Rakuten Singapore(乐天新加坡)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Step-GRPO通过内化动态早期退出机制,优化推理过程,提升效率与准确性,在不同模型规模上实现更优的准确率与效率平衡。

Comments This paper has been accepted for publication at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10739 2026-04-14 cs.AI 83%

When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling

更多思考反而有害:在LLM测试时间计算扩展中的过度思考

Shu Zhou, Rui Ling, Junan Chen, Xin Wang, Tao Fan, Hao Wang

机构 * Nanjing University(南京大学) Baidu(百度) Nanjing University of Finance & Economics(南京财经大学)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究探讨了在LLM测试时间计算扩展中,增加推理token的边际效用随计算预算增加而下降的现象,发现模型存在过度思考问题,且最优思考长度因问题难度而异。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02007 2026-04-07 cs.LG 83%

Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning

阿普里尔-1.5-开放式推理机:基于强化学习的后训练通用高效推理

Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin

机构 * ServiceNow

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出Apriel-1.5-OpenReasoner,通过可复现的多领域强化学习后训练方法,在Apriel-Base上实现跨五个领域的通用高效推理,提升推理效率并优化不同难度问题的推理长度。

Comments 20 pages, 4 tables, 6 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01430 2026-04-03 cs.LG 83%

Improving Latent Generalization Using Test-time Compute

通过测试时间计算提升潜在泛化能力

Arslan Chaudhry, Sridhar Thiagarajan, Andrew Lampinen

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文研究如何通过测试时间计算('思考')提升语言模型的潜在泛化能力,利用强化学习训练模型生成长链思考以改进泛化,实验显示该方法在分布内知识和分布外知识上均有效,但对纯反转任务仍逊于上下文学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07159 2026-03-10 cs.AI 83%

Improving reasoning at inference time via uncertainty minimisation

通过不确定性最小化提升推理时间的推理能力

Nicolas Legrand, Kenneth Enevoldsen, Márton Kardos, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 通过在单个思想层面最大化自我确定性,提升推理能力并实现高效推理时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22165 2026-03-04 cs.LG 83%

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

思想图景:可视化大语言模型的推理过程

Zhanke Zhou, Zhaocheng Zhu, Xuan Li, Mikhail Galkin, Xiao Feng, Sanmi Koyejo, Jian Tang, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) Stanford University(斯坦福大学) Mila - Québec AI Institute(魁北克 AI 院) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔 HEC 学院) Intel AI Lab(英特尔 AI 实验室)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 提出思想图景(LoT)可视化工具,用于分析大语言模型的推理轨迹,揭示推理模式并提升推理准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23681 2026-03-02 cs.AI 83%

ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference

ODAR:通过主动推断实现LLM推理的原理性自适应路由

Siyuan Ma, Bo Gao, Xiaojun Jia, Simeng Qin, Tianlin Li, Ke Ma, Xiaoshuang Jia, Wenqi Ren, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Northeast University (Qinhuangdao Campus)(东北大学(秦皇岛校区)) Beihang University(北航) University of the Chinese Academy of Sciences(中国科学院大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 ODAR通过主动推断实现LLM推理的原理性自适应路由,优化精度-效率权衡,提升计算匹配下的准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22751 2026-02-27 cs.AI 83%

Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning

知晓所知:用于可验证强化学习推理的元认知熵校准

Qiannian Zhao, Chen Yang, Jinhao Jing, Yunke Zhang, Xuhui Ren, Lu Yu, Shijie Zhang, Hongzhi Yin

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 EGPO通过整合内在不确定性提升强化学习推理性能,实现稳定且不确定性的策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏