arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-27 至 2026-07-27 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2607.22385 2026-07-27 cs.AI cs.LG 新提交 81%

Agentic Root Cause Analysis through Evidence-Grounded Reasoning

通过基于证据的推理进行智能根本原因分析

Amaury Wei, Olga Fink

机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22314 2026-07-27 cs.LG 新提交 79%

Evolution-Aware MSA Reasoning for Subsampling via Factor Graphs

基于因子图的进化感知多序列比对抽样推理

Zhangzhi Xiong, Minzhang Li, Haotian Yu, Sixian Shen, Kexin Zhang, Mingrui Li, Jie Zheng, Kewei Tu, Jingyi Yu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 研究针对MSA抽样在有限预算下难以控制进化信号的问题,提出将其作为优化问题,引入基于亲和传播的因子图方法AP-REASONER,通过特定因子和控制旋钮进行推理,实验表明该方法在下游任务中表现优异,能可控恢复蛋白质构象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21793 2026-07-27 cs.AI 新提交 70%

QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization

QLPO:用于长度感知策略优化的象限加权采样

Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(北京大学软硬件协同人工智能系统北京市重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Institute of Computational Social Science, Peking University (Qingdao)(北京大学(青岛)计算社会科学研究院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对大型推理模型长思维链响应致高延迟成本问题,提出QLPO方法,通过先过度生成候选响应,再按特定规则重采样训练组,实现隐式长度控制,在多模型中改善准确率与长度权衡,减少响应长度并保持推理性能。

Comments 18 pages, 7 figures, 6 tables. Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01551 2026-07-27 cs.LG cs.AI cs.CL 版本更新 67%

Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning

基于重新定义的逐步优势的自引导过程奖励优化用于过程强化学习

Wu Fei, Shuxian Liang, Yibo Yang, Yang Lin, Jing Tang, Lei Chen, Xiansheng Hua, Hao Kong

机构 * Terminus Group(Terminus集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对过程强化学习中引入奖励模型计算开销大且缺乏统一优势估计框架的问题,提出SPRO框架,通过从策略模型导出奖励及重新定义优势进行过程感知强化学习,实验显示其训练效率高、准确率提升且无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新 62%

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21453 2026-07-27 cs.LG 版本更新 57%

Test-Time Scaling via Error Localization

通过错误定位进行测试时缩放

Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究针对大型语言模型复杂任务性能提升问题,提出通过错误定位进行测试时缩放(TTEL)算法,利用反馈定位错误步骤,截断轨迹并分支新一代,重用有效前缀,在多个基准测试中优于竞争基线。

Comments 10 pages, 8 figures (With appendix: 27 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏