arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2601.10306 2026-04-21 cs.AI cs.CL 81%

Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning

增强证据的策略优化用于长上下文推理

Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EAPO方法,通过引入组相对证据奖励和适应性奖励-策略共演机制,提升长上下文推理中的证据提取质量,从而增强推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02970 2026-04-21 cs.CL cs.LG 81%

Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning

可靠性感知的自一致性自适应方法用于LLM推理中的高效采样

Junseok Kim, Nakyeong Yang, Kyungmin Min, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReASC,通过将自适应采样从响应计数转向证据充分性,提升推理可靠性。在五个模型和四个数据集上,ReASC在准确率与成本之间取得最佳平衡,显著提升推理效率。

Comments ACL 2026, Code is available at https://github.com/junseokkim00/ReASC

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11140 2026-04-21 cs.CL cs.AI 81%

Follow the Path: Reasoning over Knowledge Graph Paths to Improve Large Language Model Factuality

跟随路径:通过知识图谱路径推理提升大语言模型事实性

Mike Zhang, Johannes Bjerva, Russa Biswas

机构 * University of Copenhagen(哥本哈根大学) Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出fs1方法,通过收集大推理模型的推理轨迹并将其锚定在知识图谱路径上,提升大语言模型的事实性,在六个复杂开放领域问答基准测试中表现优异。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15972 2026-04-20 cs.AI cs.CL cs.MA 81%

Weak-Link Optimization for Multi-Agent Reasoning and Collaboration

多智能体推理与协作中的弱链接优化

Haoyu Bian, Chaoning Zhang, Jiaquan Zhang, Xingyao Li, Yuanfang Guo, Wei Dong, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beihang University(北航) Xi'an University of Architecture and Technology(西安建筑科技大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出WORC框架,通过识别并强化性能瓶颈智能体,提升多智能体系统的稳定性和泛化能力。

Comments 13 pages, 4 figures. Submitted to CAAI Transactions on Intelligence Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14528 2026-04-17 cs.AI cs.CL 81%

Dissecting Failure Dynamics in Large Language Model Reasoning

解析大语言模型推理中的故障动态

Wei Zhu, Jian Zhang, Lixing Yu, Kun Yue, Zhiwen Tang

机构 * School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,昆明,中国) Yunnan Key Laboratory of Intelligent Systems and Computing, Kunming, China(云南省智能系统与计算重点实验室,昆明,中国)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型推理错误多源于早期少量转换点,提出GUARD框架通过不确定性信号引导干预,提升推理可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09665 2026-04-17 cs.LG cs.AI 81%

Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model

深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了对齐对语言模型安全性和通用性的影响,提出BoN采样方法将不安全行为归因于基础模型,减少多个安全基准的攻击成功率,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13398 2026-04-16 cs.CL cs.AI 81%

From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning

从预测到论证:通过强化学习对齐情感推理与人类推理

Shihao Zhang, Ziwei Wang, Jie Zhou, Yulan Wu, Qin Chen, Zhikai Lei, Liyang Yu, Liang Dou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Qiji Zhifeng Co., Ltd.(上海启智丰科技有限公司) Ocean University of China(中国海洋大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ABSA-R1框架,通过强化学习使模型具备生成自然语言论证的能力,提升情感分类和三元组提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11626 2026-04-15 cs.AI cs.LG 81%

RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time

RationalRewards: 基于理性反馈的视觉生成推理奖励

Haozhe Wang, Cong Wei, Weiming Ren, Jiaming Liu, Fangzhen Lin, Wenhu Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Alibaba(阿里巴巴)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RationalRewards通过显式多维反馈提升视觉生成模型,训练时提供可解释奖励,测试时通过生成-反馈-优化循环改进输出,无需参数更新。

Comments Project Page: https://tiger-ai-lab.github.io/RationalRewards/ ; Code, Dataset, Models are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13755 2026-04-14 cs.LG cs.AI 81%

Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration

在RLVR中深度与广度的协同作用:通过自适应探索解锁LLM推理增益

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * Sun Yat-Sen University(中山大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心) University of California, Merced(加州大学默塞德分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARS方法,通过自适应探索提升LLM推理能力,发现扩大批量大小能显著提升Pass@1指标,同时结合DARS-Breadth方法实现深度与广度的协同增益。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07922 2026-04-10 cs.AI cs.CL 81%

SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking

SAT:通过分步自适应思维平衡推理准确性和效率

Weiyang Huang, Xuefeng Bai, Kehai Chen, Xinyang Chen, Yibin Chen, Weili Guan, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Technologies(华为技术有限公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAT框架,通过分步自适应思维在保持核心推理结构的同时实现推理步骤的动态剪枝,从而在减少推理token数量的同时维持或提升准确率。

Comments accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02967 2026-04-06 cs.AI cs.CL 81%

FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models

FoE:错误森林使大推理模型中的首个解成为最佳解

Kehan Jiang, Haonan Dong, Zhaolu Kang, Zhengzhou Zhu, Guojie Song

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文发现大推理模型中首个解往往最优,提出RED框架通过抑制错误增长和修剪后续错误提升性能,实验显示在多个基准上性能提升达19.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02341 2026-04-06 cs.LG cs.AI 81%

LLM Reasoning with Process Rewards for Outcome-Guided Steps

基于过程奖励的大型语言模型推理

Mohammad Rezaei, Jens Lehmann, Sahar Vahdati

机构 * Amazon Science(亚马逊科学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PROGRS框架通过过程奖励相对偏好优化,提升数学推理准确性,减少错误引导,优于仅基于结果的基线方法。

Comments 8 pages, 3 figures, 2 tables, submitted to IJCNN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00018 2026-04-02 cs.CL cs.AI 81%

Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning

再三思考后再写作——一种基于熵的解码策略以增强大语言模型推理

Jiashu He, Meizhu Liu, Olaitan P Olaleye, Amit Agarwal, M. Avendi, Yassi Abbasi, Matthew Rowe, Hitesh Laxmichand Patel, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI Science(甲骨文人工智能科学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于熵的解码策略,通过在生成过程中引入令牌级适应性,提高大语言模型的推理能力,实验表明在GSM8K等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17070 2026-03-19 cs.CL cs.AI 81%

Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts

大推理模型在不同脚本间转移参数知识时面临困难

Lucas Bandarkar, Alan Ansell, Trevor Cohn

机构 * Google Research(谷歌研究) University of California, Los Angeles(加州大学洛杉矶分校) University of Melbourne(墨尔本大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现,大模型在跨语言知识转移中主要受脚本差异影响,通过分析数据和实验表明,提升模型对转写歧义的推理能力可改善跨脚本知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14077 2026-03-19 cs.CL cs.LG 81%

GTS: Inference-Time Scaling of Latent Reasoning with a Learnable Gaussian Thought Sampler

GTS:基于可学习高斯思维采样器的推理时缩放

Minghan Wang, Ye Bai, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

机构 * Department of Data Science & AI, Monash University(墨尔本大学数据科学与人工智能系) Faculty of Medicine Dentistry and Health Sciences, University of Melbourne(墨尔本大学医学牙科与健康科学学院) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出GTS,通过学习条件分布实现更可控的推理时缩放,改进了传统启发式扰动方法,提升了推理质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20197 2026-03-13 cs.LG cs.AI 81%

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

混合策略强化学习可调节探索用于多模态推理

Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han

机构 * Aberystwyth University(阿伯里斯特维斯大学) Institute of Artificial Intelligence (TeleAl)(人工智能研究所) China Telecom(中国电信) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10359 2026-03-12 cs.AI cs.LG 81%

HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation

HEAL: 通过回顾熵辅助学习进行推理蒸馏

Wenjing Zhang, Jiangze Yan, Jieyun Huang, Yi Shen, Shuming Shi, Ping Chen, Ning Wang, Zhaoxiang Liu, Kai Wang, Shiguo Lian

机构 * Data Science & AI Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国unicom数据智能)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 HEAL通过引入熵辅助学习和三阶段蒸馏策略,有效提升推理蒸馏效果,优于传统方法。

Comments 11 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00405 2026-03-03 cs.LG cs.AI 81%

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

UME-R1: 探索基于推理的生成多模态嵌入

Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) WeChat AI, Tencent Inc, China(腾讯公司微信AI部门) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 UME-R1通过生成嵌入和强化学习提升多模态嵌入性能,实现判别与生成嵌入的互补,展现生成嵌入在推理和下游任务中的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08427 2026-03-03 cs.CL cs.LG 81%

Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering

沉默法官:通过潜在几何聚类的自我验证强化学习

Nonghai Zhang, Weitao Ma, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu

机构 * Meituan(美团) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent-GRPO框架,通过潜在空间几何聚类生成内在奖励,提升大语言模型推理性能并加速训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18395 2026-03-02 cs.CL cs.AI 81%

Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning

潜在自一致性用于短答和长答推理中可靠多数集选择

Jungsuk Oh, Jay-Yoon Lee

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LSC通过学习token嵌入选择语义一致的响应,有效提升短答和长答推理中的多数集选择可靠性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19169 2026-02-24 cs.LG cs.AI cs.MS math.PR 81%

Virtual Parameter Sharpening: Dynamic Low-Rank Perturbations for Inference-Time Reasoning Enhancement

虚拟参数锐化:用于推理时间推理增强的动态低秩扰动

Saba Kublashvili

机构 * Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 虚拟参数锐化通过动态低秩扰动提升大语言模型推理能力,实现测试时间适应与高效推理增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11792 2026-02-13 cs.AI cs.CL 81%

Detecting RLVR Training Data via Structural Convergence of Reasoning

通过推理的结构收敛检测RLVR训练数据

Hongbo Zhang, Yue Yang, Jianhao Yan, Guangsheng Bao, Yue Zhang, Yue Zhang

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过推理结构收敛检测RLVR训练数据,提出Min-kNN距离方法有效区分训练数据与未见数据。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08520 2026-02-13 cs.AI cs.LG 81%

Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning

强化推断:利用不确定性进行自我修正的语言模型推理

Xinhai Sun

机构 * Programme of Management Engineering, Politecnico di Milano(米兰理工学院管理工程项目)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出强化推断方法,通过利用模型不确定性进行自我修正推理,提升语言模型在零样本设置下的准确性,同时减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08489 2026-02-10 cs.LG cs.CL 81%

Beyond Correctness: Learning Robust Reasoning via Transfer

超越正确性:通过迁移学习实现鲁棒推理

Hyunseok Lee, Soheil Abbasloo, Jihoon Tack, Jinwoo Shin

机构 * Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过迁移奖励的强化学习方法,提升大语言模型推理的鲁棒性和效率,实现更稳定和可推广的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00075 2026-02-10 cs.LG cs.AI 81%

Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap

大语言模型自我改进训练动态的理论建模:通过求解器-验证器间隙

Yifan Sun, Yushan Liang, Zhen Zhang, Xin Liu, Jiaye Teng

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过求解器-验证器间隙理论,建模大语言模型自我改进的训练动态,并验证了该框架在不同模型和数据集上的有效性,同时探讨了外部数据对动态的影响。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21494 2026-02-04 cs.AI cs.CL 81%

The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus

最小阻力路径:利用前缀一致性引导大语言模型推理轨迹

Ishan Jindal, Sai Prashanth Akuthota, Jayant Taneja, Sachin Dev Sharma

机构 * Fujitsu Research India(富士通印度研究实验室) SRID Samsung R&D Institute India-Delhi(三星印度德里研发研究所)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PoLR通过利用前缀一致性在推理过程中提高计算效率,减少令牌使用和延迟,同时保持自我一致性方法的准确性。

Comments Accepted at ICLR 2026. https://openreview.net/forum?id=hrnSqERgPn

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02863 2026-02-04 cs.AI cs.LG 81%

"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time

我可能没有表达清楚:在推理时间诊断LLM推理中的动态不稳定性

Jinkun Chen, Fengxiang Cheng, Sijia Han, Vlado Keselj

机构 * Dalhousie University(达尔豪斯大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学) Meta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析LLM推理过程中的动态不稳定性,发现早期不稳定性可能预示后续正确答案,而晚期不稳定性更易导致失败,提出基于分布偏移和熵的诊断方法。

Comments 21 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17652 2026-02-02 cs.LG cs.AI 81%

Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective

重新思考强化学习中用于大语言模型推理的采样标准:一种能力-难度对齐视角

Deyang Kong, Qi Guo, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang, Wei Ye

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CDAS方法,通过能力-难度对齐提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17915 2026-01-30 cs.AI cs.LG cs.LO 81%

Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation

局部思考,全球解释:通过局部推理和信念传播的图引导LLM研究

Saurabh Jha, Rohan Arora, Bhavya, Noah Zheutlin, Paulina Toro Isaza, Laura Shwartz, Yu Deng, Daby Sow, Ruchi Mahindru, Ruchir Puri

机构 * IBM Research(IBM研究院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 EoG通过图引导的局部推理和信念传播提升LLM在开放性研究中的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10539 2026-01-28 cs.AI cs.CL 81%

Improving Value-based Process Verifier via Low-Cost Variance Reduction

通过低成本方差减少改进基于价值的过程验证器

Zetian Sun, Dongfang Li, Baotian Hu, Min Zhang

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ComMCS方法,通过低成本方差减少改进基于价值的过程验证器,有效提升数学推理能力。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏