arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-05 至 2026-03-05 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 10 篇

2603.03475 2026-03-05 cs.LG cs.AI cs.CL 86%

When Shallow Wins: Silent Failures and the Depth-Accuracy Paradox in Latent Reasoning

浅层胜出:潜在推理中的沉默失败与深度-准确性悖论

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Independent(独立研究者) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊生成AI创新中心,亚马逊网络服务) Meta AI Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北ern大学,西雅图,华盛顿州,美国)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示数学推理模型在深度增加时准确率无提升,且存在大量不可靠推理路径,需改革评估方法以衡量稳定性。

Comments Accepted at ICLR 2026 Workshop on Latent & Implicit Thinking - Going Beyond CoT Reasoning. 19 Pages and 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03975 2026-03-05 cs.AI cs.CV 83%

Phi-4-reasoning-vision-15B Technical Report

Phi-4-reasoning-vision-15B 技术报告

Jyoti Aneja, Michael Harrison, Neel Joshi, Tyler LaBonte, John Langford, Eduardo Salinas

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Phi-4-reasoning-vision-15B 是一个紧凑型开放式权重多模态推理模型,通过系统数据处理和架构优化,在减少计算资源的同时实现高效推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03752 2026-03-05 cs.CL cs.AI 81%

Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning

置信度校准的小-大语言模型协作用于成本有效的推理

Chuang Zhang, Zizhen Zhu, Yihao Wei, Bing Tian, Junyi Liu, Henan Wang, Xavier Wang, Yaxiao Liu

机构 * Amazon Web Services(亚马逊网络服务) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 COREA通过结合小型和大型语言模型,利用置信度校准提升推理效率,降低21.5%-16.8%成本,同时保持高准确率。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10625 2026-03-05 cs.AI cs.CL 81%

To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks

思考还是不思考,这是大型推理模型在心智理论任务中的问题

Nanxu Gong, Haotian Li, Sixun Dong, Jianxun Lian, Yanjie Fu, Xing Xie

机构 * Arizona State University, Tempe, Arizona, United States(亚利桑那州立大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型推理模型在心智理论任务中的表现,发现其并不总优于非推理模型,且依赖选项匹配而非真实推理,提出干预方法以缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02504 2026-03-05 cs.AI 79%

NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect

NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调

Pratibha Zunjare, Michael Hsiao

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21668 2026-03-05 cs.AI cs.CL cs.SC 73%

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理

Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan

机构 * MIT / Harvard(麻省理工学院/哈佛大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) MIT(麻省理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Harvard(哈佛大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 R1-Code-Interpreter通过监督学习和多阶段强化学习提升LLM的代码推理能力,实现对多样化任务的高效处理,显著提升模型性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04135 2026-03-05 cs.LG cs.AI 62%

Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization

无偏动态剪枝用于高效基于群体的策略优化

Haodong Zhu, Yangyang Ren, Yanjing Li, Mingbao Lin, Linlin Yang, Xuhui Liu, Xiantong Zhen, Haiguang Liu, Baochang Zhang

机构 * Beihang University(北航大学) Zhongguancun Academy(中关村学院) Communication University of China(中国通信大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DPPO通过动态剪枝和重要性采样修正,实现高效基于群体的策略优化,提升训练速度并提高准确率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03112 2026-03-05 cs.CL cs.AI cs.CY 62%

RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents

RLVER: 通过可验证情绪奖励的强化学习实现共情代理

Peisong Wang, Ruotian Ma, Bang Zhang, Xingyu Chen, Zhiwei He, Kang Luo, Qingsong Lv, Qingxuan Jiang, Zheng Xie, Shanyi Wang, Yuan Li, Fanghua Ye, Jian Li, Yifan Yang, Zhaopeng Tu, Xiaolong Li

机构 * Tencent(腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RLVER通过可验证情绪奖励提升LLM的共情能力,实验显示其在对话任务中显著提升表现,尤其在情感理解和洞察力方面成效显著。

Comments Code: https://github.com/Tencent/DigitalHuman/tree/main/RLVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09669 2026-03-05 cs.CL 57%

Query-Level Uncertainty in Large Language Models

查询级不确定性在大语言模型中

Lihu Chen, Gerard de Melo, Fabian M. Suchanek, Gaël Varoquaux

机构 * Imperial College London(伦敦帝国学院) Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所/波茨坦大学) Telecom Paris, Institut Polytechnique de Paris(电信巴黎学院,巴黎理工学院) Soda, Inria Saclay(Soda,法国国家信息与自动化技术研究院萨克利实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出了一种无需训练的内部置信度方法,用于检测大语言模型的知识边界,通过查询级不确定性提高回答质量并降低计算成本。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04975 2026-03-05 cs.CE 50%

Sentiment-Aware Stock Price Prediction with Transformer and LLM-Generated Formulaic Alpha

具有Transformer和LLM生成公式性阿尔法的情感感知股价预测

Qizhao Chen, Hiroaki Kawashima

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出一种结合Transformer和LLM的股价预测框架,利用LLM生成情感感知的公式性阿尔法以提升预测准确性并增强可解释性。

Comments This paper has been accepted by the journal Digital Finance

详情

展开后加载摘要…

URL PDF HTML 收藏