arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2604.03664 2026-04-07 cs.CL 79%

Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports

跨单表和多表的财务报告中数字推理

Yi-Cheng Wang, Wei-An Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学资讯工程学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出FinLongDocQA数据集,解决长文档中跨表数字推理问题,发现LLM在长文本中定位和多步计算时存在瓶颈,提出FinLongDocAgent多智能体方法提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03506 2026-04-07 cs.AI 79%

BioAlchemy: Distilling Biological Literature into Reasoning-Ready Reinforcement Learning Training Data

生物炼金术:将生物文献提炼为可用于强化学习训练的数据

Brian Hsu, Ozan Gökdemir, Carlo Siebenschuh, Bruce Parrello, Neil Getty, Thomas S. Brettin, Rick L. Stevens, Ian T. Foster, Nicholas Chia, Arvind Ramanathan

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BioAlchemy方法,通过提炼生物文献生成高质量训练数据,提升生物领域推理性能,最终在生物基准测试中实现9.12%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00824 2026-04-07 cs.SE 78%

Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs

即使更少也是更好:用于代理、推理和编码LLM的更优方案

CodeArts Model Team, Yang Ye, Jingyuan Tan, Tianyue Jiang, Ruizhe Ye, Qiankun He, Jiarui Yang, Jian Dong, Sicong Liang, Chongjian Yue, Peibai Xu, Lufan Lu, Shiguan Pang, Taotao Qian, Junbao Hu, Yuechan Hao, Ensheng Shi, Qi Zhang, Yi Hao, Na Fan, Xin Tan, Shuai Yao, Zhiwei Shen, Zongchen Li, Yanlin Wang, Chong Chen, Yuchi Ma

专题命中 数学推理 :reasoning(title,abstract)

AI总结 本文提出STITCH框架,通过过滤低价值噪声和保留决策关键标记,以更少但高质量的训练轨迹提升代理能力,在多个框架和语言中实现显著提升。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03993 2026-04-07 cs.LG cs.AI 73%

Can LLMs Learn to Reason Robustly under Noisy Supervision?

大语言模型能否在噪声监督下实现稳健推理?

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了强化学习中可验证奖励在噪声标签下的鲁棒性问题,提出在线标签细化方法,通过动态修正潜在噪声标签提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04131 2026-04-07 cs.AI 70%

Profile-Then-Reason: Bounded Semantic Complexity for Tool-Augmented Language Agents

Profile-Then-Reason: 用于工具增强语言代理的有界语义复杂度

Paulo Akira F. Enabe

机构 * Escola Politénica University of São Paulo(圣保罗大学理工学院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出Profile-Then-Reason框架,通过预设工作流和验证机制减少语言模型调用次数,提升工具增强推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04898 2026-04-07 cs.AI cs.CL cs.LG 67%

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

QED-Nano:用小型模型证明难题定理

LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

机构 * CMU(卡内基梅隆大学) Hugging Face ETH Zurich(苏黎世联邦理工学院) Project Numina

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09749 2026-04-07 cs.CE cs.AI 57%

Large Language Models for Combinatorial Optimization of Design Structure Matrix

大型语言模型用于设计结构矩阵的组合优化

Shuo Jiang, Min Xie, Jianxi Luo

机构 * City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的框架,用于优化设计结构矩阵的序列,通过结合网络拓扑和领域知识提升收敛速度和解的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏