arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2408.15565 2024-08-29 cs.CL 79%

SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models

Dian Yu, Baolin Peng, Ye Tian, Linfeng Song, Haitao Mi, Dong Yu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08210 2024-08-16 cs.LG 79%

Does Reasoning Emerge? Examining the Probabilities of Causation in Large Language Models

Javier González, Aditya V. Nori

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07172 2024-07-23 cs.CL cs.PL 79%

VerityMath: Advancing Mathematical Reasoning by Self-Verification Through Unit Consistency

Vernon Toh Yan Han, Ratish Puduppully, Nancy F. Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments AI4MATH Workshop @ ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19444 2024-05-31 cs.AI 79%

MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions

Zhenwen Liang, Dian Yu, Wenhao Yu, Wenlin Yao, Zhihan Zhang, Xiangliang Zhang, Dong Yu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14604 2024-04-29 cs.CL 79%

Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training

Mengzhao Jia, Zhihan Zhang, Wenhao Yu, Fangkai Jiao, Meng Jiang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03864 2024-03-14 cs.CV cs.AI 79%

Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning

Deepanway Ghosal, Vernon Toh Yan Han, Chia Yew Ken, Soujanya Poria

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04892 2024-01-30 cs.CL 79%

Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs

Shashank Gupta, Vaishnavi Shrivastava, Ameet Deshpande, Ashwin Kalyan, Peter Clark, Ashish Sabharwal, Tushar Khot

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Project page: https://allenai.github.io/persona-bias. Paper to appear at ICLR 2024. Added results for other LLMs in v2 (similar findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05113 2023-11-10 cs.CL 79%

Conic10K: A Challenging Math Problem Understanding and Reasoning Dataset

Haoyi Wu, Wenyang Hui, Yezeng Chen, Weiqi Wu, Kewei Tu, Yi Zhou

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13160 2023-10-11 cs.CL 79%

Can ChatGPT Defend its Belief in Truth? Evaluating LLM Reasoning via Debate

Boshi Wang, Xiang Yue, Huan Sun

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP-23 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04039 2023-10-09 cs.CL 79%

Analysis of the Reasoning with Redundant Information Provided Ability of Large Language Models

Wenbei Xie

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02896 2023-10-05 math.HO cs.AI 79%

Notes on a Path to AI Assistance in Mathematical Reasoning

Alex Kontorovich

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01825 2023-09-14 cs.CL 79%

Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Zheng Yuan, Hongyi Yuan, Chengpeng Li, Guanting Dong, Keming Lu, Chuanqi Tan, Chang Zhou, Jingren Zhou

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15864 2023-06-21 cs.AI 79%

Peano: Learning Formal Mathematical Reasoning

Gabriel Poesia, Noah D. Goodman

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08671 2022-11-17 cs.AI 79%

LEMMA: Bootstrapping High-Level Mathematical Reasoning with Learned Symbolic Abstractions

Zhening Li, Gabriel Poesia, Omar Costilla-Reyes, Noah Goodman, Armando Solar-Lezama

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 10 pages, 2 figures; to appear in 2nd MATH-AI Workshop at NeurIPS'22

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.12755 2022-03-22 cs.AI 79%

Abstraction, Reasoning and Deep Learning: A Study of the "Look and Say" Sequence

Wlodek W. Zadrozny

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 12 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.14474 2021-01-15 cs.AI 79%

Paraconsistent Foundations for Probabilistic Reasoning, Programming and Concept Formation

Ben Goertzel

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.04487 2020-04-10 cs.CL 79%

Injecting Numerical Reasoning Skills into Language Models

Mor Geva, Ankit Gupta, Jonathan Berant

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04760 2018-11-13 cs.AI quant-ph 79%

Quantum Reasoning using Lie Algebra for Everyday Life (and AI perhaps...)

Steven Gratton

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.05838 2015-02-23 cs.AI cs.LO 79%

Automated Reasoning for Robot Ethics

Ulrich Furbach, Claudia Schon, Frieder Stolzenburg

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:1411.4823

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10474 2026-07-14 cs.LG cs.AI cs.CE 新提交 79%

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

具有可验证物理的强化学习:具有连续奖励的训练后语言模型

Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05106 2026-06-04 cs.CL cs.AI cs.CY 79%

Arithmetic Pedagogy for Language Models

语言模型的算术教学法

Andhika Bernard Lumbantobing, Hokky Situngkir

机构 * Bandung Fe Institute & Adjunct Science Fellow in InaAI(巴旦格Fe研究所及InaAI兼职科学研究员) AI Research Center IT Del & Bandung Fe Institute(IT Del人工智能研究中心及巴旦格Fe研究所)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 借鉴人类数学教学法,通过将GASING方法操作化为链式思维监督训练小规模GPT-2模型,使其在算术推理上达到高准确率并展现出联想式心算能力。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04465 2026-06-04 cs.CL cs.AI 79%

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

SePO: 用于系统提示优化的自我进化提示智能体

Wangcheng Tao, Han Wu, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SePO方法,通过自我指涉设计让提示智能体同时优化任务智能体和自身的系统提示,采用两阶段进化训练,在多个基准上平均准确率提升4.49%。

Comments 26 pages. Code: https://github.com/taowangcheng/SePO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00915 2026-05-25 cs.LG cs.AI 79%

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

在不完美验证器下基于可验证但含噪声奖励的强化学习

Xin-Qiang Cai, Wei Wang, Feng Liu, Tongliang Liu, Gang Niu, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所AIP) The University of Tokyo(东京大学) The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对不完美验证器引入的假阴性和假阳性噪声,提出后向校正(无偏奖励)和前向校正(梯度方向对齐)两种轻量级方法,在分组相对策略优化中提升数学推理性能,并设计上诉机制在线估计假阴性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14862 2026-04-29 cs.CL cs.AI 79%

Schema Key Wording as an Instruction Channel in Structured Generation under Constrained Decoding

模式键作为在受限解码下的指令通道在结构生成中的应用

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在受限解码中模式键作为隐式指令通道的作用,提出结构生成是多通道指令问题,并通过实验展示模式键词汇对准确性的影响,揭示了不同模型对不同通道的依赖性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08483 2026-04-17 cs.CL cs.AI 79%

DeepPrune: Parallel Scaling without Inter-trace Redundancy

DeepPrune: 无需跨轨迹冗余的并行扩展

Shangqing Tu, Yaxuan Li, Yushi Bai, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepPrune框架,通过动态剪枝解决并行推理中的冗余问题,实现65.73%-88.50%的token减少,保持高精度。

Comments Accepted by ACL 2026 Findings, please check out the project page: https://deepprune.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15402 2026-03-17 cs.CL cs.AI 79%

A Closer Look into LLMs for Table Understanding

深入探究用于表格理解的大型语言模型

Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过研究16种LLM,探讨其理解表格数据和执行下游任务的机制,发现注意力动态、有效层数、专家激活及输入设计影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06619 2026-03-10 cs.LG cs.AI 79%

Not all tokens are needed(NAT): token efficient reinforcement learning

并非所有标记都必要(NAT):标记效率强化学习

Hejian Sang, Yuanda Xu, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 NAT通过局部标记采样提升RL效率,使用50%标记实现与完整标记相同性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14280 2026-01-22 cs.CL cs.AI 79%

Hallucination-Free Automatic Question & Answer Generation for Intuitive Learning

无幻觉的自动问答生成用于直观学习

Nicholas X. Wang, Aggelos K. Katsaggelos

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无幻觉的多代理生成框架,通过结构化协作减少教育内容中的幻觉,提升问答生成的准确性与教育价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23367 2026-01-09 cs.LG cs.AI 79%

Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2

在Atlas A2上对OpenPangu模型进行训练后量化以实现高效部署

Yilun Luo, Huaqing Zheng, Haoqian Meng, Wenyuan Liu, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在Atlas A2上通过低比特量化提升OpenPangu模型的推理效率,实现高效CoT推理并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14237 2025-12-17 cs.CL cs.LG 79%

Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets

向上爬,记忆下降:低成本微调与侧边网络

Estelle Zheng, Nathan Cerisara, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 LST通过轻量级侧边网络实现高效微调,比QLoRA更节省内存,同时在多个任务中保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏