A Mechanistic Interpretation of Arithmetic Reasoning in Language Models using Causal Mediation Analysis
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments EMNLP 2023. 18 pages, 19 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments EMNLP 2023. 18 pages, 19 figures
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments EMNLP 2023 Findings
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2023 Main Conference, Camera Ready
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted for publication at Elsevier's Natural Language Processing Journal
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments ACL 2023. A shorter version of the paper was accepted at the MATH-AI Workshop at NeurIPS 2022. 15 pages, 8 figures
专题命中 数学推理 :planning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to The 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 9 pages, accepted by AAAI 2023
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at ICML 2021 (16 pages)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence
为LLM推理设计的交互学习
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Sun Yat-sen University(中山大学) ; Southern University of Science and Technology(南方科技大学) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出ILR框架,通过动态交互和感知校准提升LLM独立问题解决能力,实验表明其在多个基准测试中优于单agent学习。
Comments The code is available at https://github.com/linhh29/Interactive-Learning-for-LLM-Reasoning
可靠的自改进训练:验证推理过程,而不仅仅是答案
机构 * Anyscale
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对自改进训练中因依赖最终答案正确性导致推理错误累积的问题,提出VSI框架,通过步骤级结构验证(如符号计算检查算术步骤)筛选训练数据,在GSM8K上实现持续准确率提升(80.5%→91.0%)。
Comments Accepted at ICLR 2026 Workshop LLM Reasoning. 10 pages, 3 figures, 5 tables
量化对大推理模型强化学习的影响
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; d-Matrix
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本文研究了量化对大推理模型强化学习的影响,发现量化感知训练对学习过程有负面影响,而PTQ和QLoRA能提升性能。
Comments Accepted to the NeurIPS 2025 Efficient Reasoning Workshop
RLP:将强化学习作为预训练目标
机构 * NVIDIA(英伟达) ; Carnegie Mellon University(卡内基梅隆大学) ; Boston University(波士顿大学) ; Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。
Comments ICLR 2026 camera ready
基于单领域到全领域泛化的强化学习进行思维链压缩
机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; LLM-Core Xiaomi(小米LLM-Core)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于单领域到全领域泛化的强化学习方法,通过样本级软强化学习压缩思维链推理,有效减少响应长度并提升跨领域泛化能力。
SPEC-RL: 通过推测性回放加速在线策略学习
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; LLM Team, Shopee Pte. Ltd.(Shopee公司语言模型团队) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SPEC-RL通过整合推测解码技术,有效减少强化学习回放阶段的计算开销,提升大模型推理能力。
Comments fixed typos
机构 * Anthropic Fellows Program(Anthropic Fellow项目) ; Constellation ; Anthropic
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Version 2: updated related works section on LLM steganography
机构 * Zhejiang University(浙江大学) ; Inclusion AI, Ant Group(蚂蚁集团 inclusion AI)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of California, Irvine School of Information & Computer Science(加州大学尔湾分校信息与计算机科学学院)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 13 pages, 2 figures, 2 tables
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published as a conference paper at COLM 2025
机构 * Hong Kong University of Science and Technology(香港科技大学) ; INFLY Tech(INFLY科技)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2025
机构 * Skywork Open Reasoner 1
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Assistantslab(助手实验室)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 17 pages, 9 figures, 8 tables
专题命中 数学推理 :reasoning(abstract);CoT(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 174 pages, to be submitted to a journal in a shorter version. It includes figures taken from papers by other authors. All the sources have been referenced. arXiv admin note: text overlap with arXiv:2303.18223 by other authors
专题命中 数学推理 :reasoning(abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted for publication in National Science Review. Project page:https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by ECCV 2024, 46 Pages, Benchmark Project Page: https://mathverse-cuhk.github.io
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
询问、条件化或弃权:针对缺失前提推理的强化学习
机构 * Ant International(蚂蚁国际) ; Zhejiang University(浙江大学) ; Dingtalk, Alibaba Group(阿里巴巴集团钉钉) ; Ant Group(蚂蚁集团)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。
测量位置混淆优化下的奖励黑客行为与推理-答案解耦
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。
Comments Accepted at the AI Measurement Science Workshop, COLM 2026