arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3218 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2509.25414 2026-04-28 cs.LG cs.AI cs.CL 75%

Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs

重新思考多LoRAs的参数共享用于LLM微调

Hao Ban, Kaiyi Ji

机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ALoRA和Fed-ALoRA,通过异构矩阵分解策略,在多任务和联邦微调中实现更平衡的性能,优于现有多LoRA方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18567 2026-04-21 cs.LG cs.AI cs.CL 75%

Latent Phase-Shift Rollback: Inference-Time Error Correction via Residual Stream Monitoring and KV-Cache Steering

潜在相位偏移回滚:通过残差流监控和KV-缓存引导进行推理时的误差校正

Manan Gupta, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus(比斯派恩大学,帕利尼校区)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LPSR方法,通过监控残差流和引导KV缓存来校正大语言模型中的推理错误,显著提升在MATH-500上的性能,同时在参数和token成本上更具优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00222 2026-04-16 cs.AI cs.CL cs.LG 75%

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization

RL-PLUS: 通过混合策略优化对抗LLMs在强化学习中的能力边界崩溃

Yihong Dong, Xue Jiang, Yongding Tao, Huanyu Liu, Kechi Zhang, Lili Mou, Rongyu Cao, Yingwei Ma, Jue Chen, Binhua Li, Zhi Jin, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RL-PLUS通过混合策略优化解决LLMs在强化学习中的能力边界崩溃问题,结合内部利用与外部数据提升推理能力,实验表明其在数学推理和分布外任务中表现优异。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 75%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02450 2026-04-06 cs.LG cs.AI cs.CL 75%

Do We Need Frontier Models to Verify Mathematical Proofs?

我们是否需要前沿模型来验证数学证明?

Aaditya Naik, Guruprerana Shabadi, Rajeev Alur, Mayur Naik

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了开源和前沿LLM在验证数学证明中的表现,发现较小模型在准确性上接近前沿模型,但一致性较差,通过定制提示词提升性能。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10624 2026-03-12 cs.LG cs.AI cs.CL 75%

Reinforcement Learning with Conditional Expectation Reward

基于条件期望奖励的强化学习

Changyi Xiao, Caijun Xu, Yixin Cao

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于大语言模型自身作为隐式验证器的条件期望奖励方法,用于提升一般领域推理任务的准确性与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21880 2026-02-10 cs.CL cs.AI cs.LG 75%

No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping

无提示被忽视:通过熵引导的优势塑造利用零方差提示进行LLM强化学习

Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过熵引导的优势塑造,RL-ZVP利用零方差提示提升LLM推理能力,显著优于GRPO及其他基线方法。

Comments ICLR 2026 camera-ready version

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05242 2026-01-09 cs.CL cs.AI cs.LG 75%

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

GDPO:多奖励强化学习优化中的组奖励解耦归一化策略优化

Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Peter Belcak, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, Yejin Choi, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GDPO通过解耦奖励归一化提升多奖励强化学习优化的稳定性和准确性,优于GRPO。

Comments NVIDIA-Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03759 2025-12-04 cs.CL cs.AI cs.LG 75%

Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective

从序列层面视角出发的扩散大语言模型原理化强化学习

Jingyang Ou, Jiaqi Han, Minkai Xu, Shaoxuan Xu, Jianwen Xie, Stefano Ermon, Yi Wu, Chongxuan Li

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心) Stanford University(斯坦福大学) Lambda, Inc(Lambda公司) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ESPO,一种基于序列级优化的原理化强化学习框架,用于提升扩散大语言模型的生成能力,通过ELBO作为似然代理,显著优于token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25784 2025-10-31 cs.CL cs.AI cs.LG 75%

zFLoRA: Zero-Latency Fused Low-Rank Adapters

Dhananjaya Gowda, Seoha Song, Harshith Goka, Junhyun Lee

机构 * Samsung Research(三星研究院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23566 2025-10-28 cs.CV 75%

Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition

Yu Li, Jin Jiang, Jianhua Zhu, Shuai Peng, Baole Wei, Yuxuan Zhou, Liangcai Gao

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments Accepted by NeurIPS 2025 as a spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21097 2025-10-17 cs.CL cs.AI cs.LG 75%

Thinker: Learning to Think Fast and Slow

Stephen Chung, Wenyu Du, Jie Fu

机构 * University of Cambridge(剑桥大学) The University of Hong Kong(香港大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13744 2025-10-16 cs.AI cs.CL cs.LG 75%

Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math

Shrey Pandit, Austin Xu, Xuan-Phi Nguyen, Yifei Ming, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02227 2025-10-10 cs.CL cs.AI cs.LG 75%

More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration

Xiaoyang Yuan, Yujuan Ding, Yi Bin, Wenqi Shao, Jinyu Cai, Jingkuan Song, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14979 2025-09-23 cs.AI cs.CL cs.LG 75%

Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology

Wei Xie, Shuoyoucheng Ma, Zhenhua Wang, Enze Wang, Kai Chen, Xiaobing Sun, Baosheng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科学、技术和研究局高性能计算研究所) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Thank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/24x9t7s1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21544 2025-09-12 cs.CL cs.AI cs.LG 75%

SWI: Speaking with Intent in Large Language Models

Yuwei Yin, EunJeong Hwang, Giuseppe Carenini

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能矢量研究所)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code: https://github.com/YuweiYin/SWI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02587 2025-08-05 cs.LG cs.AI cs.CL 75%

Parameter-Efficient Routed Fine-Tuning: Mixture-of-Experts Demands Mixture of Adaptation Modules

Yilun Liu, Yunpu Ma, Yuetian Lu, Shuo Chen, Zifeng Ding, Volker Tresp

机构 * Technical University of Munich(慕尼黑技术大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) University of Cambridge(剑桥大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This paper is a preprint under review. arXiv admin note: text overlap with arXiv:2411.08212

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07389 2025-07-18 cs.LG cs.AI cs.CL 75%

Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression

Hanqi Xiao, Yi-Lin Sung, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025 Camera Ready. Code: https://github.com/The-Inscrutable-X/TACQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06892 2025-07-14 cs.LG cs.AI cs.CL 75%

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Jing Liang, Hongyao Tang, Yi Ma, Jinyi Liu, Yan Zheng, Shuyue Hu, Lei Bai, Jianye Hao

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preliminary version, v3, added the missing name of x-axis in the left part of Fig.1 and corrected a wrong number in Fig.3. Project page: https://anitaleungxx.github.io/ReMix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18254 2025-06-24 cs.LG cs.AI cs.CL 75%

RLPR: Extrapolating RLVR to General Domains without Verifiers

Tianyu Yu, Bo Ji, Shouli Wang, Shu Yao, Zefan Wang, Ganqu Cui, Lifan Yuan, Ning Ding, Yuan Yao, Zhiyuan Liu, Maosong Sun, Tat-Seng Chua

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Shanghai Qi Zhi Institute(上海启智研究院) Harbin Institute of Technology(哈尔滨工业大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project Website: https://github.com/openbmb/RLPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17930 2025-06-24 cs.AI cs.CL cs.LG cs.NE cs.RO 75%

Evolving Prompts In-Context: An Open-ended, Self-replicating Perspective

Jianyu Wang, Zhiqiang Hu, Lidong Bing

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025, and Code will be released at: https://github.com/jianyu-cs/PromptQuine/

Journal ref Forty-second International Conference on Machine Learning, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07491 2025-06-24 cs.CV 75%

Kimi-VL Technical Report

Kimi Team, Angang Du, Bohong Yin, Bowei Xing, Bowen Qu, Bowen Wang, Cheng Chen, Chenlin Zhang, Chenzhuang Du, Chu Wei, Congcong Wang, Dehao Zhang, Dikang Du, Dongliang Wang, Enming Yuan, Enzhe Lu, Fang Li, Flood Sung, Guangda Wei, Guokun Lai, Han Zhu, Hao Ding, Hao Hu, Hao Yang, Hao Zhang, Haoning Wu, Haotian Yao, Haoyu Lu, Heng Wang, Hongcheng Gao, Huabin Zheng, Jiaming Li, Jianlin Su, Jianzhou Wang, Jiaqi Deng, Jiezhong Qiu, Jin Xie, Jinhong Wang, Jingyuan Liu, Junjie Yan, Kun Ouyang, Liang Chen, Lin Sui, Longhui Yu, Mengfan Dong, Mengnan Dong, Nuo Xu, Pengyu Cheng, Qizheng Gu, Runjie Zhou, Shaowei Liu, Sihan Cao, Tao Yu, Tianhui Song, Tongtong Bai, Wei Song, Weiran He, Weixiao Huang, Weixin Xu, Xiaokun Yuan, Xingcheng Yao, Xingzhe Wu, Xinhao Li, Xinxing Zu, Xinyu Zhou, Xinyuan Wang, Y. Charles, Yan Zhong, Yang Li, Yangyang Hu, Yanru Chen, Yejie Wang, Yibo Liu, Yibo Miao, Yidao Qin, Yimin Chen, Yiping Bao, Yiqin Wang, Yongsheng Kang, Yuanxin Liu, Yuhao Dong, Yulun Du, Yuxin Wu, Yuzhi Wang, Yuzi Yan, Zaida Zhou, Zhaowei Li, Zhejun Jiang, Zheng Zhang, Zhilin Yang, Zhiqi Huang, Zihao Huang, Zijia Zhao, Ziwei Chen, Zongyu Lin

机构 * Kimi Team(Kimi 团队)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments Updated Kimi-VL-A3B-Thinking-2506 information

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22756 2025-05-30 cs.AI cs.CL cs.LG 75%

Decomposing Elements of Problem Solving: What "Math" Does RL Teach?

Tian Qin, Core Francisco Park, Mujin Kwun, Aaron Walsman, Eran Malach, Nikhil Anand, Hidenori Tanaka, David Alvarez-Melis

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15068 2025-05-22 cs.AI cs.CL cs.LG 75%

ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges

Cheng Qian, Hongyi Du, Hongru Wang, Xiusi Chen, Yuji Zhang, Avirup Sil, Chengxiang Zhai, Kathleen McKeown, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research AI(IBM人工智能研究) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 36 Pages, 26 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20355 2025-04-30 cs.CL cs.AI cs.LG 75%

Local Prompt Optimization

Yash Jain, Vishal Chowdhary

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted as Oral at NAACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19865 2025-03-11 cs.CL cs.AI cs.LG 75%

Reverse Thinking Makes LLMs Stronger Reasoners

Justin Chih-Yao Chen, Zifeng Wang, Hamid Palangi, Rujun Han, Sayna Ebrahimi, Long Le, Vincent Perot, Swaroop Mishra, Mohit Bansal, Chen-Yu Lee, Tomas Pfister

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14985 2025-03-04 cs.CL cs.AI cs.LG 75%

Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data

Xinyi Wang, Antonis Antoniades, Yanai Elazar, Alfonso Amayuelas, Alon Albalak, Kexun Zhang, William Yang Wang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19393 2025-03-04 cs.CL cs.AI cs.LG 75%

s1: Simple test-time scaling

Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Candès, Tatsunori Hashimoto

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 46 pages (9 main), 10 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18514 2025-03-03 cs.AI cs.CL cs.LG 75%

Scaling up Masked Diffusion Models on Text

Shen Nie, Fengqi Zhu, Chao Du, Tianyu Pang, Qian Liu, Guangtao Zeng, Min Lin, Chongxuan Li

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16666 2025-02-26 cs.AI cs.CL cs.LG 75%

SBSC: Step-By-Step Coding for Improving Mathematical Olympiad Performance

Kunal Singh, Ankan Biswas, Sayandeep Bhowmick, Pradeep Moturi, Siva Kishore Gollapalli

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a full conference paper at ICLR 2025. Shorter(Early) Version accepted at NeurIPS'24 MATH-AI track

详情

展开后加载摘要…

URL PDF HTML 收藏