arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2512.16676 2025-12-19 cs.LG cs.CL 73%

DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI

DataFlow:面向数据导向AI时代的统一数据准备与工作流自动化框架

Hao Liang, Xiaochen Ma, Zhou Liu, Zhen Hao Wong, Zhengyang Zhao, Zimo Meng, Runming He, Chengyu Shen, Qifeng Cai, Zhaoyang Han, Meiyi Qiang, Yalin Feng, Tianyi Bai, Zewei Pan, Ziyi Guo, Yizhen Jiang, Jingwen Deng, Qijie You, Peichao Lai, Tianyu Guo, Chi Hsu Tsai, Hengyi Feng, Rui Hu, Wenkai Yu, Junbo Niu, Bohan Zeng, Ruichuan An, Lu Ma, Jihao Huang, Yaowei Zheng, Conghui He, Linpeng Tang, Bin Cui, Weinan E, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) OriginHub Technology(OriginHub技术) OpenDataLab(OpenData实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) LLaMA-Factory Team(LLaMA-Factory团队)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 DataFlow通过统一的数据准备框架和自动化工作流,提升LLM性能,实现高效、可靠的数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00466 2025-12-02 cs.CL cs.AI 73%

SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling

SCALE:面向数学测试时间扩展中性能瓶颈的有选择性资源分配

Yang Xiao, Chunpu Xu, Ruifeng Yuan, Jiashuo Wang, Wenjie Li, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 SCALE通过有选择性地分配计算资源,提升数学推理性能,显著优于均匀扩展方法。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19822 2025-11-26 cs.LG cs.AI 73%

Mosaic Pruning: A Hierarchical Framework for Generalizable Pruning of Mixture-of-Experts Models

拼图剪枝:一种用于混合专家模型通用剪枝的分层框架

Wentao Hu, Mingkuan Zhao, Shuangyong Song, Xiaoyan Zhu, Xin Lai, Jiayin Wang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 拼图剪枝通过分层框架实现混合专家模型的通用剪枝,提升模型在多样化下游任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15392 2025-11-20 cs.CL cs.AI 73%

DEPO: Dual-Efficiency Preference Optimization for LLM Agents

DEPO:用于LLM代理的双效偏好优化

Sirui Chen, Mengshi Zhao, Lei Xu, Yuying Zhao, Beier Zhu, Hanwang Zhang, Shengjie Zhao, Chaochao Lu

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DEPO通过双效偏好优化方法提升LLM代理的效率和性能,减少token和步骤消耗,同时在多个基准测试中表现优异。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03628 2025-11-06 q-fin.TR cs.AI cs.CE cs.CL 73%

LiveTradeBench: Seeking Real-World Alpha with Large Language Models

Haofei Yu, Fenghai Li, Jiaxuan You

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26768 2025-10-31 cs.CL cs.AI 73%

AMO-Bench: Large Language Models Still Struggle in High School Math Competitions

Shengnan An, Xunliang Cai, Xuezhi Cao, Xiaoyu Li, Yehao Lin, Junlin Liu, Xinxuan Lv, Dan Ma, Xuanlin Wang, Ziwen Wang, Shuang Zhou

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24772 2025-10-30 cs.CL cs.AI 73%

Confidence is Not Competence

Debdeep Sanyal, Manya Pandey, Dhruv Kumar, Saurabh Deshpande, Murari Mandal

机构 * Birla AI Labs(Birla人工智能实验室) RespAI Lab(RespAI实验室) KIIT Bhubaneshwar(KIIT大学巴纳拉塞瓦分校) BITS Pilani(比什努尔理工学院)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 20 Pages, 6 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07242 2025-10-20 cs.CL cs.LG 73%

Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense

Leitian Tao, Ilia Kulikov, Swarnadeep Saha, Tianlu Wang, Jing Xu, Sharon Li, Jason E Weston, Ping Yu

机构 * FAIR at Meta(Meta 的 FAIR) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02659 2025-10-15 cs.LG cs.CL 73%

OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding

Ramchalam Kinattinkara Ramakrishnan, Zhaocong Yuan, Shaojie Zhuo, Chen Feng, Yicheng Lin, Chenzheng Su, Xiaopeng Zhang

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02387 2025-10-13 cs.SE cs.AI cs.LG 73%

CWM: An Open-Weights LLM for Research on Code Generation with World Models

FAIR CodeGen team, Jade Copet, Quentin Carbonneaux, Gal Cohen, Jonas Gehring, Jacob Kahn, Jannik Kossen, Felix Kreuk, Emily McMilin, Michel Meyer, Yuxiang Wei, David Zhang, Kunhao Zheng, Jordi Armengol-Estapé, Pedram Bashiri, Maximilian Beck, Pierre Chambon, Abhishek Charnalia, Chris Cummins, Juliette Decugis, Zacharias V. Fisches, François Fleuret, Fabian Gloeckle, Alex Gu, Michael Hassid, Daniel Haziza, Badr Youbi Idrissi, Christian Keller, Rahul Kindi, Hugh Leather, Gallil Maimon, Aram Markosyan, Francisco Massa, Pierre-Emmanuel Mazaré, Vegard Mella, Naila Murray, Keyur Muzumdar, Peter O'Hearn, Matteo Pagliardini, Dmitrii Pedchenko, Tal Remez, Volker Seeker, Marco Selvi, Oren Sultan, Sida Wang, Luca Wehrstedt, Ori Yoran, Lingming Zhang, Taco Cohen, Yossi Adi, Gabriel Synnaeve

机构 * Meta FAIR CodeGen Team(FAIR CodeGen团队)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05283 2025-10-08 cs.AI cs.CL cs.CV 73%

Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment

Radha Gulhane, Sathish Reddy Indurthi

机构 * Radha Gulhane(独立研究者) Sathish Reddy Indurthi(独立研究者)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25160 2025-09-30 cs.CV cs.AI cs.CL 73%

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

Fan Yuan, Yuchen Yan, Yifan Jiang, Haoran Zhao, Tao Feng, Jinyan Chen, Yanwei Lou, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 68 pages, 6 figures, Project Page: https://zju-real.github.io/GSM8K-V Code: https://github.com/ZJU-REAL/GSM8K-V Datasets: https://huggingface.co/datasets/ZJU-REAL/GSM8K-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23924 2025-09-30 cs.CL cs.AI 73%

Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step

Jingyi Yang, Guanxu Chen, Xuhao Hu, Jing Shao

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures, 7 tables. Code: https://github.com/yjyddq/EOSER-ASS-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23501 2025-09-30 cs.CL cs.AI 73%

The Impact of Role Design in In-Context Learning for Large Language Models

Hamidreza Rouzegar, Masoud Makrehchi

机构 * Department of Electrical, Computer and Software Engineering(电气、计算机与软件工程系) Ontario Tech University(安大略技术大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments Code is available at https://github.com/hrouzegar/Role_Based-In-Context-Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24872 2025-09-30 cs.CV cs.AI cs.CL 73%

ProxyThinker: Test-Time Guidance through Small Visual Reasoners

Zilin Xiao, Jaywon Koo, Siru Ouyang, Jefferson Hernandez, Yu Meng, Vicente Ordonez

机构 * Rice University(里士大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08799 2025-09-29 cs.CL cs.AI 73%

KV Cache Steering for Controlling Frozen LLMs

Max Belitsky, Dawid J. Kopiczko, Michael Dorkenwald, M. Jehanzeb Mirza, James R. Glass, Cees G. M. Snoek, Yuki M. Asano

机构 * VIS Lab, University of Amsterdam(阿姆斯特丹大学VIS实验室) FunAI Lab, University of Technology Nuremberg(纽伦堡技术大学FunAI实验室) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14480 2025-09-19 cs.CL cs.AI cs.MA 73%

Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents

Weiting Tan, Xinghua Qu, Ming Tu, Meng Ge, Andy T. Liu, Philipp Koehn, Lu Lu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11016 2025-08-26 cs.LG cs.AI 73%

CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention

Qingbin Li, Rongkun Xue, Jie Wang, Ming Zhou, Zhi Li, Xiaofeng Ji, Yongqi Wang, Miao Liu, Zheming Yang, Minghui Qiu, Jing Yang

机构 * ByteDance(字节跳动)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21931 2025-07-30 cs.CL cs.AI 73%

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Carel van Niekerk, Renato Vukovic, Benjamin Matthias Ruppik, Hsien-chin Lin, Milica Gašić

机构 * Heinrich Heine Universität(海因里希·海因大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18435 2025-07-01 cs.CL cs.IT cs.LG math.IT 73%

What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?

Yizhe Zhang, Richard Bai, Zijin Gu, Ruixiang Zhang, Jiatao Gu, Emmanuel Abbe, Samy Bengio, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

Comments 10 pages for the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13379 2025-06-27 cs.CL cs.AI 73%

Thinkless: LLM Learns When to Think

Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09265 2025-06-19 cs.CL cs.AI 73%

Perspective Transition of Large Language Models for Solving Subjective Tasks

Xiaolong Wang, Yuanchi Zhang, Ziyue Wang, Yuzhuang Xu, Fuwen Luo, Yile Wang, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Jiuquan Satellite Launch Center (JSLC), Gansu, China(酒泉卫星发射中心(JSLC),甘肃,中国) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学,哈尔滨,中国) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China(计算机科学与软件工程学院,深圳大学,深圳,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) Tencent Inc, China(腾讯公司,中国)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22068 2025-05-29 cs.CL cs.AI cs.IR 73%

Beyond path selection: Better LLMs for Scientific Information Extraction with MimicSFT and Relevance and Rule-induced(R$^2$)GRPO

Ran Li, Shimin Di, Yuchen Liu, Chen Jing, Yu Qiu, Lei Chen

机构 * HKUST Hong Kong SAR, China(香港科技大学) SEU Jiangsu, China(江苏大学) HKUST(GZ) Guangzhou, China(香港科技大学(广州)) Zhipu AI Beijing, China(智谱AI) HKUST(GZ), HKUST Guangzhou, China(香港科技大学(广州)、香港科技大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21024 2025-05-28 cs.LG cs.CL 73%

Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers

Charles London, Varun Kanade

机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18830 2025-05-27 cs.LG cs.CL 73%

On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization

Wenlong Deng, Yi Ren, Muchen Li, Danica J. Sutherland, Xiaoxiao Li, Christos Thrampoulidis

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18456 2025-05-27 cs.CL cs.LG 73%

Anchored Diffusion Language Model

Litu Rout, Constantine Caramanis, Sanjay Shakkottai

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20094 2025-05-09 cs.CL cs.LG 73%

Scaling Synthetic Data Creation with 1,000,000,000 Personas

Tao Ge, Xin Chan, Xiaoyang Wang, Dian Yu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01523 2025-05-06 cs.LG cs.AI 73%

Subset Selection for Fine-Tuning: A Utility-Diversity Balanced Approach for Mathematical Domain Adaptation

Madhav Kotecha, Vijendra Kumar Vaishya, Smita Gautam, Suraj Racha

机构 * Department of Computer Science and Engineering IIT Bombay(印度理工学院班加罗尔计算机科学与工程系) Koita Centre for Digital Health IIT Bombay(IIT班加罗尔数字健康中心)

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13171 2025-04-18 cs.AI cs.CL 73%

Sleep-time Compute: Beyond Inference Scaling at Test-time

Kevin Lin, Charlie Snell, Yu Wang, Charles Packer, Sarah Wooders, Ion Stoica, Joseph E. Gonzalez

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

Comments Code and data released at: https://github.com/letta-ai/sleep-time-compute

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11536 2025-04-18 cs.CL cs.AI 73%

ReTool: Reinforcement Learning for Strategic Tool Use in LLMs

Jiazhan Feng, Shijue Huang, Xingwei Qu, Ge Zhang, Yujia Qin, Baoquan Zhong, Chengquan Jiang, Jinxin Chi, Wanjun Zhong

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

Comments fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏