arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2604.00824 2026-04-07 cs.SE 78%

Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs

即使更少也是更好:用于代理、推理和编码LLM的更优方案

CodeArts Model Team, Yang Ye, Jingyuan Tan, Tianyue Jiang, Ruizhe Ye, Qiankun He, Jiarui Yang, Jian Dong, Sicong Liang, Chongjian Yue, Peibai Xu, Lufan Lu, Shiguan Pang, Taotao Qian, Junbao Hu, Yuechan Hao, Ensheng Shi, Qi Zhang, Yi Hao, Na Fan, Xin Tan, Shuai Yao, Zhiwei Shen, Zongchen Li, Yanlin Wang, Chong Chen, Yuchi Ma

专题命中 数学推理 :reasoning(title,abstract)

AI总结 本文提出STITCH框架,通过过滤低价值噪声和保留决策关键标记,以更少但高质量的训练轨迹提升代理能力,在多个框架和语言中实现显著提升。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21854 2025-09-29 cs.MM cs.CV 78%

Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization

Songjun Tu, Qichao Zhang, Jingbo Sun, Yuqian Fu, Linjing Li, Xiangyuan Lan, Dongmei Jiang, Yaowei Wang, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 数学推理 :reasoning(title,abstract)

Comments 12pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23905 2025-06-30 cs.CV 78%

Boosting MLLM Reasoning with Text-Debiased Hint-GRPO

Qihan Huang, Weilong Dai, Jinlong Liu, Wanggui He, Hao Jiang, Mingli Song, Jingyuan Chen, Chang Yao, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07905 2025-06-10 cs.CV 78%

WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning

Jie Yang, Feipeng Ma, Zitian Wang, Dacheng Yin, Kang Rong, Fengyun Rao, Ruimao Zhang

专题命中 数学推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02390 2025-06-02 cs.MA 78%

ReSo: A Reward-driven Self-organizing LLM-based Multi-Agent System for Reasoning Tasks

Heng Zhou, Hejia Geng, Xiangyuan Xue, Li Kang, Yiran Qin, Zhiyong Wang, Zhenfei Yin, Lei Bai

专题命中 数学推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18589 2025-05-14 cs.CV 78%

Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency

Zhikai Wang, Jiashuo Sun, Wenqi Zhang, Zhiqiang Hu, Xin Li, Fan Wang, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 数学推理 :reasoning(title,abstract)

Comments Home page: https://alibaba-damo-academy.github.io/VCBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07365 2025-04-16 cs.CV 78%

MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning

Fanqing Meng, Lingxiao Du, Zongkai Liu, Zhixiang Zhou, Quanfeng Lu, Daocheng Fu, Tiancheng Han, Botian Shi, Wenhai Wang, Junjun He, Kaipeng Zhang, Ping Luo, Yu Qiao, Qiaosheng Zhang, Wenqi Shao

专题命中 数学推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12568 2024-09-20 cs.CV cs.MM 78%

InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning

Xiaotian Han, Yiren Jian, Xuefeng Hu, Haogeng Liu, Yiqi Wang, Qihang Fan, Yuang Ai, Huaibo Huang, Ran He, Zhenheng Yang, Quanzeng You

专题命中 数学推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12682 2022-05-26 cs.IR 78%

TaCube: Pre-computing Data Cubes for Answering Numerical-Reasoning Questions over Tabular Data

Fan Zhou, Mengkang Hu, Haoyu Dong, Zhoujun Cheng, Shi Han, Dongmei Zhang

专题命中 数学推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12348 2026-08-17 cs.DB cs.AI 版本更新 77%

Can Large Language Models Reason about Event-Time Stream-Processing Semantics?

StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?

Zhuoxi Wang, Shibo Zheng, Haoyu Zhang

专题命中 数学推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01667 2026-08-04 cs.AI 新提交 77%

TCPO: Turn-Level Credit Policy Optimization

TCPO:回合级信用策略优化

Sicong Liao, Zhi Chen, Yaohua Tang

机构 * Moore Threads AI(摩尔线程人工智能)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27610 2026-07-31 cs.LG 新提交 77%

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择

Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Communication University of China(中国传媒大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05711 2026-07-16 cs.CL 版本更新 77%

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

超越Token:基于LLM的多智能体系统中潜在通信的统一框架

Yingzhuo Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL

AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07026 2026-07-09 cs.LG 新提交 77%

Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata

通过有限自动机上的高效推理实现扩散语言模型的约束解码

Meihua Dang, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究扩散语言模型的约束解码问题,提出基于有限自动机高效推理的算法,能保证约束满足,支持多种解码方式,经实验验证在多种任务上提升准确率且推理开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25354 2026-07-01 cs.CL 新提交 77%

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

通过局部分支路由实现高效且可训练的语言模型测试时扩展

Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

机构 * Northwestern University(西北大学) Rutgers University(罗格斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织) Tilde Research(Tilde研究) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) University of California, San Diego(加州大学圣迭戈分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL

AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17024 2026-06-16 cs.LG 新提交 77%

ExpRL: Exploratory RL for LLM Mid-Training

ExpRL: 用于LLM中期训练的探索性强化学习

Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral Kumar

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI Rogo

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10218 2026-05-12 cs.CL 77%

Relative Score Policy Optimization for Diffusion Language Models

相对分数策略优化用于扩散语言模型

Zichao Yu, Shengze Xu, Bingqing Jiang, Wenyi Zhang, Difan Zou

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出RSPO方法,通过可验证奖励校准扩散语言模型中的噪声似然估计,提升推理能力,在规划任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07237 2026-05-12 cs.CL 77%

Teaching Language Models to Think in Code

教语言模型用代码思考

Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN科技)

专题命中 数学推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出ThinC框架,通过代码自身进行推理而非依赖自然语言,提升了数学问题解决能力,其在多个基准测试中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19780 2026-04-23 cs.CL 77%

Avoiding Overthinking and Underthinking: Curriculum-Aware Budget Scheduling for LLMs

避免过度思考与不足思考:面向大语言模型的课程感知预算调度

Amirul Rahman, Aisha Karim, Kenji Nakamura, Yi-Fan Ng

机构 * University of Malaya(马来大学)

专题命中 数学推理 :reasoning(abstract,abstract_cn);test-time compute(abstract);分类 cs.CL

AI总结 本文提出BCAE框架,通过预算感知课程调度和截断感知密集奖励机制,优化LLM的推理质量和token效率,实验表明在多种数学推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08391 2026-03-12 cs.CL 77%

Adaptive Loops and Memory in Transformers: Think Harder or Know More?

变换器中的自适应循环与记忆:更努力思考还是更了解更多?

Markus Frey, Behzad Shomali, Ali Hamza Bashir, David Berghaus, Joachim Koehler, Mehdi Ali

机构 * Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫 IAIS 研究所) University of Bonn(波恩大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究提出结合自适应循环和门控记忆的变换器模型,提升数学推理和常识任务性能。

Comments Published at Latent & Implicit Thinking Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18434 2025-11-18 cs.CL 77%

Chain-of-Conceptual-Thought Elicits Daily Conversation in Large Language Models

Qingqing Gu, Dan Wang, Yue Zhao, Xiaoyu Wang, Zhonglin Jiang, Yong Chen, Hongyan Li, Luo Ji

机构 * Geely AI Lab(Geely人工智能实验室) Beijing Institute of Technology(北京理工大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments PRICAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10446 2025-11-03 cs.CL 77%

Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models

Zemin Huang, Zhiyang Chen, Zijun Wang, Tiancheng Li, Guo-Jun Qi

机构 * Zhejiang Univeristy(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Matterwave Intelligence Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以高级技术研究所)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025. Code link: https://github.com/maple-research-lab/LLaDOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18962 2025-10-17 cs.LG 77%

Spend Wisely: Maximizing Post-Training Gains in Iterative Synthetic Data Bootstrapping

Pu Yang, Yunzhen Feng, Ziyuan Chen, Yuhang Wu, Zhuoyuan Li

机构 * Peking University(北京大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.LG

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13501 2025-10-16 cs.AI 77%

Confidence as a Reward: Transforming LLMs into Reward Models

He Du, Bowen Li, Chengxing Xie, Chang Gao, Kai Chen, Dacheng Tao

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09369 2025-10-13 cs.CL 77%

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood

Xingyu Lin, Yilin Wen, En Wang, Du Su, Wenbin Liu, Chenfu Bao, Zhonghou Lv

机构 * Baidu Inc(百度公司) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(吉林大学教育部符号计算与知识工程重点实验室) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07486 2025-10-10 cs.CL 77%

AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding

Shuqing Luo, Yilin Guan, Pingzhi Li, Hanrui Wang, Tianlong Chen

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校) Johns Hopkins University(约翰霍普金斯大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 14 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24884 2025-09-30 cs.CL 77%

Expanding Computation Spaces of LLMs at Inference Time

Yoonna Jang, Kisu Yang, Isabelle Augenstein

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24460 2025-09-30 cs.AI 77%

ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling

Haotian Zhang, Liu Liu, Baosheng Yu, Jiayan Qiu, Likang Xiao, Yanwei Ren, Quan Chen, Xianglong Liu

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Hangzhou International Innovation Institute, Beihang University(北航杭州国际创新研究院) Nanyang Technological University(南洋理工大学) University of Leicester(莱斯特大学) Kuaishou Technology(快手科技)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20016 2025-09-29 cs.CL 77%

Vulnerability of LLMs to Vertically Aligned Text Manipulations

Zhecheng Li, Yiwei Wang, Bryan Hooi, Yujun Cai, Zhen Xiong, Nanyun Peng, Kai-wei Chang

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of California, Los Angeles(加州大学洛杉矶分校) The University of Queensland(昆士兰大学) National University of Singapore(新加坡国立大学) University of Southern California(南加州大学) University of California, Merced(加州大学默塞德分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06949 2025-09-09 cs.CL 77%

Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models

Yinjie Wang, Ling Yang, Bowen Li, Ye Tian, Ke Shen, Mengdi Wang

专题命中 数学推理 :reasoning(abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL

Comments Code and Models: https://github.com/Gen-Verse/dLLM-RL

详情

展开后加载摘要…

URL PDF HTML 收藏