arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 161 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 15 篇

2605.11625 2026-05-13 cs.AI 85%

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

好折叠还是英雄召唤:学习适应性推理的预算高效思考

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出Budget-Efficient Thinking框架,通过结合行为冷启动与GRPO,在投资成本意识奖励下,学习短回答、早放弃和保留计算资源三种行为,提升推理效率与性能。

Comments 24 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11609 2026-05-13 cs.LG cs.AI cs.CL 85%

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

反自我蒸馏用于通过点互信息的推理强化学习

Guobin Shen, Xiang Cheng, Chenxiao Zhao, Lei Huang, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反自我蒸馏方法,通过分析点互信息解决自我蒸馏在数学推理中的不一致问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11906 2026-05-13 cs.CL 83%

YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning

YFPO:一种基于神经引导奖励的数学推理的初步研究

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 YFPO通过识别数学相关神经元并构建辅助奖励,提升大语言模型的推理能力,实验表明神经层面信号可增强偏好优化,为更精细的推理后训练提供新方向。

Comments 10 pages, 2figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11636 2026-05-13 cs.AI 79%

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes:具有演变干扰的对抗自博弈用于LLM推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Independent Researchers(独立研究者) Xidian University(西安电子科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Seirênes通过对抗自博弈框架将LLM推理中的上下文干扰转化为训练信号,提升推理鲁棒性,在多个数学推理基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10973 2026-05-13 cs.LG cs.AI 73%

Rotation-Preserving Supervised Fine-Tuning

保持旋转的监督微调

Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RPSFT方法,通过保持预训练奇异子空间的投影旋转来提升模型在领域内和领域外任务间的平衡性能,改进了标准SFT的不足。

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11403 2026-05-13 cs.LG cs.AI cs.CL 67%

fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum

fg-expo: 基于前沿引导的探索优先策略优化:通过自适应KL和高斯课程学习

Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FG-ExPO算法,通过自适应KL缩放和高斯课程采样提升策略优化效率,实验表明其在数学推理任务中性能显著优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11167 2026-05-13 cs.CL cs.AI cs.LG 67%

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

双通道模型:并行语言模型之间双向隐藏状态耦合

Cedric Flamant, Udaya Ghai, Kanna Shimizu

机构 * AWS Agentic AI(AWS智能AI)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双通道模型,通过可训练的神经接口在两个预训练语言模型的中间隐藏状态之间建立双向耦合,实现任务驱动与工具执行的协同,提升多任务性能。

Comments 9 pages main text, 5 figures, 24 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04894 2026-05-13 cs.CL cs.AI cs.LG 67%

Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR

不对称优势调制校准RLVR中的熵动态

Hengrui Gu, Xiaotian Han, Yujing Bian, Feiyi Wang, Kaixiong Zhou

机构 * North Carolina State University(北卡罗来纳州立大学) Case Western Reserve University(凯斯西储大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究RLVR中探索受限问题,提出AsymGRPO通过分离正负优势调制强度,精准控制熵动态以提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11491 2026-05-13 cs.LG cs.AI 62%

Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

理解与防止RLVR中的熵崩溃:基于策略熵流的在线优化

Huimin Xu, Shuai Zhao, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPEFO方法,通过平衡熵动态缓解RLVR中的熵崩溃问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11235 2026-05-13 cs.LG cs.AI 62%

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

将课程判断内部化以优化大语言模型强化微调

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu

机构 * MIT(麻省理工学院) Amazon AGI(亚马逊人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出METIS框架,通过内部化课程判断提升LLM强化微调效率与性能,利用训练结果动态分配训练资源,实现闭环优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11974 2026-05-13 cs.LG 57%

Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization

迈向顺序公平性:通过双组优势优化缓解大语言模型的顺序敏感性

Xu Chu, Guanyu Wang, Zhijie Tan, Xinrong Chen, Ziyu Li, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(软件与微电子学院,北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出双组优势优化(DGAO),通过平衡组内准确性优势和组间稳定性优势,缓解LLM的顺序敏感性,提升模型在RAG、数学推理和分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11845 2026-05-13 cs.CL 57%

Probabilistic Calibration Is a Trainable Capability in Language Models

概率校准是语言模型中的可训练能力

Davide Baldelli, Sruthi Kuriakose, Maryam Hashemzadeh, Amal Zouaq, Sarath Chandar

机构 * Chandar Research Lab(昌达尔研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) Independent researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究通过微调提升语言模型的概率校准能力,发现两种微调方法在不同任务中表现各异,硬目标方法在结构化数值采样更优,软目标方法在广泛随机生成任务中表现更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11136 2026-05-13 cs.AI 57%

EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales

EVOCHAMBER:在个体、团队和种群层面进行多智能体系统的测试时间共进化

Yaolun Zhang, Tianyi Xu, Shengyu Dai, Zhenwen Shao, Qingyun Wu, Huazheng Wang

机构 * Oregon State University(俄勒冈州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johnson & Johnson(强生公司) Pennsylvania State University(宾夕法尼亚州立大学) AG2AI, Inc.(AG2AI公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 EVOCHAMBER通过在多智能体系统中实现测试时间共进化,解决了传统方法在跨智能体学习和专业化保留上的不足,通过协作梦境协议和群体生命周期操作,在不同任务流上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08083 2026-05-13 cs.CL 57%

LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling

LLMs改进LLMs:测试时扩展的代理发现

Tong Zheng, Haolin Liu, Chengsong Huang, Huiwen Bao, Sheng Zhang, Rui Liu, Runpeng Dai, Ruibo Chen, Chenxi Liu, Tianyi Xiong, Xidong Wu, Hongming Zhang, Heng Huang

机构 * UMD(马里兰大学) UVA(弗吉尼亚大学) WUSTL(华盛顿大学) UNC(北卡罗来纳大学) Google(谷歌) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AutoTTS框架,通过环境驱动的方法自动发现测试时扩展策略,提升大语言模型性能,实验表明其在数学推理基准上的准确率与成本平衡优于人工设计基线。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12928 2026-05-13 cs.CL eess.AS 57%

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

MoshiRAG: 异步知识检索用于全双工语音语言模型

Chung-Ming Chien, Manu Orsini, Eugene Kharitonov, Neil Zeghidour, Karen Livescu, Alexandre Défossez

机构 * Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MoshiRAG,通过异步框架结合紧凑接口与选择性检索,提升全双工语音模型的事实性,同时保持交互性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 6 篇

2509.25239 2026-05-13 cs.AI cs.CL cs.LG 80%

A Formal Comparison Between Chain of Thought and Latent Thought

链式思维与潜在思维的正式比较

Kevin Xu, Issei Sato

机构 * Department of Computer Science, The University of Tokyo, Japan(东京大学计算机科学系)

专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文对比了链式思维与潜在思维,发现潜在思维在并行计算上更高效,而链式思维能通过随机解码实现近似计数与采样。

Comments Camera-ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11922 2026-05-13 cs.SE cs.CL 79%

StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹

Hao Wang, Rui Li, Lei Sha, Jie M. Zhang

机构 * Beihang University, Beijing, China(北京航空航天大学) Peking University, Beijing, China(北京大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) King's College London, United Kingdom(伦敦国王学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10974 2026-05-13 cs.LG cs.AI 62%

Vertex-Softmax: Tight Transformer Verification via Exact Softmax Optimization

顶点softmax:通过精确softmax优化实现严格的transformer验证

Navid Rezazadeh, Arash Gholami Davoodi

机构 * University of California, Irvine(加州大学尔湾分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出顶点softmax方法,通过精确优化softmax函数,实现transformer注意力的严格验证,提升了认证率并收紧了下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12239 2026-05-13 cs.PL cs.AI math.CT 57%

Harness Engineering as Categorical Architecture

利用工程作为范畴架构

Bogdan Banu

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文提出利用范畴架构三元组(G, Know, Phi)作为LLM代理的正式化框架,通过映射四个支柱到三元组组件,提供结构保证并验证了编译器在不同框架中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12139 2026-05-13 cs.AI 57%

BoolXLLM: LLM-Assisted Explainability for Boolean Models

BoolXLLM: 基于大语言模型的布尔模型可解释性

Du Cheng, Serdar Kadioglu, Xin Wang

机构 * AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BoolXLLM框架,结合大语言模型提升布尔模型的可解释性,通过特征选择、阈值推荐和规则压缩三个阶段增强解释性,实现理论与人类可理解的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12363 2026-05-13 cs.CY cs.HC 50%

Reimagining Assessment in the Age of Generative AI: Lessons from Open-Book Exams with ChatGPT

在生成式AI时代重新审视评估:来自使用ChatGPT的开放式考试的启示

Qusay H. Mahmoud

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究探讨学生在开放式考试中使用ChatGPT的交互模式,发现评估任务从生成答案转向验证答案有效性,强调推理能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2605.11258 2026-05-13 cs.AI cs.CL q-bio.QM 88%

Unlocking LLM Creativity in Science through Analogical Reasoning

通过类比推理解锁大语言模型在科学中的创造力

Andrew Shen, Shaul Druckmann, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过类比推理方法提升大语言模型在开放性问题解决中的多样性与创新性,实验表明该方法显著提高了生成解决方案的质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00775 2026-05-13 cs.RO cs.SY eess.SY 82%

SAGAS: Semantic-Aware Graph-Assisted Stitching for Offline Temporal Logic Planning

SAGAS:语义感知的图辅助拼接用于离线时序逻辑规划

Ruijia Liu, Ancheng Hou, Xiang Yin

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract)

AI总结 SAGAS结合符号合成的组成性和从离线轨迹学习的数据驱动可达结构,实现零样本泛化,无需任务特定奖励或在线交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12421 2026-05-13 cs.AI 57%

Formalize, Don't Optimize: The Heuristic Trap in LLM-Generated Combinatorial Solvers

形式化,而非优化:LLM生成组合求解器中的启发式陷阱

Haoyu Wang, Yuliang Song, Tao Li, Zhiwei Deng, Yaqing Wang, Deepak Ramachandran, Eldan Cohen, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind) Oracle AI(Oracle人工智能)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究LLM生成组合求解器时形式化与优化的矛盾,通过CP-SynC-XL基准测试,发现Python+OR-Tools在正确性上最优,而MiniZinc+OR-Tools虽使用相同后端但覆盖度较低,启发式优化导致部分问题速度下降和正确性降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11733 2026-05-13 cs.CE cs.DC 50%

Position: LLM Inference Should Be Evaluated as Energy-to-Token Production

位置:LLM推理应作为能量到令牌生产进行评估

Xiang Liu, Shimiao Yuan, Zhenheng Tang, Peijie Dong, Kaiyong Zhao, Qiang Wang, Bo Li, Xiaowen Chu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出将LLM推理视为能量到令牌生产,强调在固定质量和性能目标下,约束从理论峰值计算转向实际能源、冷却和效率问题,呼吁报告能耗、绑定约束和效率指标。

Comments https://dominic789654.github.io/energy-to-token/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 28 篇

2605.11534 2026-05-13 cs.RO 88%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11553 2026-05-13 cs.IR 82%

TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning

TwiSTAR:快速思考,缓慢思考,然后行动,基于语义ID的生成推荐

Shiteng Cao, Kaian Jiang, Yunlong Gong, Zhiheng Li

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出TwiSTAR框架,通过自适应分配推理努力提升推荐准确性与效率,利用语义ID检索、轻量级排序和慢推理模型,结合常识知识增强,减少延迟并优于基线方法。

Comments 16pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11666 2026-05-13 cs.LG cs.AI 81%

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

进化任务发现:通过技能组合与复杂性缩放推进推理前沿

Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvoTD框架,通过结构化进化算子在算法技能与复杂性属性的双轴流形上进行数据合成,提升模型推理能力,并在不同架构和规模上实现稳定泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 79%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17265 2026-05-13 cs.IR 78%

MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search

MemSearch-o1:通过基于推理的内存增长增强大语言模型的代理搜索

Sheng Zhang, Junyi Li, Yingyi Zhang, Pengyue Jia, Yichao Wang, Xiaowei Qian, Wenlin Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 规划推理 :reasoning(title,abstract)

AI总结 MemSearch-o1通过基于推理的内存增长和回溯机制,解决代理搜索中的内存稀释问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏