arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-22 至 2026-04-22 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 10 篇

2601.04237 2026-04-22 cs.AI cs.CL cs.LG 87%

SAGE-32B: Agentic Reasoning via Iterative Distillation

SAGE-32B:通过迭代蒸馏实现代理推理

Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(韦达学院) Madan Bhandari Memorial College(马丹·班达里纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAGE-32B是一种专注于代理推理和长期规划的320亿参数语言模型,通过迭代蒸馏提升推理能力,在代理推理基准测试中表现出色。

Comments 23 Pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18612 2026-04-22 cs.NE cs.AI cs.LG 82%

Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models

Agent-GWO: 为大型语言模型的动态提示优化设计的协作代理

Xudong Wang, Chaoning Zhang, Chenghao Li, Shuxu Chen, Qigan Sun, Jiaquan Zhang, Fachrina Dewi Puspitasari, Tae-Ho Kim, Jiwei Wei, Malu Zhang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Kyung Hee University(韩国庆熙大学) University of Electronic Science and Technology of China(电子科技大学) Nota Inc.(Nota公司) Tongji University(同济大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agent-GWO框架,通过统一提示模板和解码超参数作为可继承的代理配置,利用灰狼优化器的领导者-追随者机制,自动选择领导者代理以指导协作更新,提升复杂推理的准确性和稳定性。

Comments Accepted to ACL 2026. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11582 2026-04-22 cs.CL cs.AI cs.LG 82%

A Triadic Suffix Tokenization Scheme for Numerical Reasoning

三元后缀数字分词方案用于数值推理

Olga Chetverina

机构 * MIPT, Moscow, Russia(莫斯科米进大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Triadic Suffix Tokenization方案,通过三元分组和明确的量级标记,解决数字分词不一致问题,提升大语言模型在算术和科学推理中的稳定性与准确性。

Comments v3: Updated to include analysis of N=1 scalability for SLM architectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18897 2026-04-22 cs.CL cs.LG 81%

Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning

少即是多:在大语言模型数学推理中的认知负荷与单提示天花板

Manuel Israel Cazares

机构 * Bytepro AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示工程在形式数学推理中的效果,发现单提示存在性能上限,通过分析发现数学不可判定性、复杂规则系统及提示顺序影响是限制因素,最佳提交在硬性任务中达到79.25%的准确率。

Comments Companion repository: https://github.com/israelcazares/sair-prompt-engineering | Zenodo DOI: 10.5281/zenodo.19598433 | v15: final Contributor Network data (n=52, competition close April 20, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 79%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15173 2026-04-22 cs.AI 79%

Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs

注意(DH)差距!理性推理与对话LLM在风险选择中的对比

Luise Ge, Yongyan Zhang, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过对比推理模型与对话模型在风险决策中的表现,发现前者更理性,后者更接近人类但受因素影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19087 2026-04-22 cs.AI 70%

OLLM: Options-based Large Language Models

OLLM:基于选项的大型语言模型

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science(计算机科学系) University of Bath(巴斯大学) Department of Psychology(心理学系)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 OLLM通过引入学习选项提升语言模型的生成可控性与鲁棒性,利用低维选项空间实现更高效的奖励优化,减少常见对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19485 2026-04-22 cs.LG cs.AI cs.CL 67%

EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化

Chengjun Pan, Shichun Liu, Jiahang Lin, Dingwei Zhu, Jiazheng Zhang, Shihan Dou, Songyang Gao, Zhenhua Han, Binghai Wang, Rui Zheng, Xuanjing Huang, Tao Gui, Yansong Feng

机构 * Peking University(北京大学) Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18963 2026-04-22 cs.LG cs.AI 62%

Distillation Traps and Guards: A Calibration Knob for LLM Distillability

知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器

Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) Nanyang Technological University(南洋理工大学) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学) SAN University(SAN大学)

专题命中 数学推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16535 2026-04-22 cs.LG cs.AI 62%

SCATR: Simple Calibrated Test-Time Ranking

SCATR: 简单校准的测试时间排名

Divya Shyamal, Marta Knežević, Lan Tran, Chanakya Ekbote, Vijay Lingam, Paul Pu Liang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SCATR通过利用基础模型的隐藏表示,从小型校准集学习轻量级评分器,提升了测试时间排名的效率和准确性,在多个基准测试中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏