arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 34 篇

2601.03682 2026-04-21 cs.CL cs.AI 93%

From Implicit to Explicit: Token-Efficient Logical Supervision for Mathematical Reasoning in LLMs

从隐式到显式:面向大语言模型数学推理的高效令牌逻辑监督

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 数学推理 :reasoning(title,abstract);CoT(summary_cn,abstract);logical reasoning(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出FSLR框架,通过显式监督提升大语言模型对逻辑关系的理解能力,实验显示其在推理准确率和训练效率上均优于CoT-SFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27462 2026-04-21 cs.CL cs.AI 88%

VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision

VCORE: 基于方差控制的优化重加权用于链式推理监督

Xuan Gong, Senmiao Wang, Hanbo Huang, Ruoyu Sun, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VCORE通过将链式推理监督转化为约束优化问题,实现对token的自适应监督分配,提升大语言模型的推理泛化能力,在数学和编程基准测试中表现突出。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00546 2026-04-21 cs.CL 87%

ThinkBrake: Efficient Reasoning via Log-Probability Margin Guided Decoding

ThinkBrake: 通过对数概率边际引导解码实现高效推理

Sangjun Song, Minjae Oh, Seungkyu Lee, Sungmin Jo, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 ThinkBrake通过监控句子边界处最高延续词与终止词的对数概率边际,减少过度推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17297 2026-04-21 cs.CL 87%

CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning

通过内在显著性剪枝压缩链式推理中的冗余

Yangsong Lan, Hongliang Dai, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本文提出CRISP框架,通过利用模型内在显著性信号压缩链式推理,减少冗余并保持逻辑一致性,实验表明在不牺牲准确性的情况下实现50-60%的token减少。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14846 2026-04-21 cs.LG cs.AI cs.CL 85%

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization

通过群体回合策略优化增强多轮工具集成代理推理

Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AWS AI Labs(AWS人工智能实验室) NVIDIA Meta

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21244 2026-04-21 cs.LG cs.AI cs.CL 85%

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

更少的噪声,更多的声音:通过指令净化进行推理的强化学习

Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

机构 * Department of Computer Science, Aarhus University(计算机科学系,阿arhus大学) Baidu Inc.(百度公司)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LENS框架,通过去除干扰标记提升强化学习推理效率,实验显示其在数学推理和科学推理中性能更优,收敛更快。

Comments Accepted at ACL 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26771 2026-04-21 cs.CL cs.LG 84%

LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models

LogicDiff:逻辑引导去噪提升掩码扩散语言模型的零样本推理

Shaik Aman

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 LogicDiff通过逻辑角色引导去噪策略提升掩码扩散语言模型的零样本推理能力,显著提高GSM8K和MATH-500任务的准确率,但较少样本提示下效果受限。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17957 2026-04-21 cs.CL 83%

Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards

过程奖励模型与规划:生成精确且可扩展的步骤级奖励数据集

Raffaele Pisano, Roberto Navigli

机构 * Babelscape Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 数学推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出基于规划逻辑问题生成过程奖励模型数据集的方法,通过PDDL领域定义语言生成百万级推理步骤,提升数学和非数学推理能力。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17696 2026-04-21 cs.AI 83%

Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play

战略:通过轨迹调节的游戏自我对战学习可转移的推理

Xiachong Feng, Deyi Yin, Xiaocheng Feng, Yi Jiang, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Qiming Li, Yuxuan Gu, Bing Qin, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出STRATAGEM,通过轨迹调节游戏自我对战学习可转移的推理,解决领域特定性和上下文停滞问题,提升数学推理和代码生成等任务的性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09354 2026-04-21 cs.CL 83%

Logit Arithmetic Elicits Long Reasoning Capabilities Without Training

逻辑运算激发长推理能力而不需训练

Yunxiang Zhang, Muhammad Khalifa, Lechen Zhang, Xin Liu, Ayoung Lee, Xinliang Frederick Zhang, Farima Fatahi Bayat, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出ThinkLogit方法,通过逻辑运算将小型推理引导器的能力转移至大模型,无需训练即可提升推理性能,实验显示在六个基准测试中实现21.5%-24.2%的提升。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06767 2026-04-21 cs.CL cs.AI cs.LG 82%

GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO

GanitLLM:通过课程-GRPO实现难度感知的孟加拉数学推理

Shubhashis Roy Dipta, Khairul Mahbub, Nadia Najjar

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GanitLLM模型及新的难度感知孟加拉数学语料库和基于课程的GRPO流程,提升低资源环境下孟加拉数学推理能力。

Comments Accepted at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00772 2026-04-21 cs.LG cs.AI cs.CL 82%

LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning

揭开真相的面纱:秩减少后主权重的浮现使以推理为导向的监督微调得以提升

Zihang Liu, Tianyu Pang, Oleg Balabanov, Chaoqun Yang, Tianjin Huang, Lu Yin, Yaoqing Yang, Shiwei Liu

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校) International Computer Science Institute, CA, USA(国际计算机科学研究所) Lawrence Berkeley National Laboratory, CA, USA(伯克利国家实验室) Dartmouth College, NH, USA(达特茅斯学院) University of Exeter, Exeter, UK(埃克塞特大学) University of Oxford, Oxford, UK(牛津大学) University of Surrey, Guildford, UK(萨里大学) Tsinghua University, China(清华大学) Eindhoven University of Technology, the Netherlands(埃因霍温理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LIFT方法,通过秩减少后选取主权重进行微调,提升推理能力,同时保持内存效率,优于全微调和LoRA。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18493 2026-04-21 cs.LG 79%

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

过于正确而无法学习:在饱和推理数据上进行强化学习

Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CUTS策略,通过约束均匀Top-K采样增强探索,结合Mixed-CUTS框架提升推理多样性,实验显示在AIME25基准上Pass@1准确率提升15.1%。

Comments ACL 2026 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04509 2026-04-21 cs.CL 79%

ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection

ErrorRadar:通过错误检测基准测试多模态大语言模型的复杂数学推理能力

Yibo Yan, Shen Wang, Jiahao Huo, Hang Li, Boyan Li, Jiamin Su, Xiong Gao, Yi-Fan Zhang, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang, Hui Xiong, Philip S. Yu, Xuming Hu, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MSU(密歇根州立大学) UCAS(中国科学技术大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ErrorRadar通过错误检测任务评估多模态大语言模型在复杂数学推理中的能力,包含2500个高质量K-12数学问题,实验显示GPT-4o仍比人类评价差10%。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16972 2026-04-21 cs.AI 79%

MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models

MCPO:面向大推理模型的 mastery-consolidated 策略优化

Zhaokang Liao, Yingguo Gao, Yi Yang, Yongheng Hu, Jingting Ding

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出 MCPO 算法,通过引入 hinge-KL 正则化和优先机制,解决高准确度提示下的策略漂移和巩固问题,提升大模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16646 2026-04-21 cs.AI cs.SE 79%

Agentic Frameworks for Reasoning Tasks: An Empirical Study

代理框架用于推理任务:一项实证研究

Zeeshan Rasheed, Abdul Malik Sami, Muhammad Waseem, Kai-Kristian Kemell, Mika Saari, Pekka Abrahamsson

机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔塔大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过实证研究评估了22种代理框架在BBH、GSM8K和ARC三个推理基准上的表现,发现19种框架完成所有任务,其中12种性能稳定,但数学推理能力下降显著。

Comments 43 Pages, 3 Figures, and 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08983 2026-04-21 cs.CL 79%

SpiralThinker: Latent Reasoning through an Iterative Process with Text-Latent Interleaving

SpiralThinker: 通过文本-潜在交织的迭代过程进行潜在推理

Shengmin Piao, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 SpiralThinker通过文本-潜在交织的迭代过程实现稳定潜在推理,结合渐进对齐目标和结构化标注,提升推理稳定性与一致性,实现数学、逻辑和常识推理任务的SOTA性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18567 2026-04-21 cs.LG cs.AI cs.CL 75%

Latent Phase-Shift Rollback: Inference-Time Error Correction via Residual Stream Monitoring and KV-Cache Steering

潜在相位偏移回滚:通过残差流监控和KV-缓存引导进行推理时的误差校正

Manan Gupta, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus(比斯派恩大学,帕利尼校区)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LPSR方法,通过监控残差流和引导KV缓存来校正大语言模型中的推理错误,显著提升在MATH-500上的性能,同时在参数和token成本上更具优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18124 2026-04-21 cs.CL cs.AI 73%

TLoRA: Task-aware Low Rank Adaptation of Large Language Models

TLoRA:面向任务的大型语言模型低秩适应

Weicheng Lin, Yi Zhang, Jiawei Dang, Liang-Jie Zhang

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TLoRA通过联合优化初始化和资源分配,提升LoRA在不同任务中的性能,减少可训练参数数量。

Comments Accept to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16917 2026-04-21 cs.CL 70%

x1: Learning to Think Adaptively Across Languages and Cultures

x1: 在多种语言和文化中学习适应性思考

Yangfan Ye, Xiaocheng Feng, Xiachong Feng, Yichong Huang, Zekun Yuan, Lei Huang, Weitao Ma, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 x1通过在实例层面选择有利语言进行推理,提升多语言数学推理和文化相关任务的性能,挑战了单纯扩大模型规模的假设。

Comments Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17614 2026-04-21 cs.AI cs.CL cs.LG 67%

Characterizing Model-Native Skills

刻画模型内禀技能

Feiyang Kang, Mahavir Dabas, Myeongseob Ko, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出模型内禀技能的刻画方法,通过从序列激活中恢复紧凑正交基,实现行为变化轴的自组织,验证了在推理和安全对齐中的有效性,优于人类定义的技能。

Comments We argue that when the goal is to intervene on model behavior, skill characterization should be *model-native*: grounded in the model's own representations rather than imposed through external ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07084 2026-04-21 cs.LG cs.AI cs.CL 67%

Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

Countdown-Code:研究RLVR中奖励黑客现象涌现与泛化的测试平台

Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang

机构 * University of Michigan(密歇根大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Countdown-Code测试环境,通过分离代理奖励与真实奖励,研究LLM在监督微调中无意学习奖励黑客行为及其在强化学习中的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17695 2026-04-21 cs.LG cs.CL 62%

MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression

MoE-nD:多轴KV缓存压缩的分层专家路由

Libo Sun, Peixiong He, Po-Wei Harn, Xiao Qin

机构 * Department of Computer Science and Software Engineering, Auburn University, Auburn, AL, USA(计算机科学与软件工程系,阿伯拉罕大学,阿伯丁,阿拉巴马州,美国) Department of Information Management, National Central University, Taoyuan, Taiwan(信息管理系,国立中央大学,桃园,台湾)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MoE-nD方法,通过分层专家路由实现多轴KV缓存压缩,优化每层的缓存策略以提升模型性能,实验表明其在多个基准测试中表现优异。

Comments 9 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17290 2026-04-21 cs.CL cs.AI cs.PL 62%

Probabilistic Programs of Thought

思维概率程序

Poorva Garg, Renato Lui Geh, Daniel Israel, Todd Millstein, Kyle Richardson, Guy Van den Broeck

机构 * University of California Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(Allen人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14389 2026-04-21 cs.LG cs.AI 62%

From $\log π$ to $π$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17068 2026-04-21 cs.CL cs.LG 62%

Stability-Weighted Decoding for Diffusion Language Models

扩散语言模型的稳定性加权解码

Yue Wu, Jian Huang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location,Country) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location,Country) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong, China(数据科学与人工智能系,香港理工大学,香港,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出稳定性加权解码方法,通过引入时间稳定性提升扩散语言模型的生成准确性与鲁棒性,实验表明其在代码生成和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16935 2026-04-21 cs.AI cs.CY cs.HC cs.LG cs.SI 62%

LLMs can persuade only psychologically susceptible humans on societal issues, via trust in AI and emotional appeals, amid logical fallacies

LLMs只能通过信任AI和情感诉求说服心理上易受影响的人群在社会问题上的观点,尽管存在逻辑谬误

Alexis Carrillo, Salvatore Citraro, Ali Aghazhadeh Ardebili, Enrique Taietta, Giulio Rossetti, Emilio Ferrara, Giuseppe Alessandro Veltri, Massimo Stella

机构 * organization= CogNosco Lab, Department of Psychology Cognitive Science, University of Trento , city= Rovereto , country= Italy organization= Institute of Information Science Technologies ``Alessandro Faedo", National Research Council , country= Italy organization= Thomas Lord Department of Computer Science, University of Southern California , city= Los Angeles , state= California , country= USA organization= Department of Sociology Social Research, University of Trento , city= Trento , country= Italy organization= Centre for Behavioural Implementation Sciences in Medicine (BISI), National University of Singapore , city= Singapore , country= Singapore

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过Talk2AI框架研究LLM在时间演变的心理框架下对社会议题的说服力,发现人类对AI的可信度和情感诉求影响其观点变化,同时揭示了逻辑谬误在说服过程中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18206 2026-04-21 cs.AI 57%

A Control Architecture for Training-Free Memory Use

无训练记忆使用的控制架构

Yanzhen Lu, Muchen Jiang, Zhicheng Qian, Xingyu Zhou

机构 * Shanghai Qizhi Institute(上海启智研究所) Nanjing Whale Cloud(南京鲸云) Southeast University(东南大学) Xiamen University(厦门大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种无训练环境下记忆使用的控制方法,通过不确定性路由、置信度选择和记忆银行治理,提升推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14913 2026-04-21 cs.CL 57%

Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages

弥合文化鸿沟:一种基于LLM的数学应用题社会文化本地化的框架

Israel Abebe Azime, Tadesse Destaw Belay, Dietrich Klakow, Philipp Slusallek, Anshuman Chhabra

机构 * Saarland University(萨尔兰大学) Saarland Informatics Campus(萨尔兰信息技术校园) Instituto Politécnico Nacional(墨西哥理工学院) University of South Florida(佛罗里达州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的数学应用题社会文化本地化框架,通过自动构建包含本地名称、组织和货币的本地化数据集,缓解英语中心主义偏差并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16646 2026-04-21 cs.AI 57%

SMART: Self-Generating and Self-Validating Multi-Dimensional Assessment for LLMs' Mathematical Problem Solving

SMART: 自生成和自验证的多维评估用于LLM的数学问题解决

Yujie Hou, Mei Wang, Yaoyao Zhong, Ting Zhang, Xuetao Ma, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(北京市教育厅人工智能教育工程研究中心智能技术与教育应用联合实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SMART通过分解数学问题解决为四个维度,评估LLM的数学能力,揭示模型在不同维度上的差异,提出All-Pass Score衡量真实问题解决能力。

Comments Need to address additional data or methodological concerns

详情

展开后加载摘要…

URL PDF HTML 收藏