arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44946 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2606.26917 2026-06-26 cs.LG cs.AI 新提交 62%

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

GEOALIGN: 用于鲁棒大语言模型强化学习的几何轨迹策展

Ting Zhou, Zhenqing Ling, Yiyang Zhao, Ying Shen, Daoyuan Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对在线强化学习训练LLM时奖励噪声导致的不稳定性,提出GEOALIGN,通过检测并修正方向不一致的轨迹来稳定更新,提升最终性能并减少训练震荡。

Comments Accepted as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26472 2026-06-26 cs.LG cs.CL 新提交 62%

Epiphany-Aware KV Cache Eviction Without the Attention Matrix

无需注意力矩阵的顿悟感知KV缓存淘汰

Steven Kolawole, Virginia Smith

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学) Machine Learning Department Carnegie Mellon University(机器学习系卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出EpiKV方法,通过模型内部表示变化(顿悟分数)而非注意力权重来淘汰KV缓存,无需训练或自定义内核,支持FlashAttention,在MATH-500上达到72%准确率,速度提升2.8倍。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24994 2026-06-25 cs.LG cs.AI 新提交 62%

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

ExTra: 面向语言模型强化学习的探索性轨迹优化

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) SAP

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ExTra框架,通过新颖性奖励和熵引导前缀再生增强GRPO,在数学推理基准上提升pass@1约5%、pass@16约7%。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03070 2026-06-24 cs.LG cs.AI 版本更新 62%

ASymPO: Asymmetric-Scale Policy Optimization for Asynchronous LLM Post-Training Without Behavior Information

ASymPO: 用于异步大语言模型后训练的非对称尺度策略优化(无需行为信息)

Zehua Liu, Yuxuan Yao, Xiaojin Fu, Tao Zhong, Mingxuan Yuan

机构 * Huawei Technologies(华为技术)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对异步强化学习中陈旧响应导致的分布漂移问题,提出非对称尺度策略优化(ASymPO),通过归一化每个响应的令牌损失来恢复零和平衡,无需行为策略概率。

Comments incorrect proofs in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23567 2026-06-23 cs.LG cs.AI 新提交 62%

Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

调度思维:在扩散语言模型中学习思维的顺序

Jiawei Xu, Minghui Liu, Aakriti Agrawal, Yifan Chen, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出自感知调度(SAS),通过策略优化学习扩散语言模型中的去掩码顺序,显著提升Sudoku和数学推理任务的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23104 2026-06-23 cs.LG cs.AI 新提交 62%

ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

Chen Lin, Kedi Chen, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ReNIO方法,通过学生-教师概率比识别错误推理轨迹中的关键令牌并加权,在不依赖最终答案正确性的情况下提升在线策略蒸馏效果,在数学推理和代码生成任务上取得显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06021 2026-06-23 cs.LG cs.AI 版本更新 62%

OPRD: On-Policy Representation Distillation

OPRD: 在线策略表示蒸馏

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Haobo Wang, Mingxuan Xia, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Junbo Zhao, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对在线策略蒸馏中输出空间监督的采样方差和忽略中间隐藏状态的问题,提出OPRD方法,通过在隐藏状态空间对齐师生表示,消除采样方差、提供更丰富的逐层结构信息,并在AIME等基准上缩小师生差距,训练速度提升1.44倍,内存减少54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21166 2026-06-23 cs.LG cs.AI 版本更新 62%

The Ratchet Effect in Silico: How Interaction Drives Cumulative Intelligence in Large Language Models

通过交互驱动的累积智能在大语言模型中实现的“棘轮效应

Ren Zhuang

机构 * School of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出POLIS框架,通过异质智能体之间的交互实现知识积累,展示出在数学推理任务中,群体模型的性能提升显著。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05520 2026-06-23 cs.LG cs.CL 版本更新 62%

Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

通过自适应课程学习的高效强化微调

Taiwei Shi, Yiyang Wu, Linxin Song, Tianyi Zhou, Jieyu Zhao

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出AdaRFT方法,通过自适应课程学习动态调整训练问题难度,提升强化微调效率,在数学推理任务上训练时间减半。

Comments Published in Transactions on Machine Learning Research (TMLR). 30 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16312 2026-06-23 cs.AI cs.CL 版本更新 62%

EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning

EquivPruner:通过动作剪枝提升基于LLM的搜索效率与质量

Jiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM搜索中语义等价步骤导致的大量冗余消耗,提出EquivPruner方法,通过剪枝等价动作提升效率,并创建数学等价数据集MathEquiv训练轻量检测器,在多种任务中显著减少token消耗并提高准确性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18910 2026-06-18 cs.LG cs.CL 新提交 62%

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

REVES:通过修订与验证增强的测试时扩展训练

Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

机构 * Northwestern University(西北大学) Amazon AGI(亚马逊人工智能实验室) Qualcomm AI Research(高通人工智能研究) University of Minnesota(明尼苏达大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出REVES框架,通过将中间步骤的“接近正确”答案转化为解耦的修订和验证提示,实现高效的离策略数据生成,提升大语言模型的多步推理能力,在LiveCodeBench上比强化学习基线高6.5分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01249 2026-06-18 cs.LG cs.CL 版本更新 62%

Trust Region On-Policy Distillation

信任区域在线策略蒸馏

Xingrun Xing, Haoqing Wang, Boyan Gao, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) University of Oxford(牛津大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出信任区域在线策略蒸馏(TrOPD),通过信用分配策略和信任区域学习解决师生分布差异导致的训练不稳定问题,在数学推理、代码生成和通用基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12347 2026-06-18 cs.CL cs.AI cs.CY 62%

Assessment of Evolving Large Language Models in Upper Secondary Mathematics

对上中学数学中演进式大语言模型的评估

Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

机构 * Faculty of Information Technology(信息科技学院) University of Jyväskylä(于韦斯屈莱大学) Faculty of Humanities and Social Sciences(人文与社会科学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了不同大语言模型在芬兰毕业考试中的数学能力,发现随着模型演进,其表现显著提升,部分模型接近完美,展示了LLM在数学能力上的快速进步及其在教育中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17199 2026-06-17 cs.LG cs.AI 新提交 62%

PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

PowerOPD:利用有界幂变换稳定在线策略蒸馏

Anhao Zhao, Junlong Tong, Yingqi Fan, Ping Nie, Wenjie Li, Xiaoyu Shen

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) University of Waterloo(滑铁卢大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对在线策略蒸馏中log-ratio奖励无界导致训练不稳定问题,提出基于Box-Cox幂变换的有界、符号一致奖励族PowerOPD,在数学推理任务上平均提升Avg@8/Pass@8达+6.37/+5.71,并降低59.2%时间与23.1%显存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 62%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 数学推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14672 2026-06-15 cs.AI cs.CL 新提交 62%

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

面向LLM-Agent工作流中并行分支的直接潜在空间合成

Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Parallel-Synthesis框架,通过直接利用并行工作代理的KV缓存进行合成,避免文本拼接冗余,在9个数据集上匹配或超越文本合成,并将首令牌延迟降低2.5-11倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13680 2026-06-12 cs.CL cs.AI 新提交 62%

Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

通过检索增强强化微调进行类比推理学习

Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez

机构 * Meta Superintelligence Labs(Meta超级智能实验室) Rice University(莱斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出RA-RFT框架,通过黄金相关性蒸馏训练检索器,并结合强化微调利用类比推理轨迹,提升数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10402 2026-06-10 cs.CL cs.AI 新提交 62%

Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries

利用野外AI代理的集体智慧实现新发现

Federico Bianchi, Yongchan Kwon, Aneesh Pappu, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出EinsteinArena平台,通过开放分布式环境中的自主代理交互,在数学问题中实现12项新最优结果,展示了集体AI驱动研究的范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10369 2026-06-10 cs.CL cs.LG 新提交 62%

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

PADD: 面向非路由器教师指导MoE学生学习的路径对齐解压缩蒸馏

Xinyue Peng, Yi Qian, Jiaojiao Lin, Wenjian Shao, Yanming Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出路径对齐解压缩蒸馏(PADD)框架,通过四阶段两阶段流程将密集教师知识蒸馏到混合专家(MoE)学生中,同时学习高质量路由策略,在数学推理任务上显著优于基线。

Comments published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10296 2026-06-10 cs.CL cs.AI 新提交 62%

The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

自信的撒谎者:利用对数概率和LLM作为评判诊断多智能体辩论

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer

机构 * University of California, Irvine(加州大学伊文斯分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究多智能体辩论中令牌级对数概率、LLM评判分数与任务准确性的关系,发现信心与推理质量在构造者上关联更强,且信心可检测关键推理失败。

Comments 15 pages, 7 figures, 1 table, ACL proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08346 2026-06-09 cs.CL cs.LG 新提交 62%

CATPO: Critique-Augmented Tree Policy Optimization

CATPO: 批评增强的树策略优化

Ayush Singh, Umang Goyal, Ankur Dahiya

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Vision and Language Group(视觉与语言组)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出CATPO方法,通过树信息性评分和批评引导修复,解决树结构强化学习中低效树浪费计算的问题,在数学推理任务上提升准确率。

Comments 14 pages, 1 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21522 2026-06-09 cs.LG cond-mat.dis-nn cs.AI stat.ML 版本更新 62%

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

更高效利用预算:使用重置与丢弃(ReD)方法在固定预算下提升大型语言模型的推理性能

Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

机构 * School of Chemistry, Tel Aviv University(特拉维夫大学化学系) The Center for Physics and Chemistry of Living Systems, Tel Aviv University(特拉维夫大学生命系统物理与化学中心) School of Physics and Astronomy, Tel Aviv University(特拉维夫大学物理与天文学系) The Center for Computational Molecular and Materials Science, Tel Aviv University(特拉维夫大学计算分子与材料科学中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对固定预算下大型语言模型推理的收益递减问题,提出重置与丢弃(ReD)查询方法,通过优化尝试分配提升覆盖率,并在编码、数学和推理基准上验证了其成本节约效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06052 2026-06-09 cs.AI cs.CL 版本更新 62%

MixReasoning: Switching Modes to Think

MixReasoning: 切换模式以思考

Haiquan Lu, Gongfan Fang, Xinyin Ma, Qi Li, Xinchao Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MixReasoning框架,动态调整推理深度,对困难步骤详细推理、简单步骤简洁推理,在GSM8K、MATH-500和AIME上缩短推理长度并提高效率,不牺牲准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00322 2026-06-09 cs.CL cs.AI cs.SE 版本更新 62%

Failure by Interference: Language Models Make Balanced Parentheses Errors When Faulty Mechanisms Overshadow Sound Ones

干扰导致的失败:当有缺陷机制掩盖健全机制时,语言模型在平衡括号任务中出错

Daking Rai, Samuel Miller, Kevin Moran, Ziyu Yao

机构 * George Mason University(乔治·马歇尔大学) University of Central Florida(中央佛罗里达大学) Department of Computer Science(计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型在平衡括号任务中出错的原因:部分组件实现可靠机制,而其他组件引入噪声,当噪声机制主导时导致错误。提出RASteer方法,通过增强可靠组件贡献,将部分模型准确率从0%提升至近100%,并在算术推理任务中取得约20%的性能提升。

Comments 23 pages, 10 figures, accepted for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05606 2026-06-05 cs.LG cs.AI math.OC 62%

Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

跨时代自适应展开优化用于强化学习后训练

Yiming Zong, Yige Wang, Jiashuo Jiang

机构 * Department of Industrial Engineering & Decision Analytics, Hong Kong University of Science and Technology(工业工程与决策分析系,香港科学与技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对提示词训练信号差异大的问题,提出CERO方法,通过贝叶斯估计提示词成功概率并利用Fenchel对偶优化自适应分配展开预算,在固定总预算下提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05434 2026-06-05 cs.LG cs.AI 62%

Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

选择性优势熵自适应视野GRPO:用于语言模型高效强化学习的非对称令牌级折扣

Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya

机构 * Indian Institute of Technology (BHU)(印度理工学院(博生胡大学)) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性优势熵自适应视野GRPO(SA-AH-GRPO),通过非对称令牌级折扣(仅对负优势轨迹应用熵基折扣)来稳定训练并提升数学推理性能。

Comments 16 pages, 4 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25582 2026-06-05 cs.LG cs.AI 62%

Extreme Region Policy Distillation

极端区域策略蒸馏

Changyu Chen, Xiting Wang, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出极端区域策略蒸馏(ERPD)两阶段框架,通过解耦样本效率与KL效率,在固定数据上先进行弱约束离策略优化以最大化提取训练信号,再在信任区域约束下蒸馏到基础策略,从而在数学推理任务中实现更好的性能与更小的KL散度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19327 2026-06-05 cs.LG cs.AI 62%

Soft Sequence Policy Optimization

软序列策略优化

Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软序列策略优化方法,通过引入软门控函数改进序列级重要性权重,提升大语言模型对齐任务的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10823 2026-06-05 cs.CL cs.AI 62%

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

CLASH:从多个视角评估语言模型在高风险困境中的判断

Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Philosophy(哲学系) University of Michigan Ann Arbor(安娜堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CLASH数据集,用于研究基于价值观的决策过程,发现语言模型在处理矛盾决策、心理不适和价值观变化时存在显著不足。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04535 2026-06-04 cs.CL cs.AI 62%

Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models

扩散大语言模型中用于格式约束生成的动态填充锚点

Boyan Han, Yiwei Wang, Yi Song, Yujun Cai, Chi Zhang

机构 * AGI Lab, Westlake University, China(西溪大学AGI实验室,中国) University of California, Merced, USA(加州大学梅尔德分校,美国) Teeni AI, China(Teeni AI,中国) The University of Queensland, Australia(昆士兰大学,澳大利亚)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出动态填充锚点(DIA),一种无需训练的方法,通过动态估计结束锚点位置调整生成长度,确保格式约束下的结构正确性和语义连贯性,在GSM8K和MATH上实现零样本性能提升。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏