SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
Comments AI4MATH Workshop @ ICML 2024
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
Comments Project page: https://allenai.github.io/persona-bias. Paper to appear at ICLR 2024. Added results for other LLMs in v2 (similar findings)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
Comments Accepted to EMNLP2023 Findings
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
Comments EMNLP-23 (findings)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
Comments 7 pages
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
Comments Working in Progress
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
Comments 10 pages, 2 figures; to appear in 2nd MATH-AI Workshop at NeurIPS'22
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
Comments 12 pages; 5 figures
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
Comments ACL 2020
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
Comments 17 pages
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:1411.4823
具有可验证物理的强化学习:具有连续奖励的训练后语言模型
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。
语言模型的算术教学法
机构 * Bandung Fe Institute & Adjunct Science Fellow in InaAI(巴旦格Fe研究所及InaAI兼职科学研究员) ; AI Research Center IT Del & Bandung Fe Institute(IT Del人工智能研究中心及巴旦格Fe研究所)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 借鉴人类数学教学法,通过将GASING方法操作化为链式思维监督训练小规模GPT-2模型,使其在算术推理上达到高准确率并展现出联想式心算能力。
Comments 18 pages, 6 figures
SePO: 用于系统提示优化的自我进化提示智能体
机构 * National University of Singapore(新加坡国立大学) ; City University of Hong Kong(香港城市大学)
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SePO方法,通过自我指涉设计让提示智能体同时优化任务智能体和自身的系统提示,采用两阶段进化训练,在多个基准上平均准确率提升4.49%。
Comments 26 pages. Code: https://github.com/taowangcheng/SePO
在不完美验证器下基于可验证但含噪声奖励的强化学习
机构 * RIKEN AIP(日本理化学研究所AIP) ; The University of Tokyo(东京大学) ; The University of Melbourne(墨尔本大学) ; The University of Sydney(悉尼大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 针对不完美验证器引入的假阴性和假阳性噪声,提出后向校正(无偏奖励)和前向校正(梯度方向对齐)两种轻量级方法,在分组相对策略优化中提升数学推理性能,并设计上诉机制在线估计假阴性率。
模式键作为在受限解码下的指令通道在结构生成中的应用
机构 * Zhejiang University(浙江大学)
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了在受限解码中模式键作为隐式指令通道的作用,提出结构生成是多通道指令问题,并通过实验展示模式键词汇对准确性的影响,揭示了不同模型对不同通道的依赖性。
Comments 11 pages, 3 figures
DeepPrune: 无需跨轨迹冗余的并行扩展
机构 * Tsinghua University(清华大学) ; ShanghaiTech University(上海科技大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出DeepPrune框架,通过动态剪枝解决并行推理中的冗余问题,实现65.73%-88.50%的token减少,保持高精度。
Comments Accepted by ACL 2026 Findings, please check out the project page: https://deepprune.github.io/
深入探究用于表格理解的大型语言模型
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过研究16种LLM,探讨其理解表格数据和执行下游任务的机制,发现注意力动态、有效层数、专家激活及输入设计影响显著。
并非所有标记都必要(NAT):标记效率强化学习
机构 * LinkedIn Corporation(LinkedIn公司)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 NAT通过局部标记采样提升RL效率,使用50%标记实现与完整标记相同性能。
无幻觉的自动问答生成用于直观学习
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出无幻觉的多代理生成框架,通过结构化协作减少教育内容中的幻觉,提升问答生成的准确性与教育价值。
在Atlas A2上对OpenPangu模型进行训练后量化以实现高效部署
机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 本文提出在Atlas A2上通过低比特量化提升OpenPangu模型的推理效率,实现高效CoT推理并保持高精度。
向上爬,记忆下降:低成本微调与侧边网络
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG
AI总结 LST通过轻量级侧边网络实现高效微调,比QLoRA更节省内存,同时在多个任务中保持竞争力。