Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 25 pages, 3 figures
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 28 pages; v2: added Gemini Pro results, error analysis, and a discussion on confabulation; v3: see its extended version, an EMNLP 2024 paper, at https://aclanthology.org/2024.emnlp-main.740/
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments WData and Models will be released at https://github.com/ZrrSkywalker/MAVIS
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Camera-ready version for NeurIPS 2024
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2024 Main Conference
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Homepage: https://gair-nlp.github.io/ReAlign/
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 14 pages, 4 figures, 3 tables
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments add more evaluations on instruction following
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 7 pages
DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型
专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub
Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model
大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 数学推理 :reasoning(abstract,comments);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。
Comments Published at the COLM 2026 Workshop on Efficient Reasoning
基于LLM驱动知识图谱推理生成逻辑一致的合成供应链数据
机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 数学推理 :reasoning(title);分类 cs.CL
AI总结 针对合成供应链数据需保持操作逻辑一致性的问题,提出TabKG框架,通过构建列关系知识图谱并利用多LLM集成验证关系,结合潜在扩散模型生成逻辑一致的表格数据。
LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式
机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)
专题命中 数学推理 :reasoning(title);分类 cs.AI
AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。
Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench
FrontierMath: 一个评估人工智能高级数学推理能力的基准
机构 * Epoch AI ; University of Leicester(利兹大学) ; RWTH Aachen University(亚琛工业大学) ; King’s College London(伦敦大学国王学院) ; University of Bristol(布里斯托大学) ; Iowa State University(爱荷华州立大学) ; MIT(麻省理工学院) ; University of North Carolina(北卡罗来纳大学) ; CNRS - Université Paris-Saclay(法国国家科学研究中心-巴黎-萨克雷大学) ; University of Siegen(锡根大学) ; Knox College at Charlotte(夏洛特克恩学院) ; James Madison University(詹姆斯麦迪逊大学) ; ICMC, USP(巴西圣保罗大学ICMC分校) ; Masaryk University(马萨里克大学) ; UC Berkeley(伯克利加州大学) ; Cornell University(康奈尔大学) ; Rutgers University(罗格斯大学) ; Harvard University(哈佛大学) ; ETH Zurich(苏黎世联邦理工学院) ; Independent(独立研究者)
专题命中 数学推理 :reasoning(title);分类 cs.AI
AI总结 FrontierMath是一个由专家数学家设计的数学问题基准,用于评估AI在高级数学推理能力上的表现,揭示了当前AI与数学界能力之间的显著差距。
机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) ; INSAIT, Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·欧里斯基"学院)
专题命中 数学推理 :reasoning(title);分类 cs.AI
专题命中 数学推理 :reasoning(title);分类 cs.CL
机构 * McGill University(麦吉尔大学)
专题命中 数学推理 :reasoning(title);分类 cs.AI
Comments 8 pages, 2 figures, accepted by AIED conference
专题命中 数学推理 :reasoning(title);分类 cs.CL
Comments AAAI 2025 (7 pages)
专题命中 数学推理 :reasoning(title);分类 cs.AI
Comments 29 pages, 3 figures. Some minor additions/clarifications in this revision, e.g. mathematical description
专题命中 数学推理 :planning(title);分类 cs.AI
解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国学院) ; Technical University of Munich(慕尼黑工业大学) ; MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。
基于强化学习的知识蒸馏与大语言模型作为评判者
机构 * University of Iowa(爱荷华大学)
专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于强化学习的知识蒸馏方法,利用大语言模型作为评判者在无标签数据上生成奖励,实现无需真实标签的蒸馏,提升数学推理基准性能。
混合策略蒸馏用于大语言模型
机构 * Department of Computer Science(计算机科学系) ; Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) ; Shanghai Innovation Institute(上海创新研究院) ; Large Language Department, Tencent(腾讯大语言部门)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。
Comments ICML 2026
先给出答案,后进行推理:扩散大语言模型中的承诺顺序
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本研究发现扩散大语言模型(dLLMs)的任意顺序提交机制会导致推理失败,通过前沿门控承诺干预可恢复推理性能,同时保留并行解码优势。
Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。
Comments 7 pages, comments welcome!
SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) ; International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。