Discrete Adjoint Matching
离散共轭匹配
机构 * Massachusetts Institute of Technology(麻省理工学院) ; FAIR at Meta(Meta 的 FAIR)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。
Comments ICLR 2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
离散共轭匹配
机构 * Massachusetts Institute of Technology(麻省理工学院) ; FAIR at Meta(Meta 的 FAIR)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。
Comments ICLR 2026
数学与人工智能:连接数学与AI的综述
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文综述了AI在数学研究中的应用,探讨了AI通过提供灵活框架和归纳推理能力,如何支持数学研究,并促进数学与AI的跨学科理解。
Comments This article is withdrawn due to internal authorship and supervisory considerations that require clarification before the work can proceed in its current form. After further review, I believe it is appropriate to pause and formally resolve these matters to ensure full compliance with institutional and collaborative research policies
$\mathcal{X}$-KD:用于大型语言模型的通用经验知识蒸馏
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出$\mathcal{X}$-KD,通过模拟教师的原始学习环境,提升大型语言模型的蒸馏效果,优于现有基线方法。
温度作为元策略:LLM强化学习中的自适应温度
机构 * Tsinghua University(清华大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 TAMPO通过将温度控制转化为可学习的元策略,实现了LLM强化学习中的自适应探索,优于固定或启发式温度方法。
Comments Accepted at ICLR 2026. 10 pages (main text) + supplementary material, 6 figures
超越参数运算:用于分布感知模型融合的稀疏互补融合
机构 * Beijing Qiyuan Technology Co., Ltd.(北京启元科技有限公司) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出SCF-RKL方法,通过稀疏、分布感知的更新控制功能干扰,提升模型融合的稳定性与泛化能力。
通过文本反馈扩展强化学习的能力
机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) ; School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出通过文本反馈改进强化学习的方法,通过自我蒸馏和反馈建模在推理、数学和写作任务中超越基线性能。
Comments 43 pages, 6 figures
揭示混合专家大语言模型中的超级专家
机构 * Tsinghua University(清华大学) ; Meituan(美团) ; Xiamen University(厦门大学) ; Nanjing University(南京大学) ; The University of Hong Kong(香港大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 研究揭示了混合专家大语言模型中起关键作用的超级专家,通过分析其影响发现其在数学推理中的重要性,并探讨了压缩这些专家对模型性能的显著影响。
Comments Published as a conference paper at ICLR 2026
ReForm:具有前瞻性有界序列优化的反思自动形式化
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; Zhejiang University(浙江大学) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 ReForm通过整合语义一致性评估和前瞻性有界序列优化,提升自动形式化任务的准确性和语义保真度,实验表明其在四个基准上的性能提升了22.6个百分点。
Comments Camera Ready version for ICLR 2026. Code: https://github.com/Chen-GX/ReForm
一分钟内交易!基于理性驱动的量化金融交易代理系统
机构 * Tongji University(同济大学) ; Microsoft Research Asia(微软亚洲研究院) ; University of Bristol(布里斯托大学) ; Fudan University(复旦大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 TiMi是一种基于理性驱动的多代理系统,通过解耦策略开发与分钟级部署,实现量化金融交易的高效稳定盈利。
Comments 17 pages, 6 figures
QUATRO:用于LLM微调的查询自适应信任区域策略优化
机构 * Seoul National University(首尔国立大学) ; Ewha Woman University(成均馆大学) ; Geogia Institute of Technology(佐治亚理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 QUATRO通过原则性优化直接施加信任区域约束,实现稳定且可控的LLM微调,提升训练稳定性与熵控制。
判断我们无法解决的内容:一种基于后果的方法用于无Oracle评估研究级数学
机构 * snu(首尔国立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出基于后果的无Oracle评估方法,用于评估研究级数学问题的求解质量,通过测试候选方案在相关问题中的表现,有效提升评估准确性。
Comments Preprint
长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化
机构 * Meituan(美团)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。
对大型语言模型诊断学生手写数学作业认知技能的基准测试
机构 * School of Computing, KAIST, Daejeon, Republic of Korea(韩国庆熙大学计算机学院) ; University of Michigan, Ann Arbor, USA(美国密歇根大学) ; Ewha Womans University, Seoul, Republic of Korea(韩国成均馆大学) ; AlgorithmLabs, Seoul, Republic of Korea(韩国AlgorithmLabs公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文评估了18种大型语言模型在诊断学生手写数学作业认知技能时的表现,发现模型在模糊证据下表现不佳,揭示了模型在证据处理上的系统性问题。
ConvexBench: LLMs能否识别凸函数?
机构 * UC Santa Barbara(加州大学圣芭芭拉分校) ; University of Pennsylvania(宾夕法尼亚大学) ; UC San Diego(加州大学圣地亚哥分校) ; The Ohio State University(俄亥俄州立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 ConvexBench通过分治框架解决LLM在深度函数组合中识别凸性的挑战,显著提升大深度下的性能。
通过可验证的多选改写扩展RLVR以应对开放性任务
机构 * Baidu Ernie Team(百度文心团队)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出VMR-RLVR方法,通过将开放性任务数据转化为可验证的多选格式,提升LLM在无明确真实值情况下开放性任务的推理能力。
Comments 8 pages
ReMiT: 通过强化学习指导的迭代大语言模型进化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 ReMiT通过强化学习指导中训练过程,实现大语言模型的迭代进化,提升模型在数学、代码和推理任务上的表现。
Comments 25 pages
TMS:轨迹混合监督用于无奖励、在线策略微调
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 TMS通过轨迹混合监督在无奖励的情况下提升大语言模型的保留能力,有效弥补了传统SFT与RL之间的差距。
单个标记回滚:通过策略梯度引导大语言模型的监督微调
机构 * The Chinese University of Hong Kong(香港中文大学) ; Noah’s Ark Lab, Huawei(华为诺亚实验室) ; ChatEDA Tech(ChatEDA技术公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 通过策略梯度引导监督微调,单个标记回滚(OTR)在多个基准测试中优于标准SFT,展示了on-policy数据对泛化能力的重要性。
为何GRPO需要规范化:从局部曲率角度探讨自适应梯度
机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) ; Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) ; Department of Informatics, King's College London(伦敦国王学院信息学系) ; Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。
InstructDiff:通过微分熵实现领域自适应的数据选择以实现高效的LLM微调
机构 * Peking University(北京大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Tsinghua University(清华大学) ; SUFE(上海财经大学) ; SUSTech(南方科技大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 InstructDiff通过微分熵实现领域自适应的数据选择,提升LLM微调效率,实验显示在数学推理和通用指令遵循任务上分别提高17%和52%。
从格式和长度获取代理信号:用于无真实答案解决数学问题的强化学习
机构 * Baichuan Inc(百川公司) ; Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出利用格式和长度作为代理信号,通过强化学习提升数学问题解决性能,无需真实答案,实现高效推理优化。
通过多智能体辩论进行语言模型的自改进
机构 * Meta AI ; Columbia University(哥伦比亚大学) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。
为提示付费,而非答案:用于高效推断的LLM牧师
机构 * Department of Computer Science, University of Victoria, Victoria, Canada(维多利亚大学计算机科学系) ; Department Of Information Technology, Manipal University, Manipal, India(马那尔大学信息科技系)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 LLM牧师通过请求LLM的短提示来提高SLM的准确性,显著降低推断成本,同时保持准确性。
AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量
专题命中 数学推理 :verifier(abstract);分类 cs.AI
AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。
从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习
机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) ; City University of Hong Kong(香港城市大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。
Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026
也许的艺术:一种用于VLMs不确定性基准测试的共形透镜
机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) ; Qatar Computing Research Institute(卡塔尔计算研究所)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种用于VLMs不确定性基准测试的共形透镜,评估了18种最先进的VLMs在6个多元数据集上的表现,发现更大模型在不确定性量化方面表现更佳,而数学和推理任务则表现出较差的不确定性性能。
SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器
机构 * UCSD(加州大学圣地亚哥分校) ; UVA(弗吉尼亚大学) ; UIUC(伊利诺伊大学香槟分校) ; JHU(约翰·霍普金斯大学) ; Purdue(Purdue 大学) ; PolyU ; USC(美国南加州大学) ; UMich(密歇根大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。
PRISM: 一种无需可验证奖励的统一后训练LLM框架
机构 * Arizona State University(亚利桑那州立大学) ; Amazon Web Services(亚马逊网络服务)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 PRISM通过结合过程奖励模型与自我确定性,实现无需真实标签的稳定训练和提升LLM测试性能。
Comments Added open-sourced github url
错误笔记本学习:用于无训练代理适应的批量聚类失败
机构 * Bairong Inc.(柏龙公司) ; School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) ; School of Software, Jilin University(吉林大学软件学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 MNL通过批量聚类失败提炼结构化错误笔记,提升代理适应性和鲁棒性,无需参数更新。
在计算不透明时代中的先验知识:人工智能在数学发现中的作用
机构 * Purdue University(普渡大学) ; Argonne National Laboratory(阿贡国家实验室) ; University of Chicago(芝加哥大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨了在计算不透明时代,通过AI获取数学先验知识的挑战与可能方法,强调证明检查器在其中的关键作用。