OptiMind: Teaching LLMs to Think Like Optimization Experts
OptiMind: 教授大语言模型像优化专家一样思考
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 OptiMind通过整合优化专业知识,提升大语言模型在混合整数线性规划中的公式准确性,实现20.7%的提升。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
OptiMind: 教授大语言模型像优化专家一样思考
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 OptiMind通过整合优化专业知识,提升大语言模型在混合整数线性规划中的公式准确性,实现20.7%的提升。
ICPO:内在置信度驱动的群体相对偏好优化用于高效强化学习
机构 * MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 ICPO通过内在置信度驱动的群体相对偏好优化,提升大型语言模型的推理能力,有效解决粗粒度奖励和奖励噪声问题,增强高质量响应的相对优势。
置信二元性:分析和缓解工具使用代理中的校准偏差
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。
协调标记与序列:动态混合策略优化用于RLVR
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。
基于数学知识图谱的方程驱动框架用于基于方程的预测和可靠的增材制造
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出基于数学知识图谱的框架,结合大语言模型与增材制造知识图谱,实现可靠的知识提取和外推建模,提升预测的准确性和物理一致性。
Comments preprint
基于大语言模型的量化SMT求解与不可解释函数
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 AquaForte利用大语言模型提供语义指导,通过生成满足约束条件的函数定义实例化候选,显著减少SMT求解的搜索空间和复杂性,有效解决传统求解器超时的实例。
ETR: 以结果为导向的弹性信任区域用于策略优化
机构 * Alibaba Group(阿里巴巴集团) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。
MMFormalizer: 多模态自动形式化
机构 * The University of Hong Kong(香港大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; University of Edinburgh(爱丁堡大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Ohio State University(俄亥俄州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 MMFormalizer通过整合适应性定位与现实世界数学物理领域实体,实现多模态自动形式化,首次处理经典力学、相对论、量子力学和热力学等复杂领域。
Comments Technical Report
LoRA-Drop:用于高效LLM推理的时序LoRA解码
机构 * University of Waterloo(滑铁卢大学) ; University of Toronto(多伦多大学) ; Queen’s University(皇后大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 LoRA-Drop通过时序计算计划和低秩LoRA校正,实现高效LLM推理,提升解码速度2.6倍并减少45-55%的KV缓存占用。
苏格拉底学生:教语言模型通过提问学习
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Meta
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ODQS框架,通过任务结果训练语言模型提问技能,提升交互推理的准确性和效率。
反事实自问法用于语言模型中的稳定策略优化
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 反事实自问法通过内部生成的监督提升语言模型的推理准确性和训练稳定性,实现自我改进。
提问、澄清、优化:人类-大语言模型代理协作以实现更智能的库存控制
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出混合代理框架,利用LLM作为智能接口,通过分离语义推理与数学计算,降低库存成本32.1%,证明LLM作为自然语言接口使优化策略更易被非专家使用。
多令牌分歧:测量和引导上下文计算密度
机构 * The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI) ; King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 多令牌分歧通过测量语言模型的计算努力,提供了一种轻量级工具,用于分析和引导生成文本的计算动态。
MDToC:元认知动态概念树用于提升大语言模型的数学问题解决能力
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) ; National Economics University(国家经济大学) ; VNPT AI
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 MDToC通过构建概念树和多数投票机制,提升大语言模型在数学问题解决中的准确性与验证能力。
通过验证中的稀疏计算加速推测解码
机构 * Key Laboratory of Data Intelligence and Advanced Computing, Soochow University(数据智能与先进计算 key laboratory,苏州大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种稀疏验证框架,通过联合稀疏化注意力、FFN和MoE组件,减少验证阶段的计算成本,并结合检索重用策略提升效率-准确性平衡。
Comments Pre-print
大规模数学探索与发现
机构 * Google DeepMind(谷歌DeepMind) ; Department of Mathematics, Brown University(布朗大学数学系) ; Institute for Advanced Study(高级研究院) ; UCLA Department of Mathematics(加州大学洛杉矶分校数学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率
Comments 81 pages, 35 figures
AndesVL 技术报告:一种高效的移动端多模态大语言模型
机构 * AndesVL Team(AndesVL团队) ; OPPO AI Center(OPPO人工智能中心)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。
Comments Tech report of OPPO AndesVL Team
Solver-Informed RL: 为真实优化建模奠定大语言模型基础
机构 * Cardinal Operations, China(中国卡迪纳尔运营公司) ; Shanghai University of Finance and Economics(上海财经大学) ; The University of Hong Kong(香港大学) ; Antai School of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) ; Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 SIRL通过强化学习与外部优化求解器结合,提升大语言模型在优化建模中的准确性与实用性。
Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
JustRL: 通过简单强化学习方法扩展1.5B语言模型
机构 * Tsinghua University(清华大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 JustRL通过简单强化学习方法在1.5B语言模型上实现高性能,省去复杂训练流程,展现稳定训练效果。
Comments 12 pages, 3 figures
VERAFI:通过神经符号策略生成实现验证的代理金融智能
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。
通过强化学习增强放射学报告生成和视觉基础识别
机构 * University of Zurich(苏黎世大学) ; ETH Zurich(苏黎世联邦理工学院) ; Zurich University of Applied Sciences(苏黎世应用科学大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过强化学习和思考机制提升放射学报告生成和视觉基础识别的性能,展示了在医学VLMs中RL作为SFT的有效补充。
Comments 10 pages main text (3 figures, 3 tables), 31 pages in total
精益求精:基于大语言模型的代理的自动化优化
机构 * University of Leeds(利兹大学) ; City, University of London(伦敦城市大学) ; University of West London(西伦敦大学) ; University of Edinburgh(爱丁堡大学) ; University of Surrey(萨里大学) ; University of Warwick(沃里克大学) ; King's College London(伦敦国王学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 ARTEMIS通过语义感知的进化算法,自动优化基于大语言模型的代理配置,显著提升多个任务的性能表现。
大规模物理模型:迈向与大规模语言模型和基础模型的协作方法
机构 * CLPS - Centre for Logic and Philosophy of Science(逻辑与哲学科学中心) ; UGent(根特大学) ; IMAPP, Radboud University and Nikhef(IMAPP、拉德堡德大学和荷兰皇家科学院) ; Utrecht University(乌特勒支大学) ; Institute for Science in Society, Radboud University(社会科学研究院,拉德堡德大学) ; Instituto de Física Corpuscular (IFIC), CSIC-UV, Spain(Corpuscular 物理研究所(IFIC),CSIC-UV,西班牙) ; University of Twente(代尔夫特理工大学) ; TU Dresden & ScaDS.AI(德累斯顿技术大学及ScaDS.AI) ; ErUM-Data-Hub & TU Dortmund University(ErUM-Data-Hub及多特蒙德技术大学) ; Computing and Information Science, Radboud University(计算与信息科学,拉德堡德大学) ; TU Wien(维也纳技术大学) ; Thapar Institute of Engineering & Technology (TIET), Patiala, India(泰帕尔工程与技术学院(TIET),帕蒂亚,印度) ; Universität Hamburg(汉堡大学) ; Institute of Philosophy, University of Leiden(哲学研究所,莱顿大学) ; RWTH Aachen University(亚琛工业大学) ; University of Geneva(日内瓦大学) ; Munich Center for Mathematical Philosophy, LMU Munich(慕尼黑数学哲学中心,慕尼黑大学) ; Institute of Physics of Cantabria (IFCA), CSIC-UC, Spain(坎塔布里亚物理研究所(IFCA),CSIC-UC,西班牙) ; Radboud University(拉德堡德大学) ; Ippen Digital, Germany(Ippen 数字,德国) ; Universidad de Oviedo and ICTEA, Spain(奥维多大学及ICTEA,西班牙) ; CLPS - Centre for Logic and Philosophy of Science, UGent(逻辑与哲学科学中心) ; GRAPPA, Institute of Physics, University of Amsterdam(GRAPPA,物理研究所,阿姆斯特丹大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出通过跨学科协作开发大规模物理模型,旨在解决物理研究中的特定需求。
Journal ref Eur. Phys. J. C 85, 1066 (2025)
学习 deliberation:基于多智能体强化学习的元策略协作用于代理语言模型
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出元策略推理框架MPDF,结合SoftRankPO算法,通过学习动态推理策略提升多智能体LLM在复杂推理任务中的性能。
双曲大语言模型
机构 * Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院) ; Department of Biomedical Informatics, Stony Brook University(生物医学信息学系,石溪大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出双曲大语言模型,通过双曲几何提升语义表示学习和多尺度推理能力。
Comments 27 pages, 7 figures
模型Whisper:引导向量解锁大型语言模型在测试时的潜力
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 Model Whisper通过轻量级引导向量在测试时提升大型语言模型的推理能力,实现高效且稳定的性能提升。
Comments accepted to aaai2026
PretrainZero:强化主动预训练
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Xiaohongshu Inc.(小红书公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 PretrainZero通过主动预训练和自监督学习方法,提升通用推理能力,并在多个基准测试中取得显著成绩。
DeepSeek-V3.2: 推动开放大规模语言模型的前沿
机构 * DeepSeek-AI
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 DeepSeek-V3.2通过高效注意力机制、强化学习框架和大规模代理任务合成流水线,在计算效率与推理能力上取得突破,超越GPT-5并获国际竞赛金牌。
评估大型语言模型在2026年韩国CSAT数学考试中的表现:在零数据泄漏环境下测量数学能力
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究评估了24种LLM在2026年韩国CSAT数学考试中的表现,发现文本输入优于图像输入,GPT-5系列模型在特定配置下达到满分,同时揭示了微积分领域表现最差,且高难度问题对模型性能影响显著。
Comments 52 pages
Echo-N1:情感强化学习前沿
机构 * Echo-N1: Affective RL Frontier Team(情感强化学习前沿团队)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 Echo-N1通过实时推断用户个性并优化个性化对话偏好,开创了情感强化学习的新领域,显著提升了人类般的交互质量。