arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3222 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2606.17999 2026-06-23 cs.CL 新提交 57%

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding: 让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 专注于语义终止

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出VoidPadding方法,通过引入[VOID]令牌处理填充,将[EOS]从双重角色中解放,实现大块解码下的早期停止和自适应响应扩展,在数学推理和代码生成任务上平均提升17.84分,并减少55.7%的NFE。

Comments Minor related-work revisions; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20008 2026-06-19 cs.LG 新提交 57%

VIMPO: Value-Implicit Policy Optimization for LLMs

VIMPO: 值隐式策略优化用于大语言模型

Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出VIMPO方法,通过KL正则化强化学习的最优条件导出策略隐含值函数,无需训练评论家,实现细粒度信用分配,在数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01316 2026-06-19 cs.AI 版本更新 57%

Science Earth: Towards A Planet-Scale Operating System for AI-Native Scientific Discovery

Science Earth: 迈向面向AI原生科学发现的行星级操作系统

Zhe Zhao, Haibin Wen, Yingcheng Wu, Jiaming Ma, Yifan Wen, Jinglin Jian, Jiacheng Ge, Xiangru Tang, Bo An, Ming Yin, Sanfeng Wu, Mengdi Wang, Le Cong

机构 * Department of Pathology, Department of Genetics, Stanford University School of Medicine(病理学系、遗传学系,斯坦福大学医学院) Princeton AI Lab, Department of Electrical & Computer Engineering, Princeton University(普林斯顿人工智能实验室、电气与计算机工程系,普林斯顿大学) Scripps Research, La Jolla, CA, USA(斯克里普斯研究机构,洛杉矶,加利福尼亚州,美国) Division of Biostatistics, Department of Population Health, New York University Grossman School of Medicine(生物统计学部、人口健康系,纽约大学格罗斯曼医学院) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Department of Computer Science, Yale University(计算机科学系,耶鲁大学) Department of Physics, Princeton University(物理系,普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Science Earth行星级科学运行时,通过EACN协议实现AI能力动态连接与自组织协作,在跨太平洋Kuramoto同步研究和单细胞分析中验证了分布式自校正科学推理。

Comments Withdrawn by the authors. (1) The author list and authorship roles had not been finalized and agreed upon by all listed authors prior to submission. (2) The specific contribution of the system in the K3 synchronization example (Section on Kuramoto/nonlinear physics) requires further validation before it can be reported. The authors are addressing both points and may resubmit a corrected version.

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16865 2026-06-19 cs.CL 版本更新 57%

MixSD: Mixed Contextual Self-Distillation for Knowledge Injection

MixSD: 混合上下文自蒸馏用于知识注入

Jiarui Liu, Lechen Zhang, Yongjin Yang, Yinghui He, Yingheng Wang, Weihao Xuan, Zhijing Jin, Mona Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学及向量研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Princeton University(普林斯顿大学) Cornell University(康奈尔大学) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根最大计划智能系统研究所) EuroSafeAI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MixSD方法,通过混合模型自身条件下的token来实现与模型生成分布对齐的知识注入,从而在保持预训练能力的同时提升事实记忆和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07593 2026-06-19 cs.AI 版本更新 57%

Too long; didn't solve

太长;没解决

Lucía M. Cabrera, Isaac Saxton-Knight, Jocelyn D'Arcy

机构 * Instituto Balseiro(巴塞罗那研究所) Poindexter Labs(波因迪克斯实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究提示长度和解答长度与大型语言模型在数学问题上的性能关系,发现两者与模型失败率正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09689 2026-06-19 cs.LG 版本更新 57%

Model soups need only one ingredient

模型汤只需一种成分

Alireza Abdollahpoorrostam, Nikolaos Dimitriadis, Adam Hazimeh, Pascal Frossard

机构 * EPFL(瑞士联邦理工学院) EPFL LTS4(瑞士联邦理工学院 LTS4)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出MonoSoup方法,利用SVD分解单检查点的层更新,通过熵有效秩自动重加权成分,实现强分布内-分布外平衡,无需多检查点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18844 2026-06-18 cs.LG 新提交 57%

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Zhilin Huang, Hang Gao, Ziqiang Dong, Yuan Chen, Yifeng Luo, Chujun Qin, Jingyi Wang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18453 2026-06-18 cs.CL 新提交 57%

LLM Parameters for Math Across Languages: Shared or Separate?

跨语言数学问题的LLM参数:共享还是分离?

Behzad Shomali, Luisa Victor, Tim Selbach, Ali Hamza Bashir, David Berghaus, Joachim Koehler, Mehdi Ali, Markus Frey

机构 * Lamarr Institute(Lamarr研究所) University of Bonn(波恩大学) Fraunhofer IAIS(弗劳恩霍夫智能分析和信息系统研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 通过跨语言机制分析,发现多语言LLM中数学相关参数存在部分跨语言重叠,且主要集中在中间层,英语参数集最大,低资源语言参数集较小。

Comments 5 pages. Accepted at ACL Student Research Workshop (SRW) 2026. Code: https://github.com/luisavictor/math-across-languages Translated Datasets: https://huggingface.co/math-across-languages Webpage: https://math-across-languages.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17803 2026-06-17 cs.LG 新提交 57%

Continual Self-Improvement with Lightweight Experiential Latent Memories

持续自我改进:轻量级经验潜在记忆

Vaggelis Dorovatas, Nancy Kalaj, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田汽车欧洲公司) University of Trento(特伦托大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一种在线方法,将推理时计算转化为轻量级模块化潜在记忆,通过自生成测试时信号进行训练,实现持续改进且避免灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17657 2026-06-17 cs.AI 新提交 57%

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games

使用认知模型改进语言模型对人类说服博弈的模拟

Zirui Cheng, Zeyu Shen, Thomas L. Griffiths, Peter Henderson

机构 * Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出方程到行为提示和强化学习方法,使语言模型匹配认知模型(如贝叶斯更新、动机推理),在说服博弈中提升模拟人类决策多样性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14807 2026-06-17 cs.AI 版本更新 57%

Beyond the Sampled Token: Preserving Candidate Support in RLVR

超越采样令牌:在RLVR中保留候选支持

Ruotian Peng, Yi Ren, Zhouliang Yu, Weiyang Liu, Yandong Wen

机构 * Westlake University(西湖大学) University of British Columbia(不列颠哥伦比亚大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文从候选分布角度分析RLVR中的探索崩溃,提出CaSP方法,通过保留前N个候选的概率质量,在不牺牲pass@1的情况下提升pass@K,在多个基准测试中验证了有效性。

Comments Technical report (23 pages, 16 figures, project page: https://spherelab.ai/simko/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16111 2026-06-16 cs.CL 新提交 57%

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

面向帕累托最优工具集成智能体的帕累托排名策略优化

Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。

Comments ICML 2026 Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15577 2026-06-16 cs.AI 新提交 57%

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

大型语言模型作为优化器:直接方法与工具增强方法的调查及其性能前沿

Roko Peran, Luka Hobor, Mihael Kovac, Mario Brcic

机构 * University of Zagreb, Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 综述LLM作为优化器的三种范式(直接优化、工具增强优化、工具创造优化),分析性能前沿与推理差距,探讨直接优化的未来潜力与工具增强优化的可审计性之间的权衡。

Comments 6 pages, 1 figure, 2 tables, accepted at 49th ICT and Electronics Convention, MIPRO - https://mipro.hr; Paper ID: #23463

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13782 2026-06-16 cs.AI 新提交 57%

MA-ProofBench: A Two-Tiered Evaluation of LLMs for Theorem Proving in Mathematical Analysis

MA-ProofBench: 数学分析中定理证明的大语言模型双层评估基准

Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

机构 * ModelBest Inc. Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出首个面向数学分析的形式化定理证明基准MA-ProofBench,包含200个定理,覆盖6个核心主题和27个子类别,分为本科和博士资格两级难度,评估发现当前模型表现不佳,GPT-5.5在Level I上仅达16% Pass@8。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14620 2026-06-15 cs.LG 新提交 57%

Neither Parallel Nor Sequential: How DiffusionGemma Actually Commits Tokens

既非并行也非顺序:DiffusionGemma 实际如何提交令牌

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 通过钩取DiffusionGemma 26B的采样器接受步骤,测量其解码顺序,发现解码既非并行也非块自回归,而是呈现部分从左到右的提交偏差,且块大小是测量尺度的伪影而非架构特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03108 2026-06-15 cs.AI 版本更新 57%

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习

Guhong Chen, Yingcheng Shi, Yongbin Li, Binhua Li, Xander Xu, Hu Wei, Shiwen Ni, Min Yang, Jieping Ye

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) Alibaba Group(阿里巴巴集团) SUAT(深圳大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12935 2026-06-12 cs.AI 新提交 57%

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略

Wenbo Chen, Puheng Li, Mengyang Liu, Weijie Su, Tianpei Xie

机构 * Amazon(亚马逊) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12273 2026-06-11 cs.CL 新提交 57%

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models

超越完全随机掩码:扩散语言模型的注意力引导去噪与优化

Jia Deng, Junyi Li, Wayne Xin Zhao, Jinpeng Wang, Hongyu Lu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Meituan(美团) WeChat, Tencent(腾讯微信) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(大型模型与智能治理北京市重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出AGDO框架,利用注意力结构指导去噪顺序并强化关键令牌,在数学和编码基准上提升扩散语言模型的推理性能。

Comments 13 pages. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11512 2026-06-11 cs.CL 新提交 57%

SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment

SAGE: 面向言语不确定性对齐的答案条件不确定性目标

Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出SAGE目标,通过答案条件不确定性几何从模型采样响应中构建群组级不确定性目标,结合GUPO训练框架优化言语不确定性表达,在多项推理任务中提升不确定性排序、降低校准误差和过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10799 2026-06-10 cs.AI 新提交 57%

Evaluating Research-Level Math Proofs via Strict Step-Level Verification

通过严格的步骤级验证评估研究级数学证明

Yifeng Sun

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出严格步骤级验证框架,通过约束推理上下文和定理来源,解决大模型在复杂数学证明验证中的“上下文中毒”问题,在FirstProof挑战数据集上优于全局评估,并揭示基准中的隐含歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 57%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 57%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06114 2026-06-09 cs.AI 版本更新 57%

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

走向健康进化:探索人机交互在自我进化系统中的作用与机制

Dianxing Shi, Bowen Wang, Junqi He, Junhao Chen, Yuta Nakashima

机构 * The University of Osaka(大阪大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ANCHOR框架,通过模拟人类监督的反馈机制,在自我进化系统中缓解能力退化与安全漂移,实验表明有限监督可显著提升安全性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15829 2026-06-09 cs.LG 版本更新 57%

Operationalising the Superficial Alignment Hypothesis via Task Complexity

通过任务复杂度操作化浅层对齐假设

Tomás Vergara-Browne, Darshan Patil, Ivan Titov, Siva Reddy, Tiago Pimentel, Marius Mosbach

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Edinburgh(爱丁堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18428 2026-06-09 cs.AI 版本更新 57%

AlphaOPT: Formulating Optimization Programs with Self-Improving LLM Experience Library

AlphaOPT: 利用自改进LLM经验库构建优化问题

Minwei Kong, Ao Qu, Xiaotong Guo, Wenbin Ouyang, Chonghe Jiang, Han Zheng, Yining Ma, Dingyi Zhuang, Yuhan Tang, Junyi Li, Shenhao Wang, Haris Koutsopoulos, Hai Wang, Cathy Wu, Jinhua Zhao

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学) Northeastern University(东北大学) Singapore Management University(新加坡管理学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AlphaOPT,一种自改进经验库,使LLM能从有限监督中学习优化建模知识,通过库学习和库演化两阶段循环,逐步提升性能,在多个基准上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08222 2026-06-09 cs.AI 版本更新 57%

Weak-Driven Learning: How Weak Agents make Strong Agents Stronger

弱驱动学习:弱智能体如何使强智能体更强

Zehao Chen, Gongxun Li, Tianxiang Ai, Zixuan Huang, Xiaodong Liu, Yifei Li, Wang Zhou, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航) China Telecom eSurfing Cloud(中国电信eSurfing云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型后训练中的饱和瓶颈,提出WMSS方法,利用模型历史弱检查点通过熵动力学识别可恢复学习差距并进行补偿学习,在数学推理和代码生成任务上实现有效性能提升且无额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06902 2026-06-08 cs.LG 新提交 57%

TALAN: Task-Aligned Latent Adaptation Networks for Targeted Post-Training of Large Language Models

TALAN:面向大型语言模型目标后训练的任务对齐潜在自适应网络

Chengkai Zhang, Ziteng Liu, Junpu Wang, Zeyi Tao, Yang Wang, Sagar Chordia, Qin Huang

机构 * Meta AI

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出TALAN,一种序列条件潜在旁路,插入Transformer残差流并与低秩适配器协同训练,在STEM/代码基准上平均提升LoRA 1.41点、DoRA 1.85点,仅增加<1%可训练参数和1.01-1.02倍推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06428 2026-06-05 cs.CL 57%

Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation

强化学习引发对未见语言的上下文翻译学习

Hanxu Hu, Zdeněk Šnajdr, Pinzhen Chen, Jannis Vamvas, Rico Sennrich

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出使用强化学习(RL)方法,以chrF为奖励,使大语言模型从丰富的语言上下文中提取并应用语言学知识,实现对完全未见语言的有效翻译。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06350 2026-06-05 cs.CL 57%

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

EDIT:基于证据诊断的干预训练以实现遵循规则的LLM评分

Zhihao Wu, Linhai Zhang, Taiyi Wang, Runcong Zhao, Peter Andrews, Cesare Aloisi, Yulan He

机构 * King’s College London(伦敦国王学院) University of Cambridge(剑桥大学) AQA The Alan Turing Institute(艾伦·图灵研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出EDIT框架,通过内部模型信号定位推理错误步骤并修正,结合信念引导的奖励塑造,提升LLM评分对评分标准的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06136 2026-06-05 cs.SC cs.AI 57%

A Finite Certificate for the Positive $n=9$ Vasc Inequality

正数 $n=9$ 的 Vasc 不等式的一个有限证书

Dakai Guo, Ruichen Qiu, Yichuan Cao, Ruyong Feng

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, and the School of Mathematics, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院,以及中国科学院大学数学系)

专题命中 数学推理 :verifier(abstract);分类 cs.AI

AI总结 通过人工引导的 AI 代理 MechMath Agent Team,将有理不等式转化为齐次多项式不等式,并利用累积间隙参数化所有排序的固定最大值锥体,生成覆盖 40320 个锥体的有限证书,从而证明了正实数 $n=9$ 情况下的 Vasc 循环不等式。

详情

展开后加载摘要…

URL PDF HTML 收藏