arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-30 至 2026-04-30 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2510.20956 2026-04-30 cs.CR cs.CL 87%

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐

Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。

Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25926 2026-04-30 cs.CL cs.IR 86%

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

MATH-PT:一个针对欧洲葡萄牙语和巴西葡萄牙语的数学推理基准数据集

Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Fundação Getulio Vargas(古特曼基金会) Instituto de Telecomunicações(电信研究所) Universidade de Coimbra, CISUC/LASI, DEI(科英布拉大学,CISUC/LASI,DEI) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 本文提出MATH-PT数据集,包含1729个欧洲和巴西葡萄牙语数学问题,评估了当前最先进的LLM在数学推理中的表现,发现前沿模型在选择题表现优异,但在涉及图表或开放性问题时性能下降。

Comments Accepted at 17th International Conference on Computational Processing of Portuguese (PROPOR 2026). Open access to dataset repo https://huggingface.co/datasets/tiagoteixeira03/MATH-PT and model outputs https://github.com/deep-spin/math-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 70%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10150 2026-04-30 cs.LG cs.AI 62%

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

重新思考RLVR中的熵干预:从熵变化视角

Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Tencent(腾讯) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文从熵变化角度分析RLVR中的熵崩溃问题,提出STEER方法通过理论估计熵变化来调整token权重,有效缓解熵崩溃并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26573 2026-04-30 cs.LG 57%

PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners

PAINT:部分解适应插值训练用于自蒸馏推理器

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 PAINT通过部分解适应插值训练,在自蒸馏推理器中提升大语言模型的推理能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06160 2026-04-30 cs.AI 57%

Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration

学生指导教师:通过频谱正交探索实现弱到强推断

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Spectral Orthogonal Exploration框架,通过正交探针引入语义异质性推理信号,提升数学推理任务的准确率和采样效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16591 2026-04-30 cs.CL 57%

Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature

异质自适应策略优化:针对每个token的性质进行定制化优化

Zheng Liu, Mengjie Liu, Siwei Wen, Mengzhang Cai, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University Zhongguancun Academy, 5 Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京大学中关村学院,5北京软件硬件协同人工智能系统重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出HAPO算法,通过熵度量异质性指导优化,实现细粒度调节。算法包含四个核心组件,通过token级处理提升LLM在数学推理、代码和逻辑任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏