arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-26 至 2026-06-26 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2606.25524 2026-06-26 cs.AI cs.CL 新提交 81%

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点

Jaeyong Ko, Pilsung Kang, Yukyung Lee

机构 * Seoul National University(首尔大学) Boston University(波士顿大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07031 2026-06-26 cs.CR cs.AI cs.CL 版本更新 81%

HauntAttack: When Attack Follows Reasoning as a Shadow

HauntAttack:当攻击如影随形地跟随推理

Jingyuan Ma, Rui Li, Zheng Li, Junfeng Liu, Heming Xia, Lei Sha, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) StepFun Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Institute of Artificial Intelligence, Beihang University(北航人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出HauntAttack黑盒对抗攻击框架,通过将有害指令嵌入推理问题,引导大型推理模型逐步产生不安全输出,在11个模型上平均攻击成功率超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27103 2026-06-26 cs.CL 新提交 79%

The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans

谜语谜题:测试大型语言模型和人类的灵活推理

Bella Fascendini, Kathryn McGregor, Max D. Gupta, Thomas L. Griffiths

机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过谜语谜题范式,发现LLM在真实谜语上准确率高(84.9%),但在谜语谜题上表现差(50.7%),而人类相反;错误分析表明LLM更倾向于过度使用创造性推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26797 2026-06-26 cs.LG 新提交 79%

Reasoning Quality Emerges Early: Data Curation for Reasoning Models

推理质量早期涌现:推理模型的数据策展

Hongyi Henry Jin, Wenhan Yang, Meysam Ghaffari, Carlos Morato, Baharan Mirzasoleiman

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出仅利用初始推理token即可识别多样且具挑战性的推理样本,通过扰动检查点评估前100个token的损失检测难题,并证明前1k token的损失模式可预测梯度相似性,在Qwen2.5-7B和Llama3.1-8B上验证,性能提升达1.7%,token效率提升91%。

Comments Accepted by ICML 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26744 2026-06-26 cs.LG cs.CL 新提交 73%

HyperDFlash: Hyper-Connection-Aligned Block Speculative Decoding with Gated Residual Reduction

HyperDFlash: 面向MHC架构的块级推测解码与门控残差缩减

Luxi Lin, Shuang Peng, Rui Ma, Junhao Hua, Shuwei Fan, Zhengda Qin, Qiang Wang, Hongjian Sun, Fangmin Chen, Songwei Liu

机构 * ByteDance(字节跳动)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对DeepSeek-V4的多超连接架构,提出HyperDFlash框架,通过对齐残差流和轻量门控缩减器,解决推测解码中特征错位和误差累积问题,显著提升解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26917 2026-06-26 cs.LG cs.AI 新提交 62%

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

GEOALIGN: 用于鲁棒大语言模型强化学习的几何轨迹策展

Ting Zhou, Zhenqing Ling, Yiyang Zhao, Ying Shen, Daoyuan Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对在线强化学习训练LLM时奖励噪声导致的不稳定性,提出GEOALIGN,通过检测并修正方向不一致的轨迹来稳定更新,提升最终性能并减少训练震荡。

Comments Accepted as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26472 2026-06-26 cs.LG cs.CL 新提交 62%

Epiphany-Aware KV Cache Eviction Without the Attention Matrix

无需注意力矩阵的顿悟感知KV缓存淘汰

Steven Kolawole, Virginia Smith

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学) Machine Learning Department Carnegie Mellon University(机器学习系卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出EpiKV方法,通过模型内部表示变化(顿悟分数)而非注意力权重来淘汰KV缓存,无需训练或自定义内核,支持FlashAttention,在MATH-500上达到72%准确率,速度提升2.8倍。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26671 2026-06-26 cs.AI 新提交 57%

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

NebulaExp-8B:基于全尺度消融研究的经验性后训练流程

Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

机构 * ZTE NebulaL0 Post-Training Team(中兴通讯NebulaL0后训练团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出NebulaExp透明后训练流程,基于Qwen3-8B-base,通过数据清洗、三阶段SFT和GRPO RL优化指令与推理分支,并探索OPD/MOPD替代RL,在8B模型上实现性能提升。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏