arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-04 至 2026-05-04 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2506.11991 2026-05-04 cs.CV cs.AI cs.CL 86%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00677 2026-05-04 cs.LG 83%

Evaluating the Architectural Reasoning Capabilities of LLM Provers via the Obfuscated Natural Number Game

通过混淆的自然数游戏评估大语言模型证明者的架构推理能力

Lixing Li

机构 * Lixing Li(李立星)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文通过混淆的自然数游戏评估大语言模型的架构推理能力,发现推理模型在无语义线索下仍保持准确率,为数学推理能力提供了量化评估标准。

Comments 4 pages. Accepted as a short paper to the AAAI 2026 Spring Symposium on Machine Learning and Knowledge Engineering for Knowledge-Grounded Semantic Agents (MAKE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00610 2026-05-04 cs.LG 57%

Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors

在整合前解耦:测试时合成SFT和RLVR任务向量

Chaohao Yuan, Chenghao Xiao, Yu Rong, Hong Cheng, Long-Kai Huang

机构 * Department of Systems Engineering and Engineering Management, Chinese University of Hong Kong, Hong Kong, China(系统工程与工程管理系,香港中文大学,香港,中国) Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(计算机科学系,香港 Baptist 大学,香港,中国) DAMO Academy, Alibaba Group, Hangzhou, China(达摩院,阿里巴巴集团,杭州,中国) Hupan Lab, Hangzhou, China(虎派实验室,杭州,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DoTS框架,通过测试时任务向量运算解耦SFT和RLVR,减少干扰并提升性能,实验表明其在多个数学推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00224 2026-05-04 cs.AI 57%

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

TUR-DPO:基于拓扑和不确定性的直接偏好优化

Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili, Mourad Oussalah

机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17450 2026-05-04 cs.AI 57%

Compiling Deterministic Structure into SLM Harnesses

将确定性结构编译进SLM以获取优势

Zan Kai Chong, Hiroyuki Ohsaki, Bryan Ng

机构 * School of Science and Technology(科学与技术学系) Kwansei Gakuin University(冈山学院大学) School of Engineering & Computer Science(工程与计算机科学学系) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SGDe框架,通过编译代理工作流为离散执行计划,提升SLM在推理和数据主权方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15830 2026-05-04 cs.LG 57%

Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning

将拼图碎片放在关键位置:一种用于强化学习的问题增强框架

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PieceHint框架,通过战略性提供关键推理步骤,解决强化学习中训练易问题过拟合和训练难问题奖励稀疏的问题,实验表明其在数学推理基准上性能优异且保持pass@k多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏