arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-16 至 2026-07-16 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2607.13248 2026-07-16 cs.CL 新提交 85%

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试

Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

机构 * Southeast University(东南大学) Ahsanullah University of Science and Technology(阿山努拉科技大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05711 2026-07-16 cs.CL 版本更新 77%

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

超越Token:基于LLM的多智能体系统中潜在通信的统一框架

Yingzhuo Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL

AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13899 2026-07-16 cs.AI 新提交 70%

AIMO Interpretability Challenge

AIMO可解释性挑战

Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp

机构 * National Institute of Informatics(日本国立信息学研究所) Munich Center for Machine Learning / MaiNLP LMU(慕尼黑机器学习中心/慕尼黑大学语言与文学计算研究所) University of Tübingen(图宾根大学) Fuzhou University(福州大学) Masaryk University(马萨里克大学) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 提出AIMO可解释性挑战,基于前沿数学语言模型内部机制区分稳健与虚假推理。利用AIMO问题等资源,提供推理问题、模型访问及鲁棒性评估,助参与者开发识别稳健模型的方法,创建新基准和基线系统,连接可解释性与泛化研究。

Comments Accepted Competition at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13643 2026-07-16 cs.LG cs.AI cs.CL 新提交 67%

Consensus as Privileged Context for Label-Free Self-Distillation

作为无标签自蒸馏特权上下文的共识

John Gkountouras, Josip Jukić, Ivan Titov

机构 * ILLC, University of Amsterdam(逻辑、语言与计算研究所,阿姆斯特丹大学) ILCC, University of Edinburgh(信息实验室,爱丁堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在提高无标签大语言模型推理准确性,提出CANON方法将共识转化为token级监督,通过采样多个解决方案并以达到多数答案的方案为条件设置模型快照来监督。实验表明该方法大幅提升性能,还能迁移,改进非单纯分布锐化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13394 2026-07-16 cs.CL cs.LG 新提交 62%

GFlowRL: Scaling Distribution-Matching RL to Large Language Models

GFlowRL:将分布匹配强化学习扩展到大型语言模型

Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究旨在将GFlowNet风格的RL扩展到大型语言模型,提出GFlowRL算法,去除辅助分区网络,用批内蒙特卡罗估计替代学习的分区函数,并通过两个稳定器实现奖励分布匹配,在多个基准测试中表现出色,能稳定扩展到不同架构。

Comments 31 pages, 8 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07836 2026-07-16 cs.AI 版本更新 57%

Infinity-Parser2 Technical Report

Infinity-Parser2技术报告

Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14477 2026-07-16 cs.LG 版本更新 57%

Test-Time Learning with an Evolving Library

测试时学习与进化库

Weijia Xu, Alessandro Sordoni, Chandan Singh, Zelalem Gero, Michel Galley, Xingdi Yuan, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 50%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏