arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3222 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2211.09085 2022-11-17 cs.CL stat.ML 57%

Galactica: A Large Language Model for Science

Ross Taylor, Marcin Kardas, Guillem Cucurull, Thomas Scialom, Anthony Hartshorn, Elvis Saravia, Andrew Poulton, Viktor Kerkez, Robert Stojnic

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00053 2022-11-02 cs.CL 57%

Generating Sequences by Learning to Self-Correct

Sean Welleck, Ximing Lu, Peter West, Faeze Brahman, Tianxiao Shen, Daniel Khashabi, Yejin Choi

专题命中 数学推理 :self-correction(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05051 2022-08-11 cs.CL 57%

Limitations of Language Models in Arithmetic and Symbolic Induction

Jing Qian, Hong Wang, Zekun Li, Shiyang Li, Xifeng Yan

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01268 2022-06-06 cs.CL 57%

MMTM: Multi-Tasking Multi-Decoder Transformer for Math Word Problems

Keyur Faldu, Amit Sheth, Prashant Kikani, Darshan Patel

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.13435 2022-05-12 cs.AI 57%

MWP-BERT: Numeracy-Augmented Pre-training for Math Word Problem Solving

Zhenwen Liang, Jipeng Zhang, Lei Wang, Wei Qin, Yunshi Lan, Jie Shao, Xiangliang Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments Accepted by the Findings of NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10133 2022-03-08 stat.ML cs.LG eess.SP 57%

Information Field Theory and Artificial Intelligence

Torsten Enßlin

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

Comments 12 pages, three figures, invited talk at MaxEnt2020/2021, reviewed and published by Entropy

Journal ref Torsten A. Enßlin, Entropy 2022, 24, 374

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.12213 2021-05-27 cs.SI cs.AI 57%

Some Pragmatic Prevention's Guidelines regarding SARS-CoV-2 and COVID-19 in Latin-America inspired by mixed Machine Learning Techniques and Artificial Mathematical Intelligence. Case Study: Colombia

Danny A. J. Gomez-Ramirez, Yoe A. Herrera-Jaramillo, Johana C. Ortega-Giraldo, Alex M. Ardila-Garcia

专题命中 数学推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11798 2021-05-11 cs.LG cs.NE 57%

Realising Active Inference in Variational Message Passing: the Outcome-blind Certainty Seeker

Théophile Champion, Marek Grześ, Howard Bowman

专题命中 数学推理 :planning(abstract);分类 cs.LG

Comments 60 pages, 19 figures, final version accepted for publication in Neural Computation

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.02899 2021-04-08 cs.LG 57%

Recognizing and Verifying Mathematical Equations using Multiplicative Differential Neural Units

Ankur Mali, Alexander Ororbia, Daniel Kifer, C. Lee Giles

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.01502 2021-01-06 cs.MA cs.DC cs.LG cs.SY eess.SY 57%

DRLE: Decentralized Reinforcement Learning at the Edge for Traffic Light Control in the IoV

Pengyuan Zhou, Xianfu Chen, Zhi Liu, Tristan Braud, Pan Hui, Jussi Kangasharju

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

Comments Accepted by IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03755 2020-12-08 quant-ph cs.CL 57%

Foundations for Near-Term Quantum Natural Language Processing

Bob Coecke, Giovanni de Felice, Konstantinos Meichanetzidis, Alexis Toumi

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 43 pages, lots of pictures

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.14165 2020-07-24 cs.CL 57%

Language Models are Few-Shot Learners

Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, Dario Amodei

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 40+32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06896 2020-06-15 cs.AI 57%

A New Perspective on Learning Context-Specific Independence

Yujia Shen, Arthur Choi, Adnan Darwiche

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.10508 2019-07-25 cs.CY cs.AI 57%

A system of different layers of abstraction for artificial intelligence

Alexander Serb, Themistoklis Prodromakis

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments 12 pages, 1 figure, 1 table, submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
1501.05290 2015-02-13 cs.DB cs.AI cs.CE 57%

Managing large-scale scientific hypotheses as uncertain and probabilistic data

Bernardo Gonçalves

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments 145 pages, 61 figures, 1 table. PhD thesis, National Laboratory for Scientific Computing (LNCC), Brazil, February 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16973 2024-10-28 cs.CL cs.AI cs.LG 56%

Learning Mathematical Rules with Large Language Models

Antoine Gorceix, Bastien Le Chenadec, Ahmad Rammal, Nelson Vadori, Manuela Veloso

专题命中 数学推理 :分类 cs.CL、cs.AI、cs.LG;reasoning(comments)

Comments NeurIPS'24 MATH-AI, the 4th Workshop on Mathematical Reasoning and AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04854 2026-08-18 cs.SE 版本更新 50%

Assessing Large Language Models for Stabilizing Numerical Expressions in Scientific Software

评估大语言模型在科学软件中稳定数值表达式的能力

Tien Nguyen, Kirshanthan Sundararajah, Muhammad Ali Gulzar

专题命中 数学推理 :reasoning(abstract)

AI总结 本文评估大语言模型在数值稳定性任务中的表现,发现其在检测和稳定不稳定的计算方面与传统方法相当,并在某些情况下表现更优,但对控制流和高精度字面量处理较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07825 2026-08-11 cs.CY cs.HC 新提交 50%

AI as a Democratizing Force in Indie Game Development

AI作为独立游戏开发中的民主化力量

Brian Madanamootoo, Jatin Alla

专题命中 数学推理 :planning(abstract)

AI总结 该研究考察AI对2024-2026年游戏行业分化的影响,发现AI大幅降低独立游戏制作的协调成本,推动第三波民主化浪潮,披露AI的游戏接受度与传统游戏相当,但市场已呈现结构性过剩的前提条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00868 2026-08-05 cs.CV cs.HC 版本更新 50%

MIDAL: A Dataset of Math Image Descriptions for Accessible Learning

MIDAL:用于无障碍学习的数学图像描述

Rebeka Popek, Vaghawan Ojha, Young Hwan You

机构 * E.K. Solutions Pvt. Ltd.(E.K.解决方案私人有限公司)

专题命中 数学推理 :reasoning(abstract)

AI总结 该研究推出含2020张多级别数学图像的MIDAL数据集,用于训练视觉语言模型生成无障碍图像描述,还可微调语言模型提升数学推理能力,助力高等教育STEM内容无障碍性建设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18538 2026-07-31 cs.CR 版本更新 50%

CryptanalysisBench: Can LLMs do Cryptanalysis?

密码分析基准测试:大语言模型能进行密码分析吗?

Lukas Fluri, Avital Shafran, Nicholas Carlini, Matthew Jagielski, Milad Nasr, Orr Dunkelman, Eyal Ronen, Florian Tramèr

专题命中 数学推理 :reasoning(abstract)

AI总结 研究探讨大语言模型能否进行密码分析,引入包含六个密码原语家族191个任务的CryptanalysisBench基准测试,五个前沿模型在不同层级有一定破解率,不仅得出已知结果还产生新成果,发布该基准测试以追踪人工智能密码分析进展及压力测试候选方案。

Comments 46 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00491 2026-07-30 cs.NI 版本更新 50%

Smart-TCP: An Agentic AI-based Autonomous and Adaptive TCP Protocol

Smart-TCP:基于智能体AI的自主自适应TCP协议

Yule Han, Kezhi Wang, Yizhe Zhao, Kun Yang

专题命中 数学推理 :reasoning(abstract)

AI总结 提出Smart-TCP框架,利用大/小语言模型与算术逻辑单元协同决策,实现TCP控制逻辑的自适应,实验显示高精度与全生命周期成功率。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10265 2026-07-28 cs.DB 版本更新 50%

TGMS: An Agent-Native Bi-Temporal Graph Management System

TGMS:一种原生代理双时态图管理系统

Xiaofei Zhang

专题命中 数学推理 :verifier(abstract)

AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 50%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 50%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18030 2026-07-15 cs.HC 版本更新 50%

ParaTutor: Coordinating Parent and Child Math Tutoring through Role Separated LLM Scaffolding

ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导

Lan Luo, Anqi Wang, Muzhi Zhou, Junhua Zhu, Jie Cai, Ao Yu, Hui Pan

专题命中 数学推理 :reasoning(abstract)

AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06377 2026-07-08 math.HO 新提交 50%

Automation Without Understanding

没有理解的自动化

Jun-Yong Park

专题命中 数学推理 :reasoning(abstract)

AI总结 探讨人工智能产出数学成果但美国削弱相关人才培养渠道这一现象,主张将数学能力视为战略资产,提出要求进行重要推理的人工智能系统以可检查形式公开关键主张,以避免战略错误。

Comments 10 pages. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05226 2026-07-08 math.PR math.ST stat.ML stat.TH 新提交 50%

The Exact Worst-Case Tail Probability under Bounded Kurtosis

有界峰度下的精确最坏情况尾概率

Xiaoyu Li, Andi Han, Jiaojiao Jiang, Junbin Gao

专题命中 数学推理 :reasoning(abstract)

AI总结 研究有界峰度下单边尾控制问题,通过AI引导搜索确定最坏情况尾概率的四区域映射,给出各区域表达式及证明度相图,还得到精确最坏情况分位数等。

Comments v2: fixed cross-reference names rendered incorrectly by the arXiv TeX complier and made minor edits. Code, certificates, and the full instance tables are available at https://github.com/xiaoyulics/lemmaforge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26286 2026-07-03 cs.CC cs.LO 版本更新 50%

Proofdoors and Efficiency of CDCL Solvers

证明门与CDCL求解器的效率

Sunidhi Singh, Vincent Liew, Marc Vinyals, Vijay Ganesh

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出证明门参数,用于解释CDCL求解器在电路验证中的效率,证明具有小证明门的公式有短的分辨率证明,并展示某些CDCL求解器能高效生成此类证明。

Comments version 2.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00820 2026-07-02 cs.SE 新提交 50%

Knowledge-Enhanced Agentic Vulnerability Repair

知识增强的智能体漏洞修复

Sicong Cao, Hao Ma, Le Yu, Kangyi Ding, Xiaolei Liu, Terry Yue Zhuo, Bo Wang, Xingwei Lin, Xiaobing Sun, Linzhang Wang, David Lo

专题命中 数学推理 :reasoning(abstract)

AI总结 提出KeaRepair,一种基于智能体的自动化漏洞修复方法,通过提取历史漏洞知识并利用工具增强的智能体进行诊断,生成并迭代优化补丁,在55个C/C++漏洞上修复率达83.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27570 2026-06-29 cs.LO 新提交 50%

Auditing AI Investment Recommendations as Executable Actions

审计AI投资建议作为可执行行动

Sidnei Barbieri, Wellington Vargas, Ágney Lopes Roth Ferraz

专题命中 数学推理 :verifier(abstract)

AI总结 提出将AI投资建议作为可执行金融行动进行审计,通过确定性基线协议评估有效性、稳定性和一致性,发现一致性单独评估具有误导性。

详情

展开后加载摘要…

URL PDF HTML 收藏