arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-22 至 2026-05-22 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 7 篇

2605.21695 2026-05-22 cs.AI cs.HC 88%

The Impact of AI Usage and Informativeness on Skill Development in Logical Reasoning

人工智能使用与信息性对逻辑推理技能发展的影响力

Shang Wu, Hongyu Yao, Catarina Belem, Shuyuan Fu, Mark Steyvers, Padhraic Smyth

机构 * University of California, Irvine(加州大学尔湾分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了人工智能使用和信息性如何影响逻辑推理技能的发展,发现高使用AI的用户表现较差,而信息性低的AI对学习无帮助,信息性高的AI则在短期内提升表现但影响不均一。

Comments Accepted at Hybrid Human Artificial Intelligence (HHAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04371 2026-05-22 cs.AI 84%

Cumulative Reasoning with Large Language Models

基于大语言模型的累积推理

Yifan Zhang, Jingqin Yang, Yang Yuan, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种名为累积推理(CR)的框架,通过模拟人类的迭代和累积思维过程,增强大语言模型(LLM)的问题解决能力。CR通过分解任务、生成并验证中间推理步骤,构建动态有向无环图(DAG)来组成解决方案,从而在逻辑推理、24点游戏和数学问题等任务中取得了显著的性能提升。

Comments Published in Transactions on Machine Learning Research (TMLR). Project Page: https://github.com/iiis-ai/cumulative-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22322 2026-05-22 cs.RO 78%

How can reasoning capability empower the AI copilot robot in endoscopic surgery

推理能力如何赋能内窥手术中的AI助手机器人

Guankun Wang, Long Bai, Hongliang Ren

机构 * Department of Electronic Engineering(电子工程系)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文研究了推理能力在内窥手术中AI助手机器人中的应用,提出通过整合多模态线索、解读手术意图和推断隐藏组织动态来提高手术的精确性、安全性和可持续性。

Comments Accepted by npj digital medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22217 2026-05-22 cs.LG cs.CL 62%

Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL

生存或崩溃:自我博弈强化学习中数据门控与奖励基础的不对称作用

Sophia Xiao Pu, Zhaotian Weng, Chengzhi Liu, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Cisco Research(思科研究)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了自我博弈强化学习中数据门控和奖励基础的不对称作用,发现数据门控是维持稳定的关键因素,而奖励信号在门控移除后无法单独保证稳定性,揭示了'基础提出者悖论'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22566 2026-05-22 cs.LG 57%

GraphFlow: A Graph-Based Workflow Management for Efficient LLM-Agent Serving

GraphFlow: 一种基于图的流程管理用于高效的LLM代理服务

Ao Li, Shangpeng Yang, Fahao Chen, Tianheng Xu, Peng Li, Zhou Su

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University, Xi'an, China(西安交通大学计算机科学与工程学院) School of Artificial Intelligence, Shandong University, Jinan, China(山东大学人工智能学院) Shanghai Advanced Research Institute, Chinese Academy of Sciences, Shanghai, China(中国科学院上海先进研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于图的流程管理方法GraphFlow,通过统一图结构wGraph动态生成任务特定流程,提高LLM代理服务的效率和性能,实验表明其在多个基准数据集上表现优异,性能提升显著且内存占用减少。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01476 2026-05-22 cs.LG cs.NA math.NA physics.comp-ph 57%

Neuro-Symbolic AI for Analytical Solutions of Differential Equations

神经符号AI用于微分方程的解析解

Orestis Oikonomou, Levi Lingsch, Dana Grund, Siddhartha Mishra, Georgios Kissas

机构 * Seminar for Applied Mathematics, ETH Zurich, Switzerland(应用数学研讨会,苏黎世联邦理工学院,瑞士) ETH AI Center, Zurich, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,苏黎世,瑞士) Institute for Atmospheric and Climate Science, ETH Zurich, Switzerland(大气与气候科学研究所,苏黎世联邦理工学院,瑞士) Swiss Data Science Center, ETH Zurich, Switzerland(瑞士数据科学中心,苏黎世联邦理工学院,瑞士)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SIGS神经符号框架,通过上下文无关文法生成数学上有效且物理上有意义的构建块,并结合用户指定的Ansatz进行组合,嵌入到拓扑正则化的连续潜在流形中,通过两阶段搜索发现解析解,提高了微分方程解析解的准确性和效率。

Comments Updates the method and added extra results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21779 2026-05-22 cs.CR cs.SE 50%

FuzzingBrain V2: A Multi-Agent LLM System for Automated Vulnerability Discovery and Reproduction

FuzzingBrain V2: 一个用于自动化漏洞发现与重现的多智能体LLM系统

Ze Sheng, Zhicheng Chen, Qingxiao Xu, Kewen Zhu, Jeff Huang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出FuzzingBrain V2,通过多智能体系统解决LLM在漏洞检测中的三大挑战:自动化分析、精准定位与复杂依赖推理,实现了90%的检测率并发现29个零日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏