arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-27 至 2026-05-27 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 12 篇

2601.21576 2026-05-27 cs.AI 88%

Chain Of Thought Compression: A Theoretical Analysis

思维链压缩:理论分析

Juncai Li, Ru Li, Yuxiang Zhou, Boxiang Ma, Jeff Z. Pan

机构 * School of Computer and Information Technology, Shanxi University, Taiyuan, Shanxi, China(山西大学计算机与信息学院) Queen Mary, University of London, UK(伦敦大学女王学院) School of Informatics, University of Edinburgh, UK(爱丁堡大学信息学院)

专题命中 逻辑推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 本文通过引入Order-r Interaction理论,证明了隐式思维链压缩中高阶逻辑依赖的学习信号指数衰减问题,并提出ALiCoT框架通过对齐潜在令牌分布与中间推理状态来克服信号衰减,实现54.4倍加速且性能与显式CoT相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26934 2026-05-27 cs.CL cs.AI 87%

Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks

推理深度与环境复杂度:逻辑推理任务中RLVR数据分配的受控研究

Yihua Zhu, Qianying Liu, Fei Cheng, Jiaxin Wang, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) University of Tokyo(东京大学) NII LLMC(日本信息处理学会LLMC) RIKEN(理化学研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);分类 cs.CL、cs.AI

AI总结 通过将推理空间划分为深度和复杂度两个维度,并考虑四种推理形式,在合成知识图谱环境中进行受控实验,发现联合深度-复杂度覆盖优于单轴策略,不同推理家族对RLVR覆盖的反应非均匀,且均匀混合优于分阶段课程。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26567 2026-05-27 cs.AI 79%

MedGuideX: Internalizing Decision Logic from Executable Guidelines into Large Language Models for Clinical Reasoning

MedGuideX: 将可执行指南中的决策逻辑内化到大型语言模型中以进行临床推理

Yuhao Shen, Lang Cao, Simo Du, Yuqing Wang, Juexiao Zhou, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Albert Einstein College of Medicine(爱因斯坦医学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出一种将临床实践指南转化为可执行决策逻辑并生成事实与反事实问答数据的训练流程,通过微调医学大语言模型得到MedGuideX,在四个临床推理基准上平均准确率相对提升10.28%,且医生评估显示其推理步骤更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03627 2026-05-27 cs.CL cs.AI 79%

Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks

提示的鲁棒性:增强大型语言模型对抗提示攻击的鲁棒性

Lin Mu, Guowei Chu, Li Ni, Lei Sang, Yiwen Zhang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出RoP(提示鲁棒性)策略,通过错误校正和引导两个阶段,增强LLM对输入扰动的鲁棒性,在算术、常识和逻辑推理任务上显著提升性能。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04868 2026-05-27 cs.CL cs.AI 73%

SEAL: Self-Evolving Agentic Learning for Conversational Question Answering over Knowledge Graphs

SEAL: 面向知识图谱对话问答的自我演进智能体学习

Hao Wang, Jialun Zhong, Changcheng Wang, Zhujun Nie, Zheng Li, Shunyu Yao, Yanzeng Li, Xinchi Li

机构 * Institute of Big Data and Artificial Intelligence, China Telecom Research Institute(大数据与人工智能研究院,中国电信研究院) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) School of Artificial Intelligence, China University of Geosciences (Beijing)(人工智能学院,中国地质大学(北京)) Center for Cognition and Neuroergonomics, State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知与神经工效学中心,认知神经科学与学习国家重点实验室,北京师范大学) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SEAL两阶段语义解析框架,通过自我演进智能体学习解决知识图谱对话问答中的指代消解、上下文依赖和复杂逻辑推理问题,在SPICE基准上达到最先进性能。

Comments Accept by NeuroComputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-05-27 cs.CL cs.AI cs.MA 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20586 2026-05-27 cs.AI cs.LG 62%

PaTAS: A Framework for Trust Propagation in Neural Networks Using Subjective Logic

PaTAS:基于主观逻辑的神经网络信任传播框架

Koffi Ismael Ouattara, Ioannis Krontiris, Theo Dimitrakos, Dennis Eisermann, Houda Labiod, Frank Kargl

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PaTAS框架,利用主观逻辑在神经网络中并行传播信任,通过信任节点和信任函数量化输入、参数和激活的信任,并设计参数信任更新和推理路径信任评估方法,以在对抗或退化条件下提供可解释的信任估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27311 2026-05-27 cs.CL cs.CV 57%

Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

Chartographer: 用于评估视觉语言模型的反事实图表生成

Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Layer 6 AI

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出 Chartographer 框架,通过将图表逆向工程为可执行代码并生成反事实变体,揭示视觉语言模型在图表问答中的视觉推理缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26405 2026-05-27 cs.CL 57%

Towards Just-in-Time Adaptive Feedback: Enhancing Student Learning via Knowledge-Grounded LLM

面向即时自适应反馈:通过知识增强的大语言模型提升学生学习

Younghun Lee, Amir Bralin, Nobel Sanjay Rebello, Dan Goldwasser

机构 * Department of Computer Science(计算机科学系) Department of Physics and Astronomy(物理与天文学系) College of Education(教育学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出一个框架,利用领域专家知识增强大语言模型,在真实教学场景中提供即时自适应反馈,并在大规模大学课程中提升学生成绩超过80%。

Comments 8 pages, Accepted to 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27124 2026-05-27 cs.PL cs.SE 50%

ProDebug: An Automated Debugging System for Prolog

ProDebug:Prolog的自动化调试系统

Ricardo Brancas, Vasco Manquinho, Ruben Martins

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出结合大语言模型、频谱和变异技术的Prolog自动调试系统ProDebug,用于识别学生作业中的错误并生成修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26739 2026-05-27 cs.LO 50%

From Actions to Obligations: A Deontic Action Model Logic

从行动到义务:道义行动模型逻辑

Giorgio Cignarale

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出道义行动模型逻辑(DAML),通过整合道义评估机制扩展认知行动模型逻辑,用于推理多智能体系统中关于行动的义务,并证明其公理化系统的可靠性和完备性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24461 2026-05-27 cs.AR cs.DC cs.SY eess.SY 50%

Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster

一个100兆瓦级AI集群的供应到运行时优化

Ehsan K. Ardestani, Leonardo Piga, Jovan Stojkovic, Pavan Balaji, Mustafa Ozdal, Mikel Jimenez Fernandez, Mihaela Dimovska, Luka Tadic, Hao Shen, Devika Vishwanath, Richa Mishra, Melaku Mihret, Valentin Andrei, Mauricio Cespedes, Julien Prigent, James Monahan, Tyler Graf, Bin Li, Charles Marquez, Shobhit Kanaujia, Kaushik Veeraraghavan, Chunqiang Tang

专题命中 逻辑推理 :planning(abstract)

AI总结 本文首次描述了超大规模AI数据中心从早期电力规划到运行时动态功耗管理的端到端过程,并提供了150兆瓦数据中心中83K GB200 GPU集群的详细功耗测量数据。

详情

展开后加载摘要…

URL PDF HTML 收藏