arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-16 至 2026-04-16 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 12 篇

2601.02902 2026-04-16 cs.AI cs.CL cs.LO 91%

Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning

逻辑相变:理解大语言模型逻辑推理中的崩溃

Xinglang Zhang, Yunyao Zhang, ZeLiang Chen, Junqing Yu, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过控制逻辑复杂性分析大语言模型的逻辑推理性能,发现逻辑相变现象,提出神经符号课程调优框架以提升高复杂度下的推理能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13065 2026-04-16 cs.CL cs.AI cs.LO 85%

Correct Chains, Wrong Answers: Dissociating Reasoning from Output in LLM Logic

正确推理,错误答案:分离LLM中的推理与输出

Abinav Rao, Sujan Rachuri, Nikhil Vemuri

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI;logical reasoning(comments)

AI总结 本文提出新型操作测试基准,区分操作逻辑与名称,揭示LLM在深度推理中存在策略与内容两类失败模式,验证名称不决定推理能力。

Comments 9 pages, 4 figures. ICLR 2026 Workshop on Logical Reasoning of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13993 2026-04-16 cs.AI cs.CL cs.CV 81%

Reward Design for Physical Reasoning in Vision-Language Models

用于视觉语言模型中物理推理的奖励设计

Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了奖励设计对视觉语言模型物理推理的影响,通过对比不同奖励信号发现,基于准确性的奖励在多数领域表现最佳,而基于注意力权重的奖励提升了空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13759 2026-04-16 cs.AI cs.LG 81%

The cognitive companion: a lightweight parallel monitoring architecture for detecting and recovering from reasoning degradation in LLM agents

认知伙伴:一种轻量级并行监控架构,用于检测和从LLM代理的推理退化中恢复

Rafflesia Khan, Nafiul Islam Khan

机构 * IBM Dublin(IBM都柏林) Citi Polytechnic Institute Khulna(基蒂理工学院库尔纳)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出认知伙伴,一种轻量级并行监控架构,用于检测和恢复LLM代理的推理退化。通过实验验证了其在不同任务类型中的有效性,并指出任务类型依赖性和潜在的规模限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14051 2026-04-16 cs.IR 71%

Enhancing Local Life Service Recommendation with Agentic Reasoning in Large Language Model

通过大语言模型中的代理推理增强本地生活服务推荐

Shiteng Cao, Xiaochong Lan, Yuwei Du, Jie Feng, Yinxing Liu, Xinlei Shi, Yong Li

专题命中 逻辑推理 :reasoning(title)

AI总结 本文提出一种联合预测生活需求和服务推荐的框架,通过行为聚类和强化学习提升推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13979 2026-04-16 cs.CL cs.AI cs.DB 62%

Leveraging LLM-GNN Integration for Open-World Question Answering over Knowledge Graphs

利用LLM-GNN集成进行知识图谱上的开放世界问答

Hussein Abdallah, Ibrahim Abdelaziz, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科迪亚大学) IBM KAUST(科威特大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GLOW系统,结合预训练GNN和LLM进行开放世界知识图谱问答,通过结构化提示引导LLM推理,提升多跳推理和缺失链接处理能力,在GLOW-BENCH基准上取得显著提升。

Comments 18 pages,6 figures,10 tables. https://aclanthology.org/2026.eacl-long.26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13107 2026-04-16 cs.SE cs.AI cs.LG 62%

Can Coding Agents Be General Agents?

编码代理可以是通用代理吗?

Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

机构 * Agentic Labs

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨编码代理能否实现端到端业务流程自动化,发现其在简单任务上表现可靠,但在复杂任务上存在瓶颈,指出领域逻辑与代码执行的衔接是通用性关键障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 57%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13346 2026-04-16 cs.CL 57%

AgentSPEX: An Agent SPecification and EXecution Language

AgentSPEX:一种代理规范与执行语言

Pengcheng Wang, Jerry Huang, Jiarui Yao, Rui Pan, Peizhi Niu, Yaowenqi Liu, Ruida Wang, Renhao Lu, Yuwei Guo, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Baylor College of Medicine(贝勒医学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AgentSPEX,一种用于定义LLM代理工作流的显式控制流和模块化结构的语言,支持类型步骤、分支、循环、并行执行和显式状态管理,并提供可定制的代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 57%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19378 2026-04-16 cs.CL 57%

TableMaster: A Recipe to Advance Table Understanding with Language Models

TableMaster: 一种提升语言模型表格理解能力的方案

Lang Cao, Hanbing Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TableMaster方案,通过提取表格内容并增强语义上下文,结合自适应推理方法,提升语言模型对表格数据的理解能力,实验表明其在WikiTQ数据集上准确率达78.13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14044 2026-04-16 cs.CV 50%

Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models

解读Delta:利用多模态大语言模型统一遥感变化检测与理解

Xiaohe Li, Jiahao Li, Kaixin Zhang, Yuqiang Fang, Leilei Lin, Hong Wang, Haohua Wu, Zide Fan

机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) Space Engineering University(航天工程大学) Capital Normal University(首都师范大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏