arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 13 篇

2604.17819 2026-04-21 cs.CL cs.AI 86%

PDDL-Mind: Large Language Models are Capable on Belief Reasoning with Reliable State Tracking

PDDL-Mind:大型语言模型在具有可靠状态跟踪的信念推理中表现出色

Wang Bill Zhu, Qiutong Tony Yi, Robin Jia, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 PDDL-Mind通过将叙述描述转换为显式状态和动作,为LLM提供了一致的世界状态表示,从而在信念推理任务中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02871 2026-04-21 cs.CL cs.AI 81%

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning

位置:多模态大语言模型可以显著推动科学推理

Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨多模态大语言模型在科学推理中的应用,提出四阶段研究路线,指出当前模型在跨领域推理中的潜力与挑战,为实现通用人工智能提供新视角。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00430 2026-04-21 cs.AI 79%

MIRROR: Converging Cognitive Principles as Computational Mechanisms for AI Reasoning

MIRROR:将认知原则转化为AI推理的计算机制

Nicole Hsing

机构 * arcarae

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MIRROR通过将人类认知原理转化为计算机制,提升了多轮对话中在注意力干扰下的约束维持能力,验证了平行处理与整合合成的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12950 2026-04-21 cs.AI 79%

NumCoKE: Ordinal-Aware Numerical Reasoning over Knowledge Graphs with Mixture-of-Experts and Contrastive Learning

NumCoKE: 基于混合专家和对比学习的图知识中有序意识数值推理

Ming Yin, Zongsheng Cao, Qiqing Xia, Chenyang Tu, Neng Gao

机构 * State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Department of Information Science, Tsinghua University(清华大学信息学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出NumCoKE框架,通过混合专家和对比学习解决知识图谱中数值推理的语义整合不足和有序区分困难问题,实验表明其在不同属性分布下表现优越。

Comments Update

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17225 2026-04-21 cs.CL 77%

A Multi-Agent Approach for Claim Verification from Tabular Data Documents

从表格数据文档中验证声明的多智能体方法

Rudra Ranajee Saha, Laks V. S. Lakshmanan, Raymond T. Ng

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MACE,通过规划器、执行器和验证器三个智能体,实现可解释的表格数据验证,实验显示其在多个数据集上达到SOTA性能,且在参数较少时仍表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06328 2026-04-21 cs.AI 70%

C-World: A Computer Use Agent Environment Creator

C-World:一个计算机使用代理环境创建者

Ziqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou

机构 * UC San Diego(UC圣迭戈大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 C-World通过四个组件构建代理环境,解决LLM代理在规划和推理中与人类的差距问题,展示其作为评估环境和数据引擎的双重价值。

Comments Submitted to ACL 2026 12 pages, 4 figures Ziqiao Xi and Shuang Liang contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17475 2026-04-21 cs.AI cs.CL cs.LG 67%

Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception

觉醒失明:为基于视觉感知的代理轨迹进行无监督的冷启动优化

Ashutosh Bajpai, Tamal Majumder, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎比) Microsoft Research(微软研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SPECTRA框架,通过冷启动强化学习提升小视觉语言模型的视觉鲁棒性和工具协调能力,无需监督即可提高任务准确性和工具效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18052 2026-04-21 cs.CR cs.AI cs.LG 62%

ExAI5G: A Logic-Based Explainable AI Framework for Intrusion Detection in 5G Networks

ExAI5G:一种用于5G网络入侵检测的基于逻辑的可解释人工智能框架

Saeid Sheikhi, Panos Kostakos, Lauri Loven

机构 * organization= Faculty of Information Technology Electrical Engineering, University of Oulu , addressline= , city= Oulu , postcode= 90570 , state= , country= Finland

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExAI5G框架,结合Transformer深度学习与逻辑可解释AI技术,实现高精度且透明的入侵检测,通过逻辑规则提取和解释评估方法,达到99.9%准确率和0.854宏F1分数,展示出模型推理的透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16871 2026-04-21 cs.AI cs.LG 62%

GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning

GRAIL:自主概念 grounding 用于神经符号强化学习

Hikaru Shindo, Henri Rößler, Quentin Delfosse, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) Google Intrinsic(谷歌内在) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GRAIL通过环境交互自主 grounding 关系概念,利用大语言模型提供弱监督,提升在稀疏奖励和概念对齐问题中的性能,实验显示其在Atari游戏中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17988 2026-04-21 cs.CL 57%

Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

利用通用和生物医药大语言模型与先进提示工程进行药事流行病学研究设计

Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero, Francesco Paolo Speca, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文比较通用和生物医药大语言模型在药事流行病学研究设计中的表现,发现通用模型在相关性和逻辑性上表现更优,但提示策略对模型性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11182 2026-04-21 cs.CL 57%

MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization

MetaMem: 通过自反思符号优化实现元记忆的进化以促进知识利用

Haidong Xin, Xinze Li, Zhenghao Liu, Yukun Yan, Shuo Wang, Cheng Yang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MetaMem框架,通过自反思符号优化增强记忆系统,帮助LLM更有效地利用记忆知识。实验表明,MetaMem在多个任务中显著优于基线模型,提升超过3.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17142 2026-04-21 cs.MA 50%

Logic-Based Verification of Task Allocation for LLM-Enabled Multi-Agent Manufacturing Systems

基于逻辑的任务分配验证在LLM赋能的多智能体制造系统中

Jonghan Lim, Mostafa Tavakkoli Anbarani, Rômulo Meira-Góes, Ilya Kovalenko

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出一种利用大语言模型灵活性并保持安全性的控制架构,通过时序逻辑和离散事件系统验证任务分配,通过多机器人装配案例证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV 50%

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏