arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-02 至 2026-07-02 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 11 篇

2511.17673 2026-07-02 cs.AI cs.CL 84%

Bridging Symbolic Control and Neural Reasoning in LLM Agents -- The Structured Cognitive Loop

连接符号控制与神经推理的LLM代理——结构认知循环

Myung Ho Kim

机构 * JEI University(JEI大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结构认知循环(SCL)架构,通过分离检索、认知、控制、行动和记忆模块,解决LLM代理的推理与执行纠缠、记忆波动和行动序列失控问题,实现零策略违规、防止冗余调用并保持决策可追溯性。

Comments This update clarifies the theoretical architecture by separating Regulation as the Soft Symbolic Control layer from Control as a deterministic runtime engine, while adding explicit discussion of how the current implementation should be interpreted in light of that distinction

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06160 2026-07-02 cs.AI cs.CL cs.CY 版本更新 84%

Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles

通过逻辑网格谜题评估LLM推理中的隐性偏见

Fatima Jahara, Mark Dredze, Sharon Levy

机构 * Rutgers University(罗格斯大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIME框架,利用逻辑网格谜题系统探测LLM在复杂推理中受社会刻板印象的影响,发现模型在解与刻板印象一致时推理更准确。

Comments 26 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04694 2026-07-02 cs.CL cs.AI 版本更新 81%

Reasoning Up the Instruction Ladder for Controllable Language Models

在指令阶梯上推理以实现可控语言模型

Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Microsoft Research(微软研究院) Allen Institute for AI(艾伦人工智能研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过将指令层级解析重构为推理任务,并构建VerIH数据集进行轻量级强化学习,使模型能优先处理高层级指令,在冲突场景下提升约20%的指令遵循准确率,并增强对越狱和提示注入的鲁棒性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 39332-39354

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 78%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 78%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00342 2026-07-02 eess.SP 新提交 75%

Semantic-based Internet of Embodied Intelligence: Visions and Frontiers

基于语义的具身智能物联网:愿景与前沿

Yaheng Wang, Rui Meng, Xiaodong Xu, Yiming Liu, Feiliang Song, Linyuan Hu, Huishi Song, Lexi Xu, Tony Q. S. Quek, Ping Zhang

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)

AI总结 提出基于语义的具身智能物联网(SIoEI),通过语义信息统一度量解决多智能体网络中的多模态数据传输开销和逻辑推理与物理约束解耦问题,并验证其在信道鲁棒性和端到端延迟方面的优势。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00447 2026-07-02 cs.CL 新提交 74%

Understanding Why Language Models Hallucinate: Testing Reasoning Against Priors

理解语言模型为何产生幻觉:针对先验知识的推理测试

Yangfan Hu, Xuhan Tong, Haoyue Bai, Xi Ding, Shashank Muralidhar Bharadwaj, Siyang Cao, Robert Nowak, Jiawei Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL

AI总结 本文提出推理错位假说,认为幻觉源于模型偏向统计显著的潜在关联而非遵循提示约束,并通过TrapQA测试集验证了两种偏差模式。

Comments Project page: https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新 70%

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00924 2026-07-02 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 新提交 67%

Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination

图原生强化学习通过概念重组实现可追溯的科学假设生成

Subhadeep Pal, Shashwat Sourav, Tirthankar Ghosal, Markus J. Buehler

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出图原生推理模型Graph-PRefLexOR,结合GRPO强化学习将推理组织为显式阶段,在材料科学100个开放问题上推理可追溯性提升40-65%,语义多样性增加2-3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01188 2026-07-02 cs.AI cond-mat.mtrl-sci 新提交 57%

Optimal Resource Utilization for Autonomous Laboratory Orchestrators

自主实验室协调器的最优资源利用

Austin McDannald, Julia Tisaranni, Howie Joress

机构 * National Institute of Standards and Technology(美国国家标准与技术研究院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 针对自主实验室中多仪器硬件约束下的资源利用问题,提出两步法:先用约束规划找到最小化总时间的最优调度,再通过状态依赖系统鲁棒执行调度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01006 2026-07-02 cs.CL 新提交 57%

Understanding Large Language Models

理解大型语言模型

Yannik Keller, Thomas Eisenmann

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文综述大型语言模型(LLM)的机制、涌现能力及与人类认知的关系,通过分析注意力机制、符号推理、心智理论等证据,探讨LLM是否真正理解语言,并反对过度简化的人机认知差异观点。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏