arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-23 至 2026-04-23 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 10 篇

2604.20090 2026-04-23 cs.CL 88%

Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework

少语言,少令牌:一种高效的统一逻辑跨语言推理框架

Chenyuan Zhang, Qiguang Chen, Xie Chen, Zhuotao Tian, Bowen Xing, Meishan Zhang, Libo Qin, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Central South University(中南大学) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州省教育厅Text Computing and Cognitive Intelligence工程研究中心,贵州大学) University of Science and Technology Beijing(北京科技大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 本文提出UL-XCoT框架,通过减少语言和令牌数量提升跨语言推理效率,实验证明在多语言任务中准确率高且令牌成本降低超50%。

Comments Accepted by ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24765 2026-04-23 cs.AI 88%

Semantic-Aware Logical Reasoning via a Semiotic Framework

通过象征框架实现语义感知的逻辑推理

Yunyao Zhang, Xinglang Zhang, Junxi Sheng, Wenbing Li, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉筹伯大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文提出LogicAgent框架,结合自动推演与反思验证,解决逻辑复杂性与语义复杂性的交互问题,通过RepublicQA基准验证其在抽象命题和逻辑深度上的表现,实现SOTA性能。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20564 2026-04-23 cs.CL 79%

Where Reasoning Breaks: Logic-Aware Path Selection by Controlling Logical Connectives in LLMs Reasoning Chains

推理中逻辑的断裂:通过控制LLM推理链中的逻辑连接词进行逻辑感知路径选择

Seunghyun Park, Yuanyuan Lei

机构 * University of Florida(佛罗里达大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究LLM在多步逻辑推导中的脆弱性,提出通过干预逻辑连接词选择来提升推理准确性,采用多层框架优化逻辑关键节点,实现准确率与效率的平衡。

Journal ref 2026 ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20811 2026-04-23 cs.AI 77%

Diagnosing CFG Interpretation in LLMs

在LLM中诊断CFG解释

Hanqi Li, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) AISpeech Co., Ltd., Suzhou, China(上海AI语音有限公司) Shanghai Innovation Institution, Shanghai, China(上海创新研究所) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 研究LLM在处理新上下文无关文法时能否生成语法正确、行为功能和语义忠实的输出,揭示LLM在语法、行为和语义层面的层次退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16756 2026-04-23 cs.SE cs.AI 70%

Mitigating Prompt-Induced Cognitive Biases in General-Purpose AI for Software Engineering

减轻软件工程通用人工智能中的提示诱导认知偏差

Francesco Sovrano, Gabriele Dominici, Alberto Bacchelli

机构 * Collegium Helveticum at ETH Zurich(ETH苏黎世学院) University of Zurich(苏黎世大学) University of Italian-speaking Switzerland(意大利语瑞士大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究探讨了提示诱导认知偏差对软件工程决策支持系统的影响,通过动态基准测试发现,提示工程未能显著降低偏差敏感性,但引入基于最佳实践的推理方法可平均降低51%的偏差敏感性。

Comments Accepted for publication in the proceedings of FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19856 2026-04-23 cs.AR cs.AI cs.LG 62%

ChipCraftBrain: Validation-First RTL Generation via Multi-Agent Orchestration

ChipCraftBrain: 通过多智能体协调实现验证优先的RTL生成

Cagri Eryilmaz

机构 * Cagri Eryilmaz

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ChipCraftBrain通过多智能体协调和混合符号-神经架构实现验证优先的RTL生成,其核心方法包括自适应协调、混合架构、知识增强生成和分层规格分解,主要贡献是提升了RTL生成的准确性和效率。

Comments 17 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20732 2026-04-23 cs.MA cs.AI cs.CL 62%

Anchor-and-Resume Concession Under Dynamic Pricing for LLM-Augmented Freight Negotiation

基于动态定价的LLM增强货运谈判中的锚定与恢复让步

Hoang Nguyen, Lu Wang, Marta Gaia Bras

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种双指标锚定与恢复框架,解决动态定价下传统让步框架的局限性,通过实时价差推导β参数并保证非递减报价,实验证明其在不同价差情况下均能提升谈判效率与收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20136 2026-04-23 cs.CV cs.AI 57%

IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory

IMPACT-CYCLE:一种基于合同的多智能体系统,用于长视频语义记忆的层次级监督修正

Weitong Kong, Di Wen, Kunyu Peng, David Schneider, Zeyun Zhong, Alexander Jaus, Zdravko Marinov, Jiale Wei, Ruiping Liu, Junwei Zheng, Yufan Chen, Lei Qi, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) INSAIT ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IMPACT-CYCLE,通过多智能体系统实现长视频语义记忆的层次级监督修正,提升下游推理性能并降低人工仲裁成本。

Comments 7 pages, 2 figures, code are available at https://github.com/MKong17/IMPACT_CYCLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20719 2026-04-23 cs.SD cs.AI cs.MM eess.AS 57%

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

ONOTE:面向专家级音乐智能的多模态记谱处理基准测试

Menghe Ma, Siqing Wei, Yuecheng Xing, Yaheng Wang, Fanhong Meng, Peijun Han, Luu Anh Tuan, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10386 2026-04-23 cs.LG 57%

Colorful Talks with Graphs: Human-Interpretable Graph Encodings for Large Language Models

图的丰富多彩对话:用于大语言模型的人类可解释图编码

Angelo Zangari, Peyman Baghershahi, Sourav Medya

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种将图结构直接注入自然语言提示的编码策略,通过将图结构转换为人类可理解的颜色标记,提升大语言模型处理图任务的能力,实验显示在合成和真实数据集上均取得显著改进。

Comments Accepted to ACL Findings 2026 22 pages, 18 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏