arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3033 篇

2602.18514 2026-02-24 cs.CR cs.AI 83%

Trojan Horses in Recruiting: A Red-Teaming Case Study on Indirect Prompt Injection in Standard vs. Reasoning Models

招聘中的木马:针对标准与推理模型间接提示注入的红队案例研究

Manuel Wirth

机构 * University of Mannheim(曼海姆大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究通过红队测试揭示了标准与推理模型在间接提示注入中的安全差异,发现推理模型在复杂指令下易出现元认知泄漏,而标准模型在简单攻击中表现较弱。

Comments 43 pages, 3 synthetic CV PDF's, 6 chat history PDF's and system prompts. This work was developed as part of the Responsible AI course within the Mannheim Master in Data Science (MMDS) program at the University of Mannheim

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18095 2026-02-23 cs.AI 83%

Neurosymbolic Language Reasoning as Satisfiability Modulo Theory

神经符号语言推理作为可满足性模理论

Hyunseok Oh, Sam Stern, Youngki Lee, Matthai Philipose

机构 * Seoul National University(首尔国立大学) U. Mass. Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft(微软公司)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 Logitext通过结合LLM和SMT求解,实现自然语言与逻辑推理的联合处理,提升内容审核和法律任务的准确性和覆盖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04108 2026-02-23 cs.CL 83%

Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models

批量提示抑制约束下的过度推理:如何通过批量提示抑制推理模型中的过度推理

Saurabh Srivastava, Janit Bidhan, Hao Yan, Abhishek Dey, Tanu Kansal, Paras Kath, Sina Mansouri, Mohit Marvania, Vamsi Shankar Simhadri, Gaurav Singh

机构 * George Mason University(乔治·马歇尔大学) Google(谷歌) eBay

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 批量提示通过减少推理标记和抑制过度推理行为,提升推理模型的效率和可靠性。

Comments New version with updated author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01208 2026-02-03 cs.CL 83%

Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling

Chronos: 学习推理链的时序动态以实现测试时扩展

Kai Zhang, Jiayi Liao, Chengpeng Li, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 Chronos通过学习推理链的时序动态,提升大语言模型在测试时的推理性能,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23085 2026-02-02 cs.IR cs.AI 83%

OrLog: Resolving Complex Queries with LLMs and Probabilistic Reasoning

OrLog:利用LLM和概率推理解决复杂查询

Mohanna Hoveyda, Jelle Piepenbrock, Arjen P de Vries, Maarten de Rijke, Faegheh Hasibi

机构 * Radboud University(拉德堡德大学) Eindhoven University of Technology(埃因霍温理工大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 OrLog通过结合LLM和概率推理,实现约束感知的高效检索,提升查询精度并减少token消耗。

Comments Accepted to ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22312 2026-02-02 cs.LG cond-mat.mtrl-sci cs.CE 83%

SCALAR: Quantifying Structural Hallucination, Consistency, and Reasoning Gaps in Materials Foundation Models

SCALAR:量化材料基础模型中的结构幻觉、一致性和推理差距

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Texas A\&M University, College Station, TX, USA(德克萨斯A&M大学) Ankara University, Ankara, Turkey(安卡拉大学) Texas A\&M University at Qatar, Doha, Qatar(德克萨斯A&M大学多哈分校) Hamad Bin Khalifa University, Doha, Qatar(哈马德·本·卡西姆大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 SCALAR基准通过评估几何尺度泛化与材料基础模型中结构幻觉、一致性和推理的关系,揭示了大语言模型在材料科学推理中的性能局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21981 2026-02-02 cs.AI cs.MA 83%

Collaborative Belief Reasoning with LLMs for Efficient Multi-Agent Collaboration

基于LLM的协同信念推理用于高效多智能体协作

Zhimin Wang, Duo Wu, Shaokang He, Jinghe Wang, Linjia Kang, Jing Yu, Kai Zhu, Jiawei Li, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Huawei Tenchnologies Co., Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 CoBel-World通过协同信念世界框架,提升LLM多智能体协作的效率和人类化表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21210 2026-01-30 cs.AI 83%

Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification

通过符号验证揭示LLM因果推理中的隐藏正确性

Paul He, Yinya Huang, Mrinmaya Sachan, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统研究所) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出DoVerifier,通过符号验证揭示LLM因果推理中的隐藏正确性,提升因果推理评估的严谨性与信息量。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12995 2026-01-21 cs.CL 83%

Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models

图推理范式:基于拓扑感知强化学习的结构化和符号推理用于大语言模型

Runxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang, Jiafeng Liang, Jiaqi Li, Tao He, Zheng Chu, Rongchuan Mu, Zekun Wang, Baoxin Wang, Dayong Wu, Ming Liu, Shijin Wang, Guoping Hu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Tianjin Normal University(天津师范大学) Pengcheng Laboratory(鹏城实验室)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 图推理范式通过拓扑感知强化学习实现结构化和符号推理,提升大语言模型的数学推理和代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08412 2026-01-14 cs.AI 83%

Hybrid Distillation with CoT Guidance for Edge-Drone Control Code Generation

混合指导的蒸馏用于边缘-无人机控制代码生成

Yizhan Feng, Hichem Snoussi, Yuhang Wang, Jing Teng, Abel Cherouat, Tian Wang

专题命中 逻辑推理 :CoT(title);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出混合指导的蒸馏方法,通过知识蒸馏、思维链指导和监督微调,提升UAV多SDK控制任务的代码生成效率与准确性。

Comments 2nd International Conference on Drones and Unmanned Systems (DAUS' 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07754 2026-01-13 cs.CL 83%

Structure First, Reason Next: Enhancing a Large Language Model using Knowledge Graph for Numerical Reasoning in Financial Documents

先结构,再推理:利用知识图谱增强大型语言模型进行财务文档中的数值推理

Aryan Mishra, Akash Anil

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出利用知识图谱增强大型语言模型,以提高财务文档中的数值推理能力,实验表明该方法在准确性上提升了约12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11529 2026-01-09 cs.CL 83%

Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models

通过内部状态和结构化推理一致性检测大语言模型中的幻觉

Yusheng Song, Lirong Qiu, Xi Zhang, Zhihao Tang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 通过内部状态和结构化推理一致性检测大语言模型中的幻觉,提出统一框架解决检测困境,提升事实和逻辑任务的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14540 2026-01-08 cs.AI 83%

VERUS-LM: a Versatile Framework for Combining LLMs with Symbolic Reasoning

VERUS-LM:一种结合大语言模型与符号推理的多功能框架

Benjamin Callewaert, Simon Vandevelde, Joost Vennekens

机构 * Leuven.AI -- KU Leuven Institute for AI(Leuven.AI — 哥伦比亚大学莱顿人工智能研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 VERUS-LM通过结合大语言模型与符号推理,提升复杂推理任务的适应性与效率,实现更广泛的推理能力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 47-62

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12897 2026-01-01 cs.AI cs.CR 83%

RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models

RAJ-PGA:基于推理激活和原则引导对齐的大型推理模型安全对齐框架

Jianhao Chen, Mayi Xu, Haoyang Chen, Xiaohu Li, Xiangyu Zhang, Jianjie Huang, Zheng Wang, Xiaochun Cao, Tieyun Qian

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络安全学院) School of Cybersecurity and Technology, Sun Yat-sen University(中山大学网络安全学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 RAJ-PGA框架通过推理激活和原则引导对齐方法,提升大型推理模型的安全性,减少有害推理链的影响,同时保持模型推理能力。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03272 2025-12-04 cs.AI 83%

When Do Symbolic Solvers Enhance Reasoning in Large Language Models?

符号求解器在大语言模型中增强推理何时有效?

Zhiyuan He, Dingmin Wang

机构 * University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究符号求解器如何在大语言模型中增强推理,发现其在需要有限隐式推理但具有充足搜索空间的问题中表现优异,尤其在约束满足问题中提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17238 2025-12-03 cs.LG 83%

Training a Scientific Reasoning Model for Chemistry

为化学训练一个推理模型

Siddharth M. Narayanan, James D. Braza, Ryan-Rhys Griffiths, Albert Bou, Geemi Wellawatte, Mayk Caldas Ramos, Ludovico Mitchener, Samuel G. Rodriques, Andrew D. White

机构 * FutureHouse Inc.(FutureHouse公司)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出了一种基于强化学习的推理模型,用于化学领域,能高效处理多种化学任务,超越现有模型和人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12312 2025-11-20 cs.CL 83%

Socrates or Smartypants: Testing Logic Reasoning Capabilities of Large Language Models with Logic Programming-based Test Oracles

Zihao Xu, Junchen Ding, Yiling Lou, Kun Zhang, Dong Gong, Yuekang Li

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12485 2025-11-18 cs.AI 83%

ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction

Pengze Li, Jiaqi Liu, Junchi Yu, Lihao Liu, Mingyu Ding, Wanli Ouyang, Shixiang Tang, Xi Chen

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11751 2025-11-18 cs.CV cs.AI cs.MA 83%

Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models

Sanchit Sinha, Guangzhi Xiong, Zhenghao He, Aidong Zhang

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

Comments AAAI 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09457 2025-10-15 cs.CL 83%

A Survey of Multilingual Reasoning in Language Models

Akash Ghosh, Debayan Datta, Sriparna Saha, Chirag Agarwal

机构 * Indian Institute of Technology Patna(印度理工学院帕纳巴分校) University of Virginia(弗吉尼亚大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19927 2025-10-14 cs.AI 83%

TCP: a Benchmark for Temporal Constraint-Based Planning

Zifeng Ding, Sikuan Yan, Zhangdie Yuan, Xianglong Hu, Fangru Lin, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) LMU Munich(慕尼黑大学) Amazon(亚马逊公司) University of Oxford(牛津大学)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06774 2025-10-09 cs.CL 83%

Adaptive LLM-Symbolic Reasoning via Dynamic Logical Solver Composition

Lei Xu, Pierre Beckmann, Marco Valentino, André Freitas

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(联邦理工学院洛桑分校) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01479 2025-10-07 cs.CL 83%

Deliberate Planning in Language Models with Symbolic Representation

Siheng Xiong, Zhangding Liu, Jieyu Zhou, Yusen Su

机构 * Georgia Institute of Technology, Atlanta, GA 30332 USA(佐治亚理工学院)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

Comments Accepted to Twelfth Annual Conference on Advances in Cognitive Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17978 2025-09-29 cs.AI cs.LO 83%

The STAR-XAI Protocol: A Framework for Inducing and Verifying Agency, Reasoning, and Reliability in AI Agents

Antoni Guasch, Maria Isabel Valdez

机构 * Ixent Games

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

Comments Version 2: This article consolidates and replaces a previous version to present the complete research in a single, comprehensive manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12935 2025-09-23 cs.CL cs.MM cs.SD eess.AS 83%

SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models

Xingjian Diao, Chunhui Zhang, Keyi Kong, Weiyi Wu, Chiyu Ma, Zhongyu Ouyang, Peijun Qing, Soroush Vosoughi, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) Shandong University(山东大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11176 2025-09-18 cs.CL 83%

LogiDynamics: Unraveling the Dynamics of Inductive, Abductive and Deductive Logical Inferences in LLM Reasoning

Tianshi Zheng, Jiayang Cheng, Chunyang Li, Haochen Shi, Zihao Wang, Jiaxin Bai, Yangqiu Song, Ginny Y. Wong, Simon See

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00971 2025-09-04 cs.AI 83%

CoreThink: A Symbolic Reasoning Layer to reason over Long Horizon Tasks with LLMs

Jay Vaghasiya, Omkar Ghugarkar, Vishvesh Bhat, Vipul Dholaria, Julian McAuley

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00276 2025-09-03 cs.CL 83%

Exploring Reasoning-Infused Text Embedding with Large Language Models for Zero-Shot Dense Retrieval

Yuxiang Liu, Tian Wang, Gourab Kundu, Tianyu Cao, Guang Cheng, Zhen Ge, Jianshu Chen, Qingjun Cui, Trishul Chilimbi

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15849 2025-08-25 cs.CL cs.IR 83%

MedCoT-RAG: Causal Chain-of-Thought RAG for Medical Question Answering

Ziyu Wang, Elahe Khatibi, Amir M. Rahmani

机构 * University of California, Irvine(加州大学 Irvine 分校)

专题命中 逻辑推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09784 2025-08-14 cs.AI cs.CC cs.LO 83%

Reasoning About Knowledge on Regular Expressions is 2EXPTIME-complete

Avijeet Ghosh, Sujata Ghosh, François Schwarzentruber

机构 * Chennai Mathematical Institute Chennai, India(钦奈数学研究所(钦奈,印度)) Indian Statistical Institute Chennai, India(印度统计研究所(钦奈,印度)) ENS De Lyon France(里昂高等师范学院(法国))

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

Comments Accepted in KR 25

详情

展开后加载摘要…

URL PDF HTML 收藏