arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3005 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3005 篇

2401.09042 2024-01-18 cs.AI cs.CL 84%

LLMs for Relational Reasoning: How Far are We?

Zhiming Li, Yushi Cao, Xiufeng Xu, Junzhe Jiang, Xu Liu, Yon Shin Teo, Shang-wei Lin, Yang Liu

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Accepted by The First International Workshop on Large Language Models for Code (ICSE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13455 2023-11-23 cs.AI cs.CL 84%

Generation of Explanations for Logic Reasoning

Yanyi Pu

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments 78 Pages, 16 Figures, Thesis Presentation is available at https://drive.google.com/file/d/1wLIBsjfLvO11PjCS6qx4Y9UgRBUfq3wQ/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07582 2023-11-15 cs.CL cs.AI 84%

Evaluating the Potential of Leading Large Language Models in Reasoning Biology Questions

Xinyu Gong, Jason Holmes, Yiwei Li, Zhengliang Liu, Qi Gan, Zihao Wu, Jianli Zhang, Yusong Zou, Yuxi Teng, Tian Jiang, Hongtu Zhu, Wei Liu, Tianming Liu, Yajun Yan

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07696 2023-07-18 cs.CL cs.AI cs.SC 84%

Coupling Large Language Models with Logic Programming for Robust and General Reasoning from Text

Zhun Yang, Adam Ishay, Joohyung Lee

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 32 pages, Findings of the Association for Computational Linguistics: ACL 2023, 5186-5219

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14325 2023-06-29 cs.AI cs.LG 84%

The Neuro-Symbolic Inverse Planning Engine (NIPE): Modeling Probabilistic Social Inferences from Linguistic Inputs

Lance Ying, Katherine M. Collins, Megan Wei, Cedegao E. Zhang, Tan Zhi-Xuan, Adrian Weller, Joshua B. Tenenbaum, Lionel Wong

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

Comments To appear at ICML Workshop on Theory of Mind in Communicating Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12567 2023-06-23 cs.CL cs.AI 84%

Evaluating Large Language Models with NeuBAROCO: Syllogistic Reasoning Ability and Human-like Biases

Risako Ando, Takanobu Morishita, Hirohiko Abe, Koji Mineshima, Mitsuhiro Okada

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments To appear in Proceedings of the 4th Natural Logic Meets Machine Learning Workshop (NALOMA IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09743 2023-02-17 cs.AI cs.LG 84%

Teaching Pretrained Models with Commonsense Reasoning: A Preliminary KB-Based Approach

Shiyang Li, Jianshu Chen, Dian Yu

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12598 2022-11-09 cs.CL cs.LG cs.LO 84%

RobustLR: Evaluating Robustness to Logical Perturbation in Deductive Reasoning

Soumya Sanyal, Zeyi Liao, Xiang Ren

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

Comments Accpeted at EMNLP 2022, code available at https://github.com/INK-USC/RobustLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.11473 2022-10-25 cs.CL cs.AI cs.SC 84%

Reasoning Like Program Executors

Xinyu Pi, Qian Liu, Bei Chen, Morteza Ziyadi, Zeqi Lin, Qiang Fu, Yan Gao, Jian-Guang Lou, Weizhu Chen

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments To appear in EMNLP 2022 main conference. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.14230 2021-05-17 cs.AI cs.CV cs.LG 84%

Abstract Spatial-Temporal Reasoning via Probabilistic Abduction and Execution

Chi Zhang, Baoxiong Jia, Song-Chun Zhu, Yixin Zhu

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

Comments CVPR 2021 paper. Supplementary: http://wellyzhang.github.io/attach/cvpr21zhang_prae_supp.pdf Project: http://wellyzhang.github.io/project/prae.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.08129 2021-05-04 cs.IR cs.AI cs.LG cs.SC 84%

Neural Collaborative Reasoning

Hanxiong Chen, Shaoyun Shi, Yunqi Li, Yongfeng Zhang

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted to the 30th Web Conference (WWW 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04371 2026-05-22 cs.AI 84%

Cumulative Reasoning with Large Language Models

基于大语言模型的累积推理

Yifan Zhang, Jingqin Yang, Yang Yuan, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种名为累积推理(CR)的框架,通过模拟人类的迭代和累积思维过程,增强大语言模型(LLM)的问题解决能力。CR通过分解任务、生成并验证中间推理步骤,构建动态有向无环图(DAG)来组成解决方案,从而在逻辑推理、24点游戏和数学问题等任务中取得了显著的性能提升。

Comments Published in Transactions on Machine Learning Research (TMLR). Project Page: https://github.com/iiis-ai/cumulative-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02208 2026-03-03 cs.CL 84%

Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training

Reasoning Core:一个可扩展的程序化数据生成套件,用于符号预训练和后训练

Valentin Lacombe, Valentin Quesnel, Damien Sileo

机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工大学、UMR 9189 - CRIStAL)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 Reasoning Core 提出了一种可扩展的程序化数据生成套件,用于符号预训练和后训练,通过生成多样化的符号推理数据提升语言模型的推理能力。

Comments Keywords: LLMs, NLP, Dataset, Corpus, Procedural Pre-training, Reasoning, Logic, Formal Semantics https://github.com/sileod/reasoning_core

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21252 2026-07-01 cs.CV 新提交 83%

A Neurosymbolic Framework for Interpretable Skeleton-Based Seizure Detection via Concept-Driven Logical Reasoning

一种基于概念驱动逻辑推理的可解释骨架癫痫检测的神经符号框架

Talha Ilyas, Deval Mehta, Zongyuan Ge

机构 * Monash University(莫纳什大学)

专题命中 逻辑推理 :reasoning(title);logical reasoning(title)

AI总结 提出首个神经符号框架用于视频癫痫检测,通过概念驱动逻辑推理实现可解释性,在SAHZU和IEEE基准上分别达到89.78%和85.27%的灵敏度,误检率低至0.06和0.09次/小时。

Comments Accepted to MICCAI 2026 (Early Accept: top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10843 2026-08-12 cs.AI 新提交 83%

Hypothesis Frontier: Verifier Guided LLM and Symbolic Search for First-Order Induction

假设前沿:验证器引导的大语言模型与符号搜索用于一阶归纳

Serafim Batzoglou

专题命中 逻辑推理 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本研究提出Hypothesis Frontier框架,结合LLM与符号搜索,在匹配条件下比重复原始提示生成解决更多一阶归纳问题,还可简化所得公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00417 2026-08-11 cs.AI 版本更新 83%

SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs

SymboUQ:面向大语言模型空间推理的符号化不确定性量化框架

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 SymboUQ是面向LLMs空间推理的符号化不确定性量化框架,通过区分可符号性与语义确定性,整合三类分数估计最终答案可靠性,在五个空间推理基准的四个冻结LLM骨干上,使AUROC相对提升约8%、Brier损失相对降低7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04902 2026-08-11 cs.LG 版本更新 83%

Are Latent Reasoning Models Easily Interpretable?

潜在推理模型是否易于解释?

Connor Dilgren, Sarah Wiegreffe

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文研究了潜在推理模型的可解释性,发现其推理令牌往往不必要,且可通过解码自然语言推理轨迹验证预测正确性,表明当前LRMs主要编码可解释过程。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06397 2026-08-10 cs.PL cs.AI cs.SE 新提交 83%

Agentic Planning for Symbolic Execution

符号执行的智能体规划

Daniel Koh Ji Yang, Yannic Noller, Corina S. Pasareanu, Youcheng Sun

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究提出智能体规划系统Agolic,利用早期符号执行运行的证据配置后续有界符号执行,在C/C++程序上平均覆盖3倍以上分支,覆盖更多分支及对比语料库未覆盖的分支,扩展了符号执行的实际覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06076 2026-08-10 cs.AI cs.CV 版本更新 83%

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

通过模态差距感知自蒸馏从符号状态学习视觉空间规划

Haocheng Luo, Jiahui Liu, Ruicheng Zhang, Zhizhou Zhong, Jiaqi Huang, Zunnan Xu, Quan Shi, Jun Zhou, Shuiyang Mao, Wei Liu, Xiu Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。

Comments 18 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00285 2026-08-06 cs.CL 版本更新 83%

Enhancing Trustworthy Clinical Diagnosis Decision-Making in Large Language Models via Etiology-Aware Attention Supervision

通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性

Peixian Li, Yu Tian, Ruiqi Tu, Chengkai Wu, Jingjing Ren, Jingsong Li

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03506 2026-08-05 cs.AI stat.ML 新提交 83%

When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

当存在多个有效答案时,投票会失效:针对大语言模型中K选1最佳因果推理的符号验证

Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong Yin, Nhat Ho

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 针对大语言模型因果推理中多有效答案下投票失效的问题,提出无需训练的符号验证器CALVER,在CLEAR数据集等场景下显著提升了推理选择准确率。

Comments 28 pages, 5 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23541 2026-07-29 cs.CL 版本更新 83%

Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning

Med-R$^3$:通过渐进强化学习增强LLMs的医学检索增强推理

Keer Lu, Zheng Liang, Youquan Li, Jiejun Tan, Da Pan, Shusen Zhang, Guosheng Dong, Bin Cui, Yunhuai Liu, Wentao Zhang

机构 * Peking University(北京大学) Baichuan Inc.(北川科技公司)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 Med-R$^3$ 通过渐进强化学习提升医疗场景下LLMs的检索增强推理能力,实现检索与推理的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22571 2026-07-28 cs.AI 新提交 83%

SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs

SCAIR:用于企业知识图谱的模式条件代理迭代推理

Prateek Chaturvedi, Yuqicheng Zhu, Hongkuan Zhou, Dongzhuoran Zhou, Yunjie He, Steffen Staab, Fei Du, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学) University of Southampton(南安普顿大学) BSH Home Applications Holding (China) Co., Ltd(博西华家用电器有限公司(中国)) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 针对现有方法在企业知识图谱应用的局限,提出SCAIR无训练框架,集成结构化规划与受控迭代推理,通过模式条件结构先验等提升性能,强调企业图推理要结合领域约束,与业务逻辑对齐可增效。

Comments Accepted at ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11338 2026-07-23 cs.AI 版本更新 83%

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu

机构 * Hunan University, Changsha, China(湖南大学) Wuhan University of Technology, Wuhan, China(武汉理工大学) Huazhong University of Science and Technology, Wuhan, China(华中科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16727 2026-07-21 cs.AI cs.CV 新提交 83%

Constraint-Anchored Reasoning Traces

约束锚定推理轨迹

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。

Comments 15 pages, ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-07-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 新提交 83%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04854 2026-07-07 cs.AI 新提交 83%

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

CARL:用于大语言模型规划的约束感知强化学习

Qiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL 83%

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00215 2026-06-17 cs.CV cs.CL 版本更新 83%

Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design

通过奖励设计解耦多模态大语言模型中的感知与推理

Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究多模态大模型中感知与推理的瓶颈,发现感知是主要约束,并通过奖励设计提升视觉基础推理,平均提升5.56分。

Comments 24 pages, 15 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15682 2026-06-16 cs.LG 新提交 83%

ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training

ReQAT: 实现全精度推理精度的4位浮点量化感知训练

Janghwan Lee, Sihwa Lee, Jinseok Kim, Yongjik Kim, Jieun Lim, Jinwook Oh, Jungwook Choi

机构 * Hanyang University(汉阳大学) Samsung Advanced Institute of Technology(三星综合技术院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 针对大推理模型在低比特量化(W4A4KV4)下推理精度严重下降的问题,提出ReQAT框架,通过迹对齐QAT、选择性熵最小化和量化友好初始化,恢复并超越BF16微调精度,实现最高3.9倍吞吐加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏