LLMs for Relational Reasoning: How Far are We?
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Accepted by The First International Workshop on Large Language Models for Code (ICSE 2024)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Accepted by The First International Workshop on Large Language Models for Code (ICSE 2024)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments 78 Pages, 16 Figures, Thesis Presentation is available at https://drive.google.com/file/d/1wLIBsjfLvO11PjCS6qx4Y9UgRBUfq3wQ/view?usp=sharing
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
Comments 32 pages, Findings of the Association for Computational Linguistics: ACL 2023, 5186-5219
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
Comments To appear at ICML Workshop on Theory of Mind in Communicating Agents
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments To appear in Proceedings of the 4th Natural Logic Meets Machine Learning Workshop (NALOMA IV)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.LG
Comments Accpeted at EMNLP 2022, code available at https://github.com/INK-USC/RobustLR
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments To appear in EMNLP 2022 main conference. The first two authors contributed equally
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
Comments CVPR 2021 paper. Supplementary: http://wellyzhang.github.io/attach/cvpr21zhang_prae_supp.pdf Project: http://wellyzhang.github.io/project/prae.html
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
Comments Accepted to the 30th Web Conference (WWW 2021)
基于大语言模型的累积推理
机构 * IIIS, Tsinghua University(清华大学人工智能研究院) ; Shanghai Qi Zhi Institute(上海启智研究院)
专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 本文提出了一种名为累积推理(CR)的框架,通过模拟人类的迭代和累积思维过程,增强大语言模型(LLM)的问题解决能力。CR通过分解任务、生成并验证中间推理步骤,构建动态有向无环图(DAG)来组成解决方案,从而在逻辑推理、24点游戏和数学问题等任务中取得了显著的性能提升。
Comments Published in Transactions on Machine Learning Research (TMLR). Project Page: https://github.com/iiis-ai/cumulative-reasoning
Reasoning Core:一个可扩展的程序化数据生成套件,用于符号预训练和后训练
机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工大学、UMR 9189 - CRIStAL)
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL
AI总结 Reasoning Core 提出了一种可扩展的程序化数据生成套件,用于符号预训练和后训练,通过生成多样化的符号推理数据提升语言模型的推理能力。
Comments Keywords: LLMs, NLP, Dataset, Corpus, Procedural Pre-training, Reasoning, Logic, Formal Semantics https://github.com/sileod/reasoning_core
一种基于概念驱动逻辑推理的可解释骨架癫痫检测的神经符号框架
机构 * Monash University(莫纳什大学)
专题命中 逻辑推理 :reasoning(title);logical reasoning(title)
AI总结 提出首个神经符号框架用于视频癫痫检测,通过概念驱动逻辑推理实现可解释性,在SAHZU和IEEE基准上分别达到89.78%和85.27%的灵敏度,误检率低至0.06和0.09次/小时。
Comments Accepted to MICCAI 2026 (Early Accept: top 9%)
假设前沿:验证器引导的大语言模型与符号搜索用于一阶归纳
专题命中 逻辑推理 :verifier(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 本研究提出Hypothesis Frontier框架,结合LLM与符号搜索,在匹配条件下比重复原始提示生成解决更多一阶归纳问题,还可简化所得公式。
SymboUQ:面向大语言模型空间推理的符号化不确定性量化框架
专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 SymboUQ是面向LLMs空间推理的符号化不确定性量化框架,通过区分可符号性与语义确定性,整合三类分数估计最终答案可靠性,在五个空间推理基准的四个冻结LLM骨干上,使AUROC相对提升约8%、Brier损失相对降低7%。
潜在推理模型是否易于解释?
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG
AI总结 本文研究了潜在推理模型的可解释性,发现其推理令牌往往不必要,且可通过解码自然语言推理轨迹验证预测正确性,表明当前LRMs主要编码可解释过程。
Comments Published as a conference paper at COLM 2026
符号执行的智能体规划
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 该研究提出智能体规划系统Agolic,利用早期符号执行运行的证据配置后续有界符号执行,在C/C++程序上平均覆盖3倍以上分支,覆盖更多分支及对比语料库未覆盖的分支,扩展了符号执行的实际覆盖范围。
通过模态差距感知自蒸馏从符号状态学习视觉空间规划
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。
Comments 18 pages, preprint
通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。
Comments 20 pages, 8 figures
当存在多个有效答案时,投票会失效:针对大语言模型中K选1最佳因果推理的符号验证
专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 针对大语言模型因果推理中多有效答案下投票失效的问题,提出无需训练的符号验证器CALVER,在CLEAR数据集等场景下显著提升了推理选择准确率。
Comments 28 pages, 5 figures, 28 tables
Med-R$^3$:通过渐进强化学习增强LLMs的医学检索增强推理
机构 * Peking University(北京大学) ; Baichuan Inc.(北川科技公司)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 Med-R$^3$ 通过渐进强化学习提升医疗场景下LLMs的检索增强推理能力,实现检索与推理的协同优化。
SCAIR:用于企业知识图谱的模式条件代理迭代推理
机构 * University of Stuttgart(斯图加特大学) ; Bosch Center for AI(博世人工智能中心) ; University of Oslo(奥斯陆大学) ; University of Southampton(南安普顿大学) ; BSH Home Applications Holding (China) Co., Ltd(博西华家用电器有限公司(中国)) ; Tsinghua University(清华大学)
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 针对现有方法在企业知识图谱应用的局限,提出SCAIR无训练框架,集成结构化规划与受控迭代推理,通过模式条件结构先验等提升性能,强调企业图推理要结合领域约束,与业务逻辑对齐可增效。
Comments Accepted at ACL 2026 Industry Track
AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理
机构 * Hunan University, Changsha, China(湖南大学) ; Wuhan University of Technology, Wuhan, China(武汉理工大学) ; Huazhong University of Science and Technology, Wuhan, China(华中科技大学)
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。
约束锚定推理轨迹
机构 * University of Oxford(牛津大学)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。
Comments 15 pages, ACM MM 2026
化学与材料推理的有根据验证:检测是瓶颈
专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG
AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。
CARL:用于大语言模型规划的约束感知强化学习
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; City University of Hong Kong(香港城市大学) ; College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) ; School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。
Comments ACL 2026 Findings
为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。
通过奖励设计解耦多模态大语言模型中的感知与推理
机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) ; Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) ; Independent Researcher(独立研究者)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 研究多模态大模型中感知与推理的瓶颈,发现感知是主要约束,并通过奖励设计提升视觉基础推理,平均提升5.56分。
Comments 24 pages, 15 Figures, 10 Tables
ReQAT: 实现全精度推理精度的4位浮点量化感知训练
机构 * Hanyang University(汉阳大学) ; Samsung Advanced Institute of Technology(三星综合技术院)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 针对大推理模型在低比特量化(W4A4KV4)下推理精度严重下降的问题,提出ReQAT框架,通过迹对齐QAT、选择性熵最小化和量化友好初始化,恢复并超越BF16微调精度,实现最高3.9倍吞吐加速。
Comments ICML 2026