Evidence from counterfactual tasks supports emergent analogical reasoning in large language models
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments NAACL 2024 Main Conference
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments This work is part of the proceedings of EACL Findings 2024
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments ALP@JURIX2023
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Presented at SemDial, August 2023 in Maribor, Slovenia
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to the Findings of ACL 2023
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments To appear at the main conference of EMNLP 2022
Journal ref EMNLP 2022
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.LG
Comments Accepted by 2022 IEEE International Conference on Data Mining (ICDM 2022) Workshop on Foundation Models for Vision and Language
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 12 pages
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted at ICML'19. The code can be found at https://github.com/locuslab/satnet
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
Comments Code available at https://github.com/Akirato/LLM-KG-Reasoning
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
Journal ref IJCAI2023 Symposium on Multimodal Reasoning with LLM
虚假的平均值:思维链监控在其作为唯一防御的地方失效
专题命中 逻辑推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究指出思维链监控在作为唯一防御时会失效,攻击者通过重写智能体推理可大幅降低监控捕获率,攻击可跨模型迁移,仅轨迹防御难恢复,需外部信息辅助。
DiscoLoop: 循环离散嵌入与连续隐藏状态用于多跳推理
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对多跳推理中非循环Transformer的深度局部存储问题,提出DiscoLoop架构,通过循环同时携带离散嵌入和连续隐藏状态,实现近乎完美的泛化,并在符号和合成语言任务中显著减少训练步数。
Comments 16 pages, 7 figures
超越语义主导:音频语言模型中的认知情感推理与共情响应对齐
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);logical reasoning(abstract)
AI总结 提出CogAudio-LLM框架,通过构建LIME-440K数据集实现声学-语义解耦,设计EIPS思维链机制进行心理推理,并采用DR-SAPO优化策略平衡逻辑严谨性与共情质量,解决音频语言模型中的语义主导和情感认知不足问题。
Comments Accepted by Interspeech2026
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)
Comments Accepted at COLM 2025
专题命中 逻辑推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);logical reasoning(abstract)
Comments 20 pages, 12 figures, 3 tables
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
Comments 26 pages; the first two authors contributed equally; GTBench HF Leaderboard: https://huggingface.co/spaces/GTBench/GTBench
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
Comments Accepted by NeurIPS'25 Efficient Reasoning Workshop
用于大语言模型逻辑推理的符号逻辑六边形理论
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
AI总结 研究大语言模型逻辑推理中语义组织的影响,提出HexLogicAgent框架,先组织自然语言含义再结构化验证推理。发现不完整语义表示是推理失败主因,建模语义对立结构可延迟性能下降,实验证明该框架能提高推理可靠性。
数据驱动的机器学习无法达到符号级逻辑推理——缩放定律的极限
机构 * The Alan Turing Institute(艾伦·图灵研究所) ; University of Cambridge(剑桥大学)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
AI总结 本文通过理论分析和实验证明,数据驱动的监督深度学习无法通过增加训练数据和时间达到符号级三段论推理的严谨性,并揭示了训练数据和方法上的根本限制。
后训练如何塑造生物学推理模型
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究院)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.LG
AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。
HOLMES: 评估大语言模型中的高阶逻辑推理
机构 * State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; YiXin-AILab, YIXIN(YiXin-AILab,YIXIN)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
AI总结 提出HOLMES基准,基于高阶逻辑评估LLM在规则、谓词和约束上的推理能力,发现当前模型平均准确率仅50.64%,揭示高阶符号推理是关键瓶颈。