Can LLMs Help Improve Analogical Reasoning For Strategic Decisions? Experimental Evidence from Humans and GPT-4
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);CoT(abstract);分类 cs.CL
Comments Accepted to SoCal NLP Symposium 2024
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
Comments camera-ready version
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
Comments Code and data are publicly available at: https://github.com/Mattylam/Logic_Symbolic_Solvers_Experiment
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
Comments Accepted at RuleML 2023
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
Comments 11 pages, 2 figures, 8 tables, accepted as a long paper to ACL 203
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
Comments Accepted by SIGIR 2022
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
Comments Accepted for IJCAI 2021
LGMT:基于逻辑的蜕变测试用于评估LLMs的推理可靠性
机构 * School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出LGMT框架,利用一阶逻辑推导蜕变关系,通过一致性检查评估LLM推理的鲁棒性,揭示传统评估忽略的隐藏缺陷。
Comments Zheng Zheng is the corresponding author
Journal ref Knowledge-Based Systems, Volume 348, 2026, 116324, ISSN 0950-7051
神经符号驱动:基于规则忠实推理的驾驶VLA
机构 * Texas A&M University(德克萨斯农工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学) ; University of California, Riverside(加利福尼亚大学河滨分校) ; University of Pittsburgh(匹兹堡大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。
鲁棒双信号融合:混合神经符号门控与压缩链式思维精炼用于社交媒体文本讽刺检测
机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校)
专题命中 逻辑推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出RDS融合框架,结合神经符号架构与压缩链式思维推理,在TweetEval和iSarcasm数据集上达到与微调BERTweet相当的性能,并显著优于监督方法。
Comments 11 pages total, 10 figures
服从与感知:大型语言模型中的推理可控性研究
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) ; School of EECS, Queen Mary University of London(伦敦女王学院电子工程与计算机科学学院) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 通过推理冲突视角,系统研究大型语言模型在诱导逻辑模式与任务预期模式冲突时,是否优先服从指令还是遵循感知合理性,并探索内部检测与激活级干预方法。
OMNIFLOW:一种基于物理的多模态代理用于通用科学推理
机构 * Tsinghua University(清华大学) ; Tencent(腾讯) ; Shenzhen Loop Area Institute(深圳河套学院) ; Ocean University of China(海洋大学) ; HKUST (Guangzhou)(香港科技大学(广州))
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。
TopoBench:在复杂拓扑推理上对LLM进行基准测试
机构 * Intercom Research(Intercom研究院) ; University College Dublin(都柏林大学) ; University of Galway(Galway大学) ; Salk Institute(Salk研究所) ; Dublin City University(都柏林城市大学) ; Trinity College Dublin(都柏林三一学院)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,comments);分类 cs.CL、cs.AI
AI总结 TopoBench通过测试LLM在复杂拓扑推理任务上的表现,揭示了模型在提取空间约束方面的瓶颈,并提出缓解策略。
Comments Accepted, Workshop on Logical Reasoning of Large Language Models at ICLR 2026
约束校正训练用于高效的推理链
机构 * The Ohio State University(俄亥俄州立大学) ; University of Houston(休斯顿大学) ; Google(谷歌)
专题命中 逻辑推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);self-correction(abstract)
AI总结 CRT通过约束校正训练提升推理效率,减少冗余并保持准确性。
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; University College London(伦敦大学学院) ; LG AI Research(LG人工智能研究)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
Comments Previously titled "Let's Predict Sentence by Sentence"; Presented @ COLM RAM 2 Workshop (Oral)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
Comments ICML 2025
Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准
机构 * HKUST(香港科技大学) ; Colab, Beihang University(北京航空航天大学合作实验室) ; CUHK(香港中文大学)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract)
AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。
ForestHG-Trace: 大规模森林场景下的可追踪长程生态推理
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract)
AI总结 提出ForestHG-Trace框架,通过生态超图表示和LLM引导的确定性工具链,实现森林场景中可追踪的多步生态推理,并构建ForestTraceQA基准,显著提升长程生态问答的准确性和执行忠实度。
Comments It has theoretical flaws and experimental errors
超越营养标签:类比推理如何塑造合成媒体披露设计
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract)
AI总结 本研究探讨了在复杂的社会技术约束下,AI政策制定者和实践者如何设计合成媒体披露,识别了过程透明和危害减少等关键披露目标,并揭示了规范性与中立性、主动与精确性之间的核心矛盾,强调了类比推理在管理但不解决这些矛盾中的作用。
Comments 18 pages, 3 tables
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract)
Comments Accepted by ICCV2025
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract)
Journal ref Proceedings of the 38th Pacific Asia Conference on Language, Information and Computation (PACLIC 2024), Tokyo, Japan, pages 203-212, December 2024. Tokyo University of Foreign Studies
机构 * Purdue University(普渡大学) ; Google Research(谷歌研究)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);分类 cs.CL、cs.AI、cs.LG
机构 * School of Computer Science and Technology, Guangdong University of Technology(广东技术大学计算机科学与技术学院) ; School of Computer Science and Intelligence Education, Lingnan Normal University(岭南师范学院计算机科学与智能教育学院)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);CoT(abstract)
Comments 10 pages
ChaosBench-Logic v2: 大规模评估大语言模型在动力系统上的逻辑推理能力
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);分类 cs.AI、cs.LG
AI总结 针对二元推理基准的准确性掩盖了关键缺陷,本文提出包含40,886个问题、覆盖165个动力系统的ChaosBench-Logic v2基准和CARE评估协议,揭示模型在状态转换推理、FOL演绎等任务上的表现差异和系统性反相关。
Comments 14 pages, 8 figures. Published at the ICLR 2026 Workshop on LLM Reasoning
当大语言模型发展语言:用于高效多智能体推理的符号通信
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 提出CLSR框架,让多个LLM智能体自主发明和演化紧凑符号语言,通过路由器自适应选择以优化准确率与token成本的权衡,在保持准确率的同时将推理token数减少3-6倍。
Comments ICML2026 Regular paper