Code Prompting: a Neural Symbolic Method for Complex Reasoning in Large Language Models
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Queen Mary University of London(伦敦大学Queen Mary) ; NVIDIA(NVIDIA公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) ; Microsoft Corporation(微软公司)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。
Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title)
Comments 20 pages, 6 figures
SymDiag:基于神经符号验证的LLM推理可解释诊断
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Xinjiang Future Enterprise Incubator Co., Ltd.(新疆未来企业孵化器有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI
AI总结 SymDiag是一种神经符号框架,将LLM推理验证重构为结构化故障诊断,可定位推理故障步骤、分离翻译与推理错误,在多类基准中提升了不可靠推理检测与推理修复反馈效果。
X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中
机构 * Tencent Hunyuan(腾讯混元) ; Zhejiang University(浙江大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.LG
AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。
CoTu在EXACT 2026中的应用:用于透明教育问答的神经符号推理
机构 * Can Tho University(芹苴大学) ; Tay Do University(西原大学)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 EXACT 2026竞赛要求用最多8B参数的自托管模型解决教育问答问题。CoTu团队开发神经符号思维程序管道,结合Z3编码、数值Python等,经答案类型路由等方法,在物理任务中获满分,决赛技术得分最高,总体第三,证明小模型也能实现可验证推理。
Comments The 2nd International XAI Challenge for Transparent Educational Question-Answering @ IEEE IJCNN 2026 Competition
编程而非思考:高效且稳健的多约束规划
机构 * Nanyang Technological University(南洋理工大学) ; Agency for Science, Technology and Research(科技研究局)
专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 多约束规划面临挑战,现有大语言模型方法有局限。本文提出SCOPE框架,将特定查询推理与通用代码执行分离,产生一致、可重用的求解器函数,降低成本和延迟,性能达最优。
Comments Accepted at ACL 2026 : Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)
RS-Gen:用于推理和搜索增强图像生成的多阶段智能体框架
机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出RS-Gen,一种即插即用、无需训练的多阶段图像智能体框架,通过“提问-解决”闭环机制进行逻辑推理和知识补全,显著提升基础图像生成与编辑模型在模糊意图和分布外知识场景下的性能。
Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 逻辑推理 :reasoning(title,title_cn);分类 cs.AI
AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。
Comments Accepted by ICML 2026 as Oral
高德地图中基于隐式推理的生成式时空意图序列推荐
机构 * AMAP, Alibaba Group(阿里集团地图(AMAP))
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.LG
AI总结 提出GPlan框架,通过渐进式隐式思维链蒸馏和时空反事实DPO,将LLM推理能力压缩至轻量模型,实现低延迟且符合时空约束的意图序列生成。
Comments 9 pages, 1 figure
可验证过程奖励用于智能体推理
机构 * Tsinghua University(清华大学)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出可验证过程奖励(VPR)框架,通过符号或算法预言机将密集的中间步骤验证转化为强化学习的逐轮监督信号,解决长程智能体推理中的信用分配问题,并在搜索、约束和后验验证三种场景中验证其有效性。
Comments Corrected minor typos and LLM-assisted data extraction errors. The main conclusions are unchanged
推理作为压缩:通过条件信息瓶颈统一预算强制
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出将高效推理视为信息瓶颈原则下的损失性压缩问题,通过引入条件信息瓶颈(CIB)原则,解决了传统预算强制方法在处理transformers时的理论缺陷,并通过语义先验实现了更高效的推理压缩,提升了准确率并减少了计算成本。
大语言模型推理中的涌现流形分离
机构 * Department of Physics, Harvard University(哈佛大学物理系) ; Center for Data Science, New York University(纽约大学数据科学中心) ; Kempner Institute, Harvard University(哈佛大学 Kempner 研究所) ; Center for Computational Neuroscience, Flatiron Institute(Flatiron 机构计算神经科学中心)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 研究大语言模型推理过程中的流形分离现象,通过曼福容量理论分析两种组合推理任务,发现概念流形在计算前解耦为线性可分子空间,揭示动态流形管理机制。
Comments Alexandre Polo and Chanwoo Chun contributed equally to this work
CoDA:通过引导式推理的领域适应实现有效的跨领域知识迁移
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Pengcheng Laboratory(鹏城实验室)
专题命中 逻辑推理 :CoT(title,abstract);reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 针对跨领域知识迁移中领域分布偏移问题,CoDA通过轻量适配器和基于特征的知识蒸馏结合MMD分布匹配,有效对齐源域与目标域的潜在推理表示,提升逻辑推理任务性能。
Comments 12 pages, 6 figures
从分歧开始:理解跨语言推理-答案不一致现象
机构 * FAIR, Meta(Meta 人工智能基础研究团队) ; Meta Superintelligence Labs(Meta 超级智能实验室)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 研究探讨了多语言模型推理与答案的一致性问题,发现非拉丁文字推理痕迹与结论的不一致程度是拉丁文字的两倍,提出基于人工标注的错误分类方法,揭示了证据错误和逻辑推理错误是主要问题。
Comments Accepted to 2025 EMNLP Multilingual Representation Learning Workshop
对讨好型人格的有益论点:推理如何缓解(却掩盖)LLM的讨好行为
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 研究探讨了推理在缓解LLM讨好行为中的作用,发现推理虽能减少最终决策的讨好倾向,但可能在部分样本中掩盖讨好行为,且LLM在主观任务和权威偏见下更易表现出讨好倾向。
分子科学的多任务大规模推理模型
机构 * Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本文提出多任务大规模推理模型,结合科学逻辑与深度学习,通过强化学习提升分子推理能力,在10项任务中实现50.3%的性能提升,验证了显式推理机制的有效性。
SPOT:基于跨度的思考暂停,用于大语言模型中高效且可解释的潜在推理
机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) ; School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 SPOT通过压缩显式推理步骤为紧凑的潜在暂停token,提升大语言模型的推理效率和可解释性。
连续思维链实现并行探索与推理
机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) ; Google Research NYC(谷歌纽约研究)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.LG
AI总结 本文提出CoT2连续思维链方法,通过并行探索与推理提升模型性能,解决组合子集和问题并优化推理效率。
Comments ICLR 2026
VIRAASAT:为印度文化推理开辟新路径
机构 * AI Institute, University of South Carolina(AI研究所,南卡罗来纳大学) ; Indian Institute of Technology Patna(帕纳大学印度理工学院)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 VIRAASAT通过半自动化多跳方法生成印度文化多跳问题-答案数据集,提出SCoM框架提升文化推理性能。
Canvas-of-Thought:通过可变的结构化状态进行推理
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; New York University(纽约大学) ; Westlake University(西湖大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 Canvas-CoT通过引入HTML Canvas实现可变结构化状态,提升多模态推理效率与精度。
通过差异推理学习关闭临床代理中的推理差距
机构 * Dept. of Population Health Sciences, Weill Cornell Medicine, Cornell University(人口健康科学系,韦尔·科恩医学中心,康奈尔大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 DRL通过学习推理差异改进临床代理,提升问答和预测任务的准确性和推理可信度。
鲁棒答案,脆弱逻辑:在LLM推理中探究解耦假说
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 研究揭示LLM在面对微小输入扰动时,仍能保持正确答案但推理过程不稳定,提出MATCHA框架以探测解耦假说,发现多步骤和常识任务更易受此影响。
剪除无意义的:通过首词意外度实现高效的LLM推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; East China Normal University(华东师范大学) ; Chongqing University(重庆大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本文提出ASAP方法,通过锚点引导和首词意外度度量实现高效的CoT压缩,提升推理效率并降低训练成本。
Comments Code and model available at https://github.com/Zengwh02/ASAP
ReEfBench: 量化大语言模型的推理效率
机构 * Westlake University(西湖大学) ; Imperial College London(帝国理工学院) ; New York University(纽约大学) ; Hainan University(海南大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 ReEfBench通过神经符号框架量化LLM推理效率,揭示推理性能提升源于真实推理而非冗长性,并指出训练中混合长短CoT数据的风险及蒸馏模型的局限性。
ToTRL: 通过解谜游戏解锁大语言模型树状思维推理潜力
机构 * The Chinese University of Hong Kong(香港中文大学) ; Noah’s Ark Lab(Noah's Ark Lab) ; Huawei(华为) ; ChatEDA Tech(ChatEDA科技)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 ToTRL通过解谜游戏训练,提升大语言模型的树状思维推理能力与效率。
基于模型的推理语言模型代理:通过显式问题建模减少幻觉
机构 * Stanford AI Professional Program(斯坦福AI专业项目) ; IESE EMBA Program(IESE EMBA项目)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出基于模型的推理方法,通过显式问题建模减少LLM在复杂规划任务中的幻觉和不一致性。
具有动态路由的意图链式思维提示法用于代码生成
专题命中 逻辑推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 RoutingGen通过动态路由策略优化代码生成,结合少样本提示与结构化推理策略ICoT,提升生成效率与质量。
Comments Accepted at AAAI-2026
认知镜像:探索大语言模型推理中注意力头的多样化功能角色
机构 * The University of Melbourne(墨尔本大学) ; The University of Sydney(悉尼大学) ; Amazon(亚马逊公司)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 本文提出认知镜像框架,通过CogQA数据集分析LLM中注意力头的功能专业化,揭示其在推理任务中的关键作用。
Comments Accepted to NeurIPS 2025