Recursive Vision Language Models for General Symbolic Reasoning
用于通用符号推理的递归视觉语言模型
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
用于通用符号推理的递归视觉语言模型
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。
Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。
GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体
机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。
Comments 21 pages, 8 figures
可解Transformer模型中思维链状态追踪的学习动力学
专题命中 逻辑推理 :chain-of-thought(title,abstract)
AI总结 通过可解设置研究Transformer在思维链状态追踪中的学习动力学,发现注意力检索与MLP逻辑模块分阶段协同发展。
Comments 10 pages, 3 figures
人工智能时代的临床推理:纵向认知与人机协作
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 本研究通过混合方法揭示临床推理的纵向结构,发现当前AI系统主要支持单次就诊任务,与医生多就诊的推理过程存在关键不匹配,为设计更符合真实临床推理的AI系统提供方向。
VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?
机构 * Imperial College London(伦敦帝国理工学院)
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。
DIVE:通过多样性驱动的技能进化解锁冻结语言模型的自我提升
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 DIVE是一种多样性驱动的无参数框架,可让冻结LLM从任务经验和验证器反馈中进化出自然语言技能,在多项推理任务上优于现有方法,还能实现模型间技能迁移,让小模型性能匹配或超越大模型。
Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统
机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)
专题命中 逻辑推理 :reasoning(title);分类 cs.AI、cs.LG
AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。
基于语义的具身智能物联网:愿景与前沿
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)
AI总结 提出基于语义的具身智能物联网(SIoEI),通过语义信息统一度量解决多智能体网络中的多模态数据传输开销和逻辑推理与物理约束解耦问题,并验证其在信道鲁棒性和端到端延迟方面的优势。
Comments 7 pages, 4 figures
解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线
机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) ; School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。
Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)
MechAInistic:一种由大语言模型引导的多智能体系统,用于基于基因组规模的约束代谢模型进行推理
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
AI总结 研究旨在降低基于约束的代谢建模使用门槛,开发了MechAInistic多智能体系统,借助大语言模型,围绕特定模式将自然语言问题转化为可执行工作流程,通过两个免疫细胞代谢模型用例验证,能生成可追溯的治疗假设。
Comments 23 pages, 6 figures,
通过数值规划在多视角约束框架内支持自主流程执行
专题命中 逻辑推理 :planning(title);分类 cs.AI
AI总结 研究在人工智能增强业务流程管理系统中,通过引入新工具,用多视角约束增强流程框架,为部分流程执行推荐最优延续,经实证评估该技术具可扩展性和有效性,能支持自主及约束感知决策。
神经网络的机械可解释性:电路、稀疏特征和符号推理
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; VSB—Technical University of Ostrava(奥斯特拉瓦技术大学)
专题命中 逻辑推理 :reasoning(title);分类 cs.LG
AI总结 研究神经网络机械可解释性,通过Transformer电路分析、Sparse Autoencoders等工具应对叠加等挑战,探索控制模型行为方法,还将机械见解与神经符号人工智能框架联系,以实现神经网络内部算法逆向工程及可解释。
Comments 20 pages
理解语言模型为何产生幻觉:针对先验知识的推理测试
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 逻辑推理 :reasoning(title);分类 cs.CL
AI总结 本文提出推理错位假说,认为幻觉源于模型偏向统计显著的潜在关联而非遵循提示约束,并通过TrapQA测试集验证了两种偏差模式。
Comments Project page: https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/
ScholarSum:基于知识图谱推理与反思性精炼的师生式抽象摘要生成
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
专题命中 逻辑推理 :reasoning(title);分类 cs.CL
AI总结 提出ScholarSum框架,通过构建层次知识图谱引导学生生成初稿,并利用教师式审阅者迭代检查与修正,实现科学文献摘要的流畅性与事实一致性。
大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变
机构 * Meta Superintelligence Labs(元超级智能实验室)
专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。
Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle
超越可解性:任务可学习性作为大语言模型强化学习后训练的静态先验
机构 * Sun Yat-Sen University(中山大学) ; Alibaba Group(阿里巴巴集团)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出TrajVal估计任务可学习性,将其作为静态先验用于LLM的RL后训练任务采样,可提升数据效率并与在线调度方法互补。
Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译
机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) ; Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。
Comments CP 2026 Workshop on LLMs meet Constraint Solving
大语言模型中逻辑一致性的可控重新表述测试
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在逻辑等价问题表面形式改变时的逻辑一致性,提出CRTBench基准,评估多个前沿LLMs,发现存在准确率 - 一致性差距,揭示失败集中在逻辑非平凡变换,表明仅靠准确率无法评估LLMs的逻辑推理。
Comments 10 pages
HABIB_TAZ参加SemEval-2026任务11:通过合成训练和多目标优化从内容中分离形式逻辑
机构 * Dhanani School of Science & Engineering Habib University(哈比卜大学达纳尼科学与工程学院)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文针对SemEval-2026任务11,用基于三段论合成数据集微调的mDeBERTa-v3网络,结合多目标损失函数应对大语言模型形式推理受内容影响的问题,在多个子任务中取得优异成绩,还公开了数据集生成引擎和代码库。
Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (2026), pp. 1006-1014 (2026)
被叙事诱惑:评估半开放文本沙盒中的规则遵守情况
机构 * University of Alberta(阿尔伯塔大学) ; Qilu University of Technology(齐鲁工业大学) ; N-Dice Association(N-Dice协会)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究在半开放文本游戏环境中,当用户意图与系统规则冲突时大语言模型的规则遵守问题。基于桌面角色扮演游戏机制构建多智能体对抗基准CoC-Seduce,用前沿模型生成样本,对20个目标裁决器进行基准测试。
安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划
机构 * Zhejiang University(浙江大学)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。
Comments 13 pages
DiffusionGemma 的透明度如何?
机构 * Google(谷歌)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究DiffusionGemma在连续潜空间中的推理透明度,通过变量透明度和算法透明度分解,发现可解释的令牌瓶颈将不透明串行深度降至Gemma 4的1.1倍,并揭示扩散特有现象。
Comments 20 main text pages and 6 pages of references and appendices
RLCSD: 基于对比策略自蒸馏的强化学习
机构 * Tsinghua University(清华大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; Peking University(北京大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对策略自蒸馏中特权诱导的风格漂移问题,提出RLCSD方法,通过对比正确与错误提示下的师生差距来抑制风格偏移,提升推理模型在数学和逻辑推理任务上的性能。
Comments 20 pages, 9 figures, 9 tables
面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理
专题命中 逻辑推理 :reasoning(title)
AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。
EvoPlan:具有时空保证的进化神经符号机器人规划
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 逻辑推理 :planning(title)
AI总结 研究针对基于LLM的机器人规划器不足及经典PDDL规划器问题,提出含离线STL约束挖掘、进化PDDL规划器和受约束执行循环的神经符号框架,能保证计划属性,在基准测试中表现良好且可在无云环境下部署。
用于漏洞检测的神经符号推理
专题命中 逻辑推理 :reasoning(title)
AI总结 研究基于大语言模型的漏洞检测不可靠性,提出神经符号框架LeanGuard,通过将代码解释与安全义务判定分离,神经侧过滤事实,符号侧形式验证,证据感知裁决器权衡结果,在五个CWE类上实例化框架。
从被动视频到可编辑体验:具身智能的物理基础体验合成
专题命中 逻辑推理 :planning(abstract);verifier(abstract);分类 cs.AI
AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。
AlphaOracle:通过受人工工作流程启发的深度学习进行甲骨文破译
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; School of Electronic Information Engineering, South China University of Technology(华南理工大学电子信息学院) ; Key Laboratory of Oracle Bone Inscriptions Information Processing, Anyang Normal University(安阳师范学院甲骨文信息处理重点实验室)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 针对约3000个未破译甲骨文字符的问题,提出受人工工作流程启发的AlphaOracle框架,经多阶段管道进行甲骨文破译,与专家解读高度一致,还能减少分析时间,为甲骨文及其他未破译文字研究提供参考。
Comments Accepted by The Innovation 2026
Journal ref The Innovation 7(11), 101462, 2026
用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 逻辑推理 :chain-of-thought(abstract);verifier(abstract);分类 cs.AI
AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。