arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 21 篇

2506.15787 2026-05-12 cs.AI cs.CL cs.LG 89%

SLR: Automated Synthesis for Scalable Logical Reasoning

SLR:可扩展逻辑推理中的自动化合成

Lukas Helff, Ahmad Omar, Felix Friedrich, Antonia Wüst, Hikaru Shindo, Rupert Mitchell, Tim Woydt, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting

机构 * TU Darmstadt(图宾根大学) DFKI(德意志联邦防务学院) Meta FAIR CERTAIN, Germany(德国CERTAIN) Lab1141 MPI-Inf(马克斯·普朗克研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLR通过可扩展逻辑推理系统自动化生成指令提示、验证程序和潜在真实规则,创建SLR-Bench基准测试,展示LLM在逻辑推理中的表现及课程学习提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI 88%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09678 2026-05-12 cs.AI 83%

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

荒诞世界:一种简单却强大的方法,用于将现实世界扭曲以探测LLM推理能力

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

机构 * The Nueva School(新维学校) University of Southern California(南加州大学) Notre Dame College(诺特大学) Arizona State University(亚利桑那州立大学) National University of Singapore(新加坡国立大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出Absurd World框架,通过扭曲现实世界来测试LLM的推理能力,验证其在简单逻辑任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04142 2026-05-12 cs.CV cs.AI cs.LG 81%

Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments

将漂移转化为约束:非稳态多流环境中的鲁棒推理对齐

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faulty of Engineering and Information Technology(工程与信息技术学院) University of Technology Sydney(悉尼技术大学) Australia(澳大利亚)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出APO框架,通过约束满足问题解决多源推理对齐问题,实验表明其在胸片解读中鲁棒性优于现有模型,并发布CXR-MAX基准测试集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09419 2026-05-12 cs.AI 79%

From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

从被动重用来主动推理:为神经符号经验回放构建大型语言模型

Yanan Xiao, Yixiang Tang, Zechen Feng, Lu Jiang, Minghao Yin, Pengyang Wang

机构 * Affiliation(机构1)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出神经符号经验回放框架,通过将经验回放从被动样本重用机制转变为知识构建的主动引擎,解决语言推理与数值优化的不兼容问题,提升样本效率和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO 79%

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 73%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 逻辑推理 :chain-of-thought(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08416 2026-05-12 cs.AI cs.CY cs.LG 73%

Alignment as Jurisprudence

对齐作为法学

Nicholas Caputo

机构 * Oxford Martin AI Governance Initiative(牛津马丁人工智能治理研究所)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨法学与对齐的相似结构,通过法律解释主义和宪法AI等方法,揭示两者在规则与案例互动中的价值,并指出AI如何改进法律理解和应用。

Journal ref 27 Yale Journal of Law and Technology 390 (Sept. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09487 2026-05-12 cs.LG 70%

Kintsugi: Learning Policies by Repairing Executable Knowledge Bases

Kintsugi: 通过修复可执行知识库学习策略

Teng Cao, Yu Deng, Hikaru Shindo, Quentin Delfosse, Lanxi Wen, Suli Wang, Jannis Blüml, Christopher Tauchmann, Kristian Kersting

机构 * Artificial Intelligence and Machine Learning Lab, Technical University of Darmstadt, Germany(德累斯顿技术大学人工智能与机器学习实验室) Hessian Center for Artificial Intelligence (hessian.AI), Germany(黑森人工智能中心) Department of Computer Science, Technical University of Darmstadt, Germany(德累斯顿技术大学计算机科学系) Department of Computer Science, Technical University of Munich (TUM), Germany(慕尼黑技术大学计算机科学系) German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt, Germany(德累斯顿技术大学认知科学中心)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 Kintsugi提出一种白盒策略学习框架,通过验证器门控构建可执行知识库,以可组合的类型条目表示任务级策略知识,并通过局部类型编辑提升知识库,实现可检查、可编辑和可部署的策略改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09347 2026-05-12 cs.AI cs.LO 70%

Dsat: A Native SAT Solver for Discrete Logic

Dsat:用于离散逻辑的原生SAT求解器

Yaofang Zhang, Ken Zhou, Adnan Darwiche

机构 * Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种用于离散逻辑的原生SAT求解器,通过扩展布尔逻辑,允许变量取任意值,并通过与CSP求解器、布尔SAT求解器等的比较验证其有效性。

Comments To Appear at The International Conferences on Theory and Applications of Satisfiability Testing (SAT), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00953 2026-05-12 cs.LG 70%

SAGE: Agentic Framework for Interpretable and Clinically Translatable Computational Pathology Biomarker Discovery

SAGE:可解释且临床可转化的计算病理学生物标志物发现代理框架

Sahar Almahfouz Nasser, Juan Francisco Pesantez Borja, Jincheng Liu, Sandeep Manandhar, Shikhar Shiromani, Mohammad Tanvir Hasan, Zenghan Wang, Suman Ghosh, Jinchu Li, Xuejian Xu, Aniket Ramkrishnan Iyer, Naoto Tokuyama, Twisha Shah, Tilak Pathak, Soundharya Kumaresan, Yohei Abe, Himanshu Maurya, Anant Madabhushi

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(NVIDIA公司) University of Arkansas at Little Rock(阿拉伯州立大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

AI总结 SAGE通过生物证据引导生物标志物发现,结合多代理系统生成和评估假设,实现结构化、可追溯的病理学研究方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14044 2026-05-12 cs.AI cs.CR 70%

Multi-Stage Retrieval for Operational Technology Cybersecurity Compliance Using Large Language Models: A Railway Casestudy

基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 70%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01643 2026-05-12 cs.LG cs.AI 62%

AI Alignment via Incentives and Correction

通过激励与修正实现AI对齐

Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan

机构 * Princeton University(普林斯顿大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14785 2026-05-12 cs.LG cs.AI 62%

Exploring the In-Context Learning Capabilities of LLMs for Money Laundering Detection in Financial Graphs

探索LLMs在金融图谱中反洗钱检测中的情境学习能力

Erfan Pirmorad

机构 * The Vanguard Group, Inc.(先锋集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs在金融图谱中进行反洗钱检测的能力,通过提取局部子图并利用少量样本进行情境学习,展示LLMs在识别可疑行为和生成解释方面的潜力。

Comments Accepted at AI4FCF-ICDM 2025

Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09580 2026-05-12 cs.AI cs.CL 62%

GraphMERT: Efficient and Scalable Distillation of Reliable Knowledge Graphs from Unstructured Data

GraphMERT:从非结构化数据中高效可扩展地蒸馏可靠知识图谱

Margarita Belova, Jiaxin Xiao, Shikhar Tuli, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphMERT,一种高效的图神经网络模型,通过蒸馏高质量知识图谱提升领域知识的可靠性与有效性。

Comments Camera-ready version. Published in Transactions on Machine Learning Research (TMLR), 2026. Reviewed on OpenReview: https://openreview.net/forum?id=tnXSdDhvqc

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11537 2026-05-12 cs.LG cs.AI 62%

Simulus: Combining Improvements in Sample-Efficient World Model Agents

Simulus:结合高效样本世界模型代理的改进

Lior Cohen, Kaixin Wang, Bingyi Kang, Uri Gadot, Shie Mannor

机构 * Technion(技术ion大学) Microsoft Research(微软研究院) ByteDance Seed(字节跳动种子实验室)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。

Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15599 2026-05-12 cs.AI 57%

Autonomous Business System via Neuro-symbolic AI

通过神经符号AI实现自主业务系统

Cecil Pang, Hiroki Sayama

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿分校系统科学与工业工程学院) AI Engineering, USA TODAY Co., Inc.(USA TODAY公司人工智能工程部) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿复杂系统中心) Waseda Innovation Lab, Waseda University(早稻田大学创新实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自主业务系统AUTOBUS,结合大语言模型、谓词逻辑编程和企业数据,构建神经符号架构以执行端到端业务任务,通过人机协作提升业务处理的确定性和适应性。

Comments IEEE SysCon 2026

Journal ref 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06483 2026-05-12 cs.AI cs.RO cs.SY eess.SY 57%

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

ReasonSTL:通过工具增强的过程奖励学习桥接自然语言与信号时间逻辑

Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ReasonSTL框架,通过工具增强和过程奖励学习,解决自然语言到信号时间逻辑(STL)的转换难题,提供透明、低成本且隐私保护的正式规范起草方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09573 2026-05-12 cs.SE 50%

ConCovUp: Effective Agent-Based Test Driver Generation for Concurrency Testing

ConCovUp:面向并发测试的有效代理基于测试驱动生成

Yuandao Cai, Shuhao Fu, Wensheng Tang, Cheng Wen, Shengchao Qin, Charles Zhang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出ConCovUp框架,结合LLM与程序分析,通过静态分析提取共享内存访问及调用上下文,利用LLM驱动的逆向追踪方法生成有效并发测试,提升SMAP覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00241 2026-05-12 math.OC 50%

Paratransit Optimization with Constraint Programming: A Case Study in Savannah, Georgia

约束编程在萨凡纳市的拼车服务优化研究

Liam Jagrowski, Kevin Dalmeijer, Tinghan Ye, Pascal Van Hentenryck

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出基于约束编程的拼车服务优化模型,通过萨凡纳案例证明其在服务效率和请求数量上的优势,相比传统方法更易实施且灵活性高。

详情

展开后加载摘要…

URL PDF HTML 收藏