arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-10 至 2026-04-10 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 11 篇

2505.00017 2026-04-10 cs.CL cs.AI cs.DB cs.LG 82%

ReCellTy: Domain-Specific Knowledge Graph Retrieval-Augmented LLMs Reasoning Workflow for Single-Cell Annotation

ReCellTy:领域特定的知识图谱检索增强型大语言模型推理工作流用于单细胞注释

Dezheng Han, Yibin Jia, Ruxiao Chen, Wenjie Han, Shuaishuai Guo, Jianbo Wang

机构 * Shandong University(山东大学) Qilu Hospital of Shandong University(山东大学齐鲁医院) Johns Hopkins University(约翰霍普金斯大学) Cognicore Artificial Intelligence Co., Ltd.(科智人工智能有限公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReCellTy,通过整合生物信息知识图谱和多任务推理工作流,提升单细胞注释的准确性与自动化水平,改进人类评估得分和语义相似度,缩小大中小语言模型性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08401 2026-04-10 cs.AI cs.CL 81%

Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing

在提交前验证:通过自我审计实现LLM代理中的忠实推理

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Xuehe Wang, Edith Cheuk Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAVeR框架,通过在行动承诺前验证内部信念状态,提升LLM代理的推理忠实性,实验表明其在保持任务性能的同时提升了推理可靠性。

Comments Accepted by ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04500 2026-04-10 cs.AI cs.RO 70%

"Don't Do That!": Guiding Embodied Systems through Large Language Model-based Constraint Generation

别这样做!

Amin Seffo, Aladin Djuhera, Masataro Asai, Holger Boche

机构 * Technical University Munich(慕尼黑工业大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出STPR框架,利用LLM将自然语言中的约束转化为可执行Python代码,解决复杂约束的翻译问题,并在仿真环境中验证其高效性和兼容性。

Comments ICLR 2026 Workshop -- Agentic AI in the Wild: From Hallucinations to Reliable Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07622 2026-04-10 cs.CL cs.AI cs.LG 67%

DIVERSED: Relaxed Speculative Decoding via Dynamic Ensemble Verification

DIVERSED: 通过动态集成验证实现放松的推测解码

Ziyi Wang, Siva Rajesh Kasa, Ankith M S, Santhosh Kumar Kasa, Jiaru Zou, Sumit Negi, Ruqi Zhang, Nan Jiang, Qifan Song

机构 * Purdue University(普渡大学) Amazon Inc.(亚马逊公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DIVERSED通过动态集成验证框架提升解码效率,保留生成质量,通过任务和上下文依赖的权重融合草案与目标模型分布,提升推理效率。

Comments 35 pages, 9 figures, accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08468 2026-04-10 cs.LG cs.AI 62%

TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis

TTVS: 通过测试时变分合成提升自我探索强化学习

Sikai Bai, Haoxi Li, Jie Zhang, Yongjiang Liu, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TTVS框架,通过动态增强未标记测试查询流,使大推理模型自我进化,提升测试时适应性能,实验显示其在八种模型架构上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08284 2026-04-10 cs.CL cs.AI 62%

Distributed Multi-Layer Editing for Rule-Level Knowledge in Large Language Models

分布式多层编辑用于大语言模型中的规则级知识

Yating Wang, Wenting Zhao, Yaqi Zhao, Yongshun Gong, Yilong Yin, Haoliang Sun

机构 * School of Software, Shandong University(山东大学软件学院) Salesforce AI Research

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对规则级知识的编辑问题,提出分布式多层编辑方法,通过多层干预提升规则理解和实例可迁移性。

Comments 17 pages,3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07897 2026-04-10 cs.AI cs.LG 62%

Visual Perceptual to Conceptual First-Order Rule Learning Networks

基于视觉感知的概念性一阶规则学习网络

Kun Gao, Davide Soldà, Thomas Eiter, Katsumi Inoue

机构 * Zhongguancun Academy(中关村学院) Vienna University of Technology (TU Wien)(维也纳技术大学) National Institute of Informatics(国立信息学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出γILP框架,通过图像常量替换到规则结构归纳的可微流程,解决图像数据中无标签学习规则及自动发明谓词的问题,实验证明其在符号关系数据和图像数据上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08245 2026-04-10 cs.AI 57%

From Phenomenological Fitting to Endogenous Deduction: A Paradigm Leap via Meta-Principle Physics Architecture

从现象拟合到内生推导:通过元原理物理架构实现范式跃迁

Helong Hu, HongDan Pan, ShuiQing Hu

机构 * Guangdong Ocean University(广东海洋大学) Maoming Administrative Service Center(茂名市行政服务中心) China Pacific Insurance (Group) Co., Ltd. Foshan Branch(中国太平洋保险(集团)股份有限公司佛山分公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过元原理物理架构将现象拟合与内生推导结合,提升物理推理、数学任务和逻辑任务性能,同时降低验证困惑度,展现原理嵌入设计的鲁棒性和可解释性。

Comments 23 pages, 4 figures, 11 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16750 2026-04-10 cs.LG 57%

Interpretable Clinical Classification with Kolmogorov-Arnold Networks

可解释的临床分类与科拉莫戈罗夫-阿诺德网络

Alejandro Almodóvar, Patricia A. Apellániz, Alba Garrido, Fernando Fernández-Salvador, Santiago Zazo, Juan Parras

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于科拉莫戈罗夫-阿诺德网络的可解释性临床分类方法,通过Logistic KAN和KAAM模型在多个公开数据集上验证了其在预测性能和临床透明度上的优势。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07752 2026-04-10 cs.SE cs.AI 57%

MIMIC-Py: An Extensible Tool for Personality-Driven Automated Game Testing with Large Language Models

MIMIC-Py:一种基于人格驱动的大型语言模型自动游戏测试工具

Yifei Chen, Sarra Habchi, Lili Wei

机构 * Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 MIMIC-Py通过模块化架构实现人格驱动LLM代理的可重用性和扩展性,支持多种交互机制,降低新游戏环境部署难度。

Comments 10 pages, Accepted by FSE Companion '26, July 5--9, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07592 2026-04-10 cs.RO 50%

Spatio-Temporal Grounding of Large Language Models from Perception Streams

从感知流中对大语言模型进行时空 grounding

Jacob Anderson, Bardh Hoxha, Georgios Fainekos, Hideki Okamoto, Danil Prokhorov

机构 * Toyota Motor North America Research & Development(丰田北美研发中心)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出FESTS框架,通过将自然语言查询转化为SpRE,为大语言模型注入可验证的时空监督,提升时空推理能力,使30亿参数模型在27k数据上实现87.5%的帧级F1分数,接近GPT-4.1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏