arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-28 至 2026-04-28 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 14 篇

2509.25346 2026-04-28 cs.AI cs.LG q-bio.CB q-bio.GN 88%

SynthPert: Enhancing LLM Biological Reasoning via Synthetic Reasoning Traces for Cellular Perturbation Prediction

SynthPert: 通过合成推理轨迹增强LLM的生物推理以进行细胞扰动预测

Lawrence Phillips, Marc Boubnovski Martell, Aditya Misra, Josefa Lia Stoisser, Cesar A. Prada-Medina, Rory Donovan-Maiye, Kaspar Märtens

机构 * InverseBio Novo Nordisk

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SynthPert方法,通过合成推理轨迹提升LLM在细胞扰动预测中的性能,展现了合成数据在生物推理中的有效性,并实现了跨细胞类型泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23877 2026-04-28 cs.CL 88%

Knowledge Vector of Logical Reasoning in Large Language Models

大语言模型中逻辑推理的知识向量

Zixuan Wang, Yuanyuan Lei

机构 * Department of Computer & Information Science and Engineering(计算机与信息科学与工程系)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了大语言模型中演绎、归纳和溯因推理的知识表示,发现其在线性空间中可独立表示,提出互补子空间约束框架以增强其互补性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16909 2026-04-28 cs.CL cs.AI 84%

PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations

PRISM:探究语言模型幻觉中的推理、指令和来源记忆

Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

机构 * HKUST(GZ)(香港科技大学(广州)) NYUSH(纽约大学上海分校) DUFE(东华大学) CUHK(SZ)(香港城市大学(深圳)) CUFE(中国金融学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PRISM通过四个维度分析语言模型幻觉,提供细粒度诊断评估,揭示不同模型在指令遵循、记忆检索和逻辑推理上的权衡。

Comments Accepted by ACL main conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23345 2026-04-28 cs.CL cs.HC 83%

Bridging Reasoning and Action: Hybrid LLM-RL Framework for Efficient Cross-Domain Task-Oriented Dialogue

连接推理与行动:一种高效的跨领域任务导向对话混合LLM-RL框架

Yangyang Zhao, Linfan Dai, Li Cai, Bowen Xing, Libo Qin

机构 * School of Computer Science and Technology, Changsha University of Science and Technology(长沙理工大学计算机科学与技术学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算与智能研究院) University of Science and Technology Beijing(北京科技大学) Text Computing and Cognitive Intelligence MOE Engineering Research Center, Guizhou University(贵州大学文字计算与智能认知MOE工程研究中心)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出VLK-RL框架,通过结合LLM生成约束并验证以提升跨领域任务导向对话的推理与行动效率,实验表明其在长周期任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23809 2026-04-28 cs.CL 79%

LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models

LegalDrill: 以诊断驱动合成促进小型语言模型中的法律推理

Tianchun Li, Haochen Liu, Vishwa Pardeshi, Xingchen Wang, Tianci Liu, Huijun Zhao, Wei Fan, Jing Gao

机构 * Purdue University(普渡大学) Fidelity Investments(富达投资)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 LegalDrill通过精细提示提取并迭代优化教师模型的推理轨迹,结合自我反思验证选择有效数据,提升小型语言模型的法律推理能力,无需稀缺专家标注。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10294 2026-04-28 cs.CR 78%

Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models

推理劫持:大语言模型中推理对齐的脆弱性

Yuansen Liu, Yixuan Tang, Anthony Kum Hoe Tun

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24062 2026-04-28 cs.AI 70%

Grounding Before Generalizing: How AI Differs from Humans in Causal Transfer

在泛化之前建立基础:人工智能如何与人类在因果迁移中不同

Liangru Xiang, Yuxi Ma, Zhihao Cao, Yixin Zhu, Song-Chun Zhu

机构 * Department of Automation(清华大学自动化系) Institute for Artificial Intelligence(北京大学人工智能研究院) School of Psychological and Cognitive Sciences(北京大学心理与认知科学系) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 研究探讨了人工智能与人类在因果迁移中的差异,发现AI模型在缺乏环境基础映射时难以高效迁移,而人类能利用先验结构知识。文本条件中AI表现优异,但视觉信息反而降低性能,揭示AI依赖符号处理而非多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04177 2026-04-28 cs.CL 65%

Position: Logical Soundness is not a Reliable Criterion for Neurosymbolic Fact-Checking with LLMs

位置:逻辑正确性不是LLM神经符号事实核查中的可靠标准

Jason Chan, Robert Gaizauskas, Zhixue Zhao

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.CL;logical reasoning(comments)

AI总结 本文指出,逻辑正确性无法有效检测误导性声明,提出利用LLM的人类推理倾向来验证神经符号系统中的正式组件输出。

Comments ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23088 2026-04-28 cs.SE cs.AI cs.CL cs.PL 62%

Code Broker: A Multi-Agent System for Automated Code Quality Assessment

Code Broker:一个用于自动化代码质量评估的多智能体系统

Samer Attrah

机构 * Independent researcher(独立研究者) California, USA(美国加州)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Code Broker通过多智能体架构对Python代码进行分析并生成质量评估报告,结合LLM推理与静态分析工具,提升代码审查的效率与准确性。

Comments 8 pages, 1 figure, 2 tables, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24429 2026-04-28 cs.CL 57%

A Multi-Dimensional Audit of Politically Aligned Large Language Models

对政治倾向大型语言模型的多维审计

Lisa Korver, Mohamed Mostagir, Sherief Reda

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Ross School of Business(罗斯商学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于哈贝马斯沟通行动理论的多维框架,评估政治倾向语言模型在有效性、公平性、真实性及说服力四方面的表现,揭示大模型在政治角色扮演中更有效但更偏颇的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24341 2026-04-28 cs.CR 50%

GoAT-X: A Graph of Auditing Thoughts for Securing Token Transactions in Cross-Chain Contracts

GoAT-X:用于跨链合约中保障令牌交易的安全思想图

Zijun Feng, Yuming Feng, Yu Wang, Weizhe Zhang, Yuhong Nan, Yuang Liu, Zibin Zheng

专题命中 逻辑推理 :reasoning(abstract)

AI总结 GoAT-X通过系统性原理验证替代启发式模式匹配,构建审计思想图以识别跨链逻辑中的漏洞,实现高召回率和覆盖范围,发现117个真实风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 50%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 逻辑推理 :reasoning(abstract)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18375 2026-04-28 cs.CC cs.LO 50%

Fagin's Theorem for Semiring Turing Machines

对于半环图灵机的法金定理

Guillermo Badia, Manfred Droste, Thomas Eiter, Rafael Kiesel, Carles Noguera, Erik Paul

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文改进了Eiter和Kiesel的SRTM模型,证明了在改进模型下,NP_∞(R)可通过允许谓词解释为半环注释关系的加权存在第二阶逻辑捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17321 2026-04-28 cs.RO 50%

Neuro-Symbolic Control with Large Language Models for Language-Guided Spatial Tasks

基于大语言模型的神经符号控制用于语言引导的空间任务

Momina Liaqat Ali, Muhammad Abid, Muhammad Saqlain, Jose M. Merigo

机构 * Department of Computer Science, Middle Tennessee State University(中田纳西州立大学计算机科学系) Department of Mechanical and Aerospace Engineering, University of Tennessee(田纳西大学机械与航空航天工程系) School of Computer Science, Faculty of Engineering, and Information Technology, University of Technology Sydney(悉尼技术大学工程与信息技术学院计算机科学系) School of Computer Science, Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼技术大学工程与信息技术学院计算机科学系)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种神经符号控制框架,结合轻量神经控制器和本地大语言模型,通过符号任务解释与低层运动执行分离,提升空间任务的成功率和效率,实验证明在连续控制中具有更高的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏