arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-13 至 2026-08-13 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 6 篇

2608.08514 2026-08-13 cs.AI cs.CL cs.LG 交叉投稿 83%

Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing

复现与压力测试两种提升大语言模型(LLM)推理可靠性的方法:测试时概率聚合与逻辑表示编辑

Minhan Cho, Jimin Kweon

机构 * Sungkyunkwan University(成均馆大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究复现了RPC与LCF两种提升LLM推理可靠性的方法,在多任务域与多模型上压力测试,发现RPC优势未达显著且样本量增大后效果逆转,LCF效果弱且无统计显著性。

Comments 16 pages, 3 figures, 9 tables. Code, data, and experiment logs: https://github.com/rabqatab/llm-reasoning-reliability-reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11905 2026-08-13 cs.AI cs.LG cs.SC 新提交 81%

Policy-as-logic for robust reasoning over rules

作为逻辑的策略:针对规则的鲁棒推理

Rahul Nair, Bastian Lipka, Elizabeth Daly

机构 * IBM Research(IBM研究院) IBM(国际商业机器公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出混合符号方法,将策略表示为形式逻辑,结合语言模型事实提取与答案集求解器推理,性能优于策略作为提示、策略作为代码方法,令牌用量减少约10倍,助力生成式AI系统做出鲁棒决策。

Comments RobustifAI Workshop at IJCAI-ECAI '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 57%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11340 2026-08-13 cs.NI cs.AI 新提交 57%

Self-evolving network verifiers

自演进网络验证器

Ioannis Protogeros, Tibor Schneider, Laurent Vanbever

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27143 2026-08-13 cs.CR cs.AI 版本更新 57%

Enhancing Linux Privilege Escalation Attack Capabilities of Local LLM Agents

增强本地大语言模型代理的Linux提权攻击能力

Benjamin Probst, Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究通过系统性实验验证针对性干预能否提升本地开源模型在Linux提权中的性能,发现开源模型可匹配甚至超越云模型,且反思类干预效果最佳,但漏洞发现仍是本地模型的瓶颈。

Comments Accepted at RAISE workshop (https://raise-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13252 2026-08-13 cs.CL 版本更新 57%

A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problems

语言模型作为形式化工具在约束满足问题上的现实检验

Rikhil Amonkar, Ceyhun Efe Kayan, Qimei Lai, Ronan Le Bras, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究评估了语言模型作为形式化工具在约束满足问题中的表现,发现其在15种模型-数据集组合中表现劣于作为求解器,尽管形式化更具可验证性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏