arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-08 至 2026-04-08 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 3 篇

2402.09664 2026-04-08 cs.SE cs.AI cs.CL cs.PL 81%

CodeMind: Evaluating Large Language Models for Code Reasoning

CodeMind: 评估大型语言模型的代码推理能力

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CodeMind框架,通过独立执行推理、规范推理和动态语义推理任务评估LLM的代码推理能力,发现LLM在处理复杂代码时性能下降,且bug修复性能与代码推理任务无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05080 2026-04-08 cs.SE cs.AI cs.LO cs.MA 79%

Nidus: Externalized Reasoning for AI-Assisted Engineering

Nidus:面向AI辅助工程的外部化推理

Danil Gorinevski

机构 * cybiont GmbH(cybiont有限公司)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 Nidus通过外部化推理机制,实现了AI辅助软件交付中的V模型机械化,通过约束表面确保工程不变量的可靠性,提出递归自治理、协同机制、规范强化和治理剧场预防四项贡献。

Comments 19 pages, 3 figures, 5 tables. Evaluated on self-hosting deployment. Patent pending (CH000371/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01346 2026-04-08 cs.CR cs.AI cs.LG cs.RO 62%

Safety, Security, and Cognitive Risks in World Models

世界模型中的安全性、安全性和认知风险

Manoj Parmar

机构 * SovereignAI Security Labs(SovereignAI安全实验室)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了世界模型在自主决策中的安全、安全及认知风险,提出了轨迹持久性和表征风险的定义,并通过实验验证了对抗攻击的效果,强调了对世界模型的严谨性要求。

Comments version 2, 29 pages, 1 figure (6 panels), 3 tables. Empirical proof-of-concept on GRU/RSSM/DreamerV3 architectures

详情

展开后加载摘要…

URL PDF HTML 收藏