arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 2 篇

2604.06401 2026-04-09 cs.AI cs.CE cs.CV cs.LG 76%

ProofSketcher: Hybrid LLM + Lightweight Proof Checker for Reliable Math/Logic Reasoning

ProofSketcher: 混合LLM + 轻量级证明检查器用于可靠的数学/逻辑推理

Kranthi Kommuru, Kunal Khanvilkar, Gaurav Parekh

机构 * Amazon Web Services, Inc(亚马逊云科技)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出混合方法,结合LLM生成类型化证明草图与轻量级可信内核,以提升数学逻辑推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03926 2026-04-09 cs.AI cs.CY cs.HC cs.MA 57%

CODE-GEN: A Human-in-the-Loop RAG-Based Agentic AI System for Multiple-Choice Question Generation

CODE-GEN:一种基于检索增强生成的多选题生成人机协作人工智能系统

Xiaojing Duan, Frederick Nwanganga, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 CODE-GEN通过生成与课程目标一致的多选题提升学生代码推理能力,采用生成器和验证器代理,结合专用工具提高准确性,评估结果显示系统在七个教学维度上表现优异,但人类专家仍需参与设计教学性干扰项和反馈质量。

Comments Full version of the paper accepted as a short paper at the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏