arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 10 篇

2603.02676 2026-05-12 cs.CL cs.AI 81%

ITLC at SemEval-2026 Task 11: Normalization and Deterministic Parsing for Formal Reasoning in LLMs

在SemEval-2026任务11中采用ITLC:为LLMs中的形式推理进行规范化和确定性解析

Wicaksono Leksono Muhamad, Joanito Agili Lopo, Tack Hwa Wong, Muhammad Ravi Shulthan Habibi, Samuel Cahyawijaya

机构 * SEACrowd Mantera Studio Universiti Teknologi PETRONAS(普特拉联合大学) Universitas Indonesia(印度尼西亚大学) Cohere

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过显式结构抽象和确定性解析减少LLMs推理中的内容偏差,方法在SemEval-2026任务11中取得前五名,有效降低偏差并提供替代复杂微调的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04910 2026-05-12 cs.SE 80%

Reducing the Costs of Proof Synthesis on Rust Systems by Scaling Up a Seed Training Set

通过扩大种子训练集来降低Rust系统证明合成的成本

Nongyu Di, Tianyu Chen, Shan Lu, Shuai Lu, Yeyun Gong, Peng Cheng, Jacob R. Lorch, Yuan Yao, Xiaoxing Ma

专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出VeruSyn数据合成管道,通过自合成和教程合成扩大Verus验证工具的数据集,生成690万Rust程序及其形式化规格证明,提升代码生成模型的性价比和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23238 2026-05-12 cs.CR cs.AI 79%

Hiding in Plain Sight: Detectability-Aware Antidistillation of Reasoning Models

明目张胆:面向可检测性的推理模型抗蒸馏

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Yash Savani, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Stony Brook University(石溪大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种面向可检测性的抗蒸馏方法,通过Stackelberg博弈框架显式编码可检测性约束,以稀疏扰动替代全迹中毒,提升教师模型性能并降低防御可见性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21619 2026-05-12 cs.LG cs.AI cs.CL 67%

On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency

关于并行思维的过度扩展诅咒:系统效能与样本效率的矛盾

Yiming Wang, Zhuosheng Zhang, Rui Wang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究并行思维中系统效能与样本效率的矛盾,提出Latent Budget Predictor提升预算利用率,并引入Pre-decoding Budget Adaptation改进解码效率。

Comments 44 pages, 66 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09184 2026-05-12 cs.AI cs.CL cs.DB 62%

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

开放本体:基于稳定匹配对齐的工具增强本体工程

Fabio Rovai

机构 * The Tesseract Academy, London, United Kingdom(泰斯拉学院,伦敦,英国)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Open Ontologies系统,结合LLM驱动构建与形式OWL推理及本体对齐,发现稳定1对1匹配是本体对齐质量关键,且工具增强访问优于纯LLM解析。

Comments 10 pages, 6 tables. Code: https://github.com/fabio-rovai/open-ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09716 2026-05-12 cs.AI 57%

Medical Model Synthesis Architectures: A Case Study

医学模型合成架构:一种案例研究

Katherine M. Collins, Marlene Berke, Ilia Sucholutsky, Ayman Ali, Adrian Weller, Timothy J. O'Donnell, Tyler Brooke-Wilson, Lionel Wong, Joshua B. Tenenbaum

机构 * MIT(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) Duke University(杜克大学) The Alan Turing Institute(艾伦·图灵研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种框架,使AI系统能在不确定性下进行实用且形式透明的临床预测。通过语言模型检索知识并构建概率模型,实现校准和可验证的推理,用于鉴别诊断并讨论未来应用方向。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16708 2026-05-12 cs.CR cs.AI cs.MA 57%

Formal Policy Enforcement for Real-World Agentic Systems

面向现实代理系统的正式政策执行

Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Langroid

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于面向切面编程的框架,通过Datalog语言实现跨代理系统的政策执行,解决传统方法无法保证正式执行的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10074 2026-05-12 cs.CR cs.SE 50%

Agentic Fuzzing: Opportunities and Challenges

代理模糊测试:机遇与挑战

Junyoung Park, Insu Yun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09794 2026-05-12 cs.IR 50%

LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries

LLM代理使用户主导的个性化超越平台边界

Jiacheng Lin, Kun Qian, Arvind Srinivasan, Tian Wang, Fang Han, Changran Hu, Junze Liu, Ziyi Wang, Hanwen Xu, Mengmeng Xue, Shuo Yang, Hansi Zeng, Simon Sinong Zhan, Kai Zhong, Weiqi Zhang, Dakuo Wang, Tianhao Wang, Zhiyuan Li

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出用户主导的个性化方法,利用LLM代理整合跨平台和离线数据,突破平台限制,实现更全面的个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08694 2026-05-12 cs.SE 50%

A Learning Method for Symbolic Systems Using Large Language Models

基于大语言模型的符号系统学习方法

Jian Fang, Yixun Yao, Yingfei Xiong

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。

详情

展开后加载摘要…

URL PDF HTML 收藏