arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-07 至 2026-07-07 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 9 篇

2507.16331 2026-07-07 cs.CL 版本更新 77%

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04631 2026-07-07 cs.AI 新提交 70%

Formal Disco: Scalable Open-Ended Generation of Formally Verified Programs

形式化迪斯科:可扩展的形式化验证程序的开放式生成

Gabriel Poesia, Simon Henniger, Tzu-Han Hsu, Yilun Du, Nada Amin

机构 * Kempner Institute, Harvard University(坎普纳研究所,哈佛大学) School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对生成程序质量保证落后及形式验证数据稀缺问题,提出Formal Disco分布式系统,协调三类工人,记录痕迹用于改进,提出最大熵原则,发布数据集并微调模型,为形式推理领域大规模创建合成数据。

Comments Code: https://github.com/metareflection/formal-disco Datasets: https://huggingface.co/collections/metareflection/formal-disco

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05188 2026-07-07 cs.LG cs.SE 新提交 57%

Latent Programming Horizons in Coding Agents

编码智能体中的潜在编程视界

André Silva, Han Tu, Martin Monperrus

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05032 2026-07-07 cs.CL 新提交 57%

Multi-Large Language Model Orchestrated Severity Assessment of Clinical Records (MOSAIC)

临床记录的多大型语言模型编排严重程度评估(MOSAIC)

Manuela Del Castillo Suero, Arnault-Quentin Vermillet, Nicole Sonne Heckmann, Darmendra Ramcharran, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) GSK(葛兰素史克) School of Pharmacy, University of Rhode Island(罗德岛大学药学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 研究用MOSAIC这一两阶段智能语言模型框架对2型糖尿病严重程度进行表型分析,以合成队列评估其与多种算法真值对比情况及全因死亡率等,结果显示该框架有优势,智能分类与固定规则执行不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04232 2026-07-07 cs.SE cs.CL 新提交 57%

Teaching Code LLMs to Reason with Intermediate Formal Specifications

使用中间形式规范训练代码语言模型进行推理

Minh Le-Anh, Cuong Chi Le, Tien N. Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hanoi Univ. of Science and Tech.(河内科学技术大学) Texas, USA(得克萨斯州,美国) Hanoi, Vietnam(河内,越南)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 研究可执行检查点规范生成,介绍SpecCoder框架从多种程序学习,能选正确规范拒错误执行。引入HumanExec基准测试,实验表明其提升了检查点规范质量及下游正确性推理和修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03701 2026-07-07 cs.AR cs.CR cs.LG 新提交 57%

SABLE: An NDA-Safe Closed-Loop LLM Framework for Analog Circuit Optimization in Industrial EDA Flows

SABLE:工业 EDA 流程中用于模拟电路优化的 NDA 安全闭环 LLM 框架

Xunqi Li, Chris H. Kim

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究针对工业模拟流程中数据安全问题,提出 SABLE 框架,结合多种安全措施,能让 LLM 通过特定工具优化模拟电路,在实际任务中评估多个模型,验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01134 2026-07-07 cs.AI 版本更新 57%

To Use AI as Dice of Possibilities with Timing Computation

将AI用作带有时序计算的可能性骰子

Jia Li, Vipin Kumar, Rui Zhang

机构 * Department of Surgery, University of Minnesota(明尼苏达大学外科系) Department of Computer Science & Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于动词的范式,定义时序计算和可能性,使AI能作为实现思维语法的工具,并在乳腺癌患者数据上自动发现临床轨迹和反事实时序推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 50%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04974 2026-07-07 cs.SE 新提交 50%

A Comprehensive Study of Implementation Bugs in Multi-modal Agents

多模态智能体中实现错误的综合研究

Suwan Li, Lei Bu, Shangqing Liu, Yile Wang, Guangdong Bai, Fuman Xie, Kai Chen, Chang Yue

专题命中 代码与定理证明 :planning(abstract)

AI总结 针对多模态智能体实现错误缺乏系统研究的问题,收集34个智能体,从1268个问题报告中识别出158个错误,开发分类法,实现MATester工具,为多模态智能体错误分类、预防和修复提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏