Trusta: Reasoning about Assurance Cases with Formal Methods and Large Language Models
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments 38 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments 38 pages
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments Published in Artificial Intelligence (2023)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments 16 pages, 1 figure
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
Comments Accepted to AAAI-2022, AAAI preprint
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
Comments 19 pages, 5 figures, 4 tables, extended version
Journal ref In Stefan Edelkamp, Ralf Moeller, and Elmar Rueckert, editors, KI 2021: Advances in Artificial Intelligence - 44th German Conference on AI, LNAI 12873, pages 217-232. Springer, 2021
专题命中 代码与定理证明 :planning(title,abstract);分类 cs.AI
Comments PPDP 2020, 13 pages, 9 figures
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments This is the pre-print of our short-paper accepted at the 34th Annual Conference of the Japanese Society for Artificial Intelligence, 2020 (https://www.ai-gakkai.or.jp/jsai2020/en)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG
Comments 20 pages, 18 figures, 2 tables
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments 21 pages, 8 figures
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Journal ref EPTCS 224, 2016
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
专题命中 代码与定理证明 :planning(title,abstract);分类 cs.AI
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments Appears in Proceedings of the Fourth Conference on Uncertainty in Artificial Intelligence (UAI1988)
编译以压缩:通过编译器输出提升形式定理证明器
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
专题命中 代码与定理证明 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 利用编译器将大量证明尝试压缩为结构化失败模式,提出一种学习-精炼框架,通过树搜索基于验证器反馈局部修正错误,在可比测试时预算下在PutnamBench上达到最先进性能。
机构 * Tencent(腾讯) ; The University of Hong Kong(香港大学)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments This work was presented at the Workshop on Neural Network Weights as a New Data Modality at ICLR 2025
RepoReasoner:评估长上下文语言模型的仓库级代码推理能力
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。
Comments Published in FSE'2026
规划锤击:面向自动化Rocq证明的难度感知分解
专题命中 代码与定理证明 :planning(title,abstract)
AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。
Comments 26 pages, 8 figures; submitted to OOPSLA 2026
Theoria: 非正式推理状态上的重写-可接受性验证
机构 * Independent Researchers(独立研究者)
专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Theoria验证架构,通过将候选解重写为带显式理由的序列化状态转换并验证变更完整性,在HLE-Verified Gold上以91.4%精确率认证105个问题,优于整体式LLM评判。
个性化且鲁棒的主动机器人辅助:基于不确定性引导的大语言模型推理
机构 * Concordia University(康考迪亚大学)
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 提出GLOBE框架,结合n-gram马尔可夫模型与不确定性引导的大语言模型推理,在家庭环境中实现高效鲁棒的主动机器人辅助,并在HOMER-Noise数据集上验证了其性能与效率。
Comments Accepted to the 2026 IEEE 35th International Conference on Robot and Human Interactive Communication (RO-MAN)
第二届嵌入式和安全关键系统技术因果推理国际研讨会论文集
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 本文探讨了复杂嵌入式和安全关键系统中因果推理的方法,旨在促进不同领域研究者之间的交流,以提升关键系统故障根本原因分析的科学性。
Journal ref EPTCS 259, 2017
衡量信息负担:从基于联盟的推理到价格体系
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 本文通过形式化框架衡量价格体系节省的信息量,证明在可转移效用博弈中,核心与一致同意等价所需的最小信息结构是每个联盟至少被其一个成员所知,且平均每代理信息负担随经济规模指数增长。
LAD-VF:LLM自动微分实现基于形式化方法反馈的无微调机器人规划
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of São Paulo(圣保罗大学) ; Texas A&M University(德克萨斯A&M大学) ; SylphAI
专题命中 代码与定理证明 :planning(title,abstract)
AI总结 提出LAD-VF框架,利用形式化验证反馈和LLM自动微分自动优化提示词,无需微调即可提升机器人规划任务中规范符合率,成功率从60%提升至90%以上。
Comments Presented at ICRA 2026
通过反馈局部推理错误引导基于LLM的循环不变式合成
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 本文提出了一种框架,通过形式验证LLM的思考过程并检测局部推理错误,为基于LLM的循环不变式合成提供建设性反馈,从而提高合成效果。
Comments Accepted by ACM Transactions on Programming Languages and Systems (TOPLAS). DOI: 10.1145/3806652
Journal ref ACM Trans. Program. Lang. Syst. 48, 2, Article 8 (May 2026)
评估大语言模型在现实世界上下文中的代码推理能力
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 本文提出R2Eval1基准测试,包含135个来自十个广泛使用的Python项目的代码推理问题,通过序列化复合和自定义类型,更真实地评估LLM的通用性。
Comments Accepted by ICES SRC (ACM Student Research Competition)
Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学)
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。
Comments CVPR 2026
GeoHeight-Bench:迈向遥感中基于高度的多模态推理
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Technical University of Munich(慕尼黑工业大学)
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 本文提出GeoHeight-Bench,通过构建高度感知的遥感理解评估框架,解决现有多模态模型在复杂遥感几何和灾害场景中忽略垂直维度的问题,提出数据生成管道和基准测试,并验证高度感知的重要性。
Comments 18 pages, 4 figures
ConceptCoder: 通过概念学习提升代码推理
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 ConceptCoder通过学习代码概念提升代码推理能力,在漏洞检测任务中显著提高F1值,优于现有方法,并扩展至分支预测。
超越检测:用于快速在轨遥感危机响应的协作多智能体推理
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。
Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)