FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs
FAVA:基于证据支持的权限图的经验证智能体的形式化授权
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
FAVA:基于证据支持的权限图的经验证智能体的形式化授权
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。
作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。
Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl
就模型达成一致,验证推理:基于同态-非同态分解变压器的HND的GKR协议
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG
AI总结 研究外包变压器推理问题,提出GKR-HND协议验证同态-非同态分解变压器多项式主干,保留验证器检查记录与开口,委托公共评估给计算工作者,实验验证了证明路径与委托计算,无需密集矩阵重放。
Comments 24 pages, including 4 pages of supporting information; 2 figures
从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器
机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。
$\max$@$k$强化学习的理论基础
机构 * Bocconi University(博科尼大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 研究有限 horizon 强化学习中$\max$@$k$学习问题,指出其与标准预期回报最大化不同,证明马尔可夫策略不足,识别状态增强,表征策略性能差距,表明学习更难,给出高效算法实现最优样本复杂度率。
验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。
CAVA:用于智能代理人工智能系统运行时治理的规范动作验证与认证
机构 * Ond Holdings Inc(Ond控股公司)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 研究智能代理人工智能系统异构运行时带来的治理问题。提出CAVA,将异构代理活动转换为规范动作对象。通过基准参考实现研究,为部署者端人工智能治理提供动作级规范化和语义模式的系统表述。
Comments 35 pages. Working paper on canonical action verification, runtime governance, semantic pattern detection, and approval-bound action receipts
OpenProver:使用Lean 4进行智能且交互式的定理证明
机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。
Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)
Lean-QIT:迈向量子信息理论的形式化基础设施
机构 * QudeLeap Research(QudeLeap研究院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) ; The University of Hong Kong(香港大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。
Comments 24+5 pages, 3 figures
执行证明:受治理人工智能代理行动的运行时验证
机构 * AlphaBitCore, Inc.(AlphaBitCore公司)
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 研究人工智能代理行动正确性验证问题,提出运行时证明(PoE)方法构建执行三元组及相关谓词和保证,证明其合理性,通过原型测试验证效果,能将多方面绑定到可检查对象,使受治理执行可证。
Comments 14 pages, 1 figure, 4 tables, 1 algorithm; includes formal soundness and replay theorems with witness constructions in appendix
人工智能在科学发现中的三层框架
机构 * Department of Mathematics, University of Texas at Arlington(德克萨斯大学阿灵顿分校数学系)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出AI在科学发现中的三层框架,核心创新是第二层:通过定性推理进行模型形成,识别框架结构不足并寻找缺失概念,通过三个案例说明其重要性。
编码智能体中的潜在编程视界
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。
临床记录的多大型语言模型编排严重程度评估(MOSAIC)
机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) ; GSK(葛兰素史克) ; School of Pharmacy, University of Rhode Island(罗德岛大学药学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL
AI总结 研究用MOSAIC这一两阶段智能语言模型框架对2型糖尿病严重程度进行表型分析,以合成队列评估其与多种算法真值对比情况及全因死亡率等,结果显示该框架有优势,智能分类与固定规则执行不同。
使用中间形式规范训练代码语言模型进行推理
机构 * FPT Software AI Center(FPT软件人工智能中心) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Hanoi Univ. of Science and Tech.(河内科学技术大学) ; Texas, USA(得克萨斯州,美国) ; Hanoi, Vietnam(河内,越南)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL
AI总结 研究可执行检查点规范生成,介绍SpecCoder框架从多种程序学习,能选正确规范拒错误执行。引入HumanExec基准测试,实验表明其提升了检查点规范质量及下游正确性推理和修复能力。
SABLE:工业 EDA 流程中用于模拟电路优化的 NDA 安全闭环 LLM 框架
机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 研究针对工业模拟流程中数据安全问题,提出 SABLE 框架,结合多种安全措施,能让 LLM 通过特定工具优化模拟电路,在实际任务中评估多个模型,验证其有效性。
LLMs作为数学考试评分的助教:可靠性与实际可用性
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 评估六种LLM配置在离散数学考试评分中的表现,发现宽松评分策略降低错误率,但点校准与排名保持仍是不同目标。
Comments 12 Pages, 6 figures
面向智能体RAG管道的贝叶斯不确定性传播:多跳问答的概念验证研究
机构 * University of Hull(赫尔大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出一种不确定性感知的智能体RAG框架,通过贝叶斯网络传播各阶段的不确定性信号,以估计系统级不确定性并定位潜在故障点,在HotpotQA上表现有效,但在StrategyQA上受限于校准问题。
Comments Submitted for 7th International Conference on Maintenance and Intelligent Asset Management (ICMIAM 2026)
AxDafny: Dafny中的智能验证代码生成
机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。
ToE:一种具有动态多源证据检索与聚合的分层可解释声明验证框架
机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学信息科学与技术学院) ; TravelSky Technology Limited(TravelSky技术有限公司) ; School of Computer Science, University of Auckland(奥克兰大学计算机科学学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出Tree of Evidence (ToE)框架,通过强化学习驱动的多源检索、证据评估和参数树聚合,实现可解释的自动事实核查,在多个数据集上提升4-24个百分点,尤其对抗性毒化输入效果显著。
LCAi: 基于大数据融合与检索增强生成辅助解释的生命周期评估
机构 * Institute for Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zürich(苏黎世联邦理工学院化学与应用生物科学系化学与生物工程研究所) ; NCCR Catalysis(瑞士国家研究能力中心催化研究所)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出一种视角条件检索增强生成框架,通过多视角检索与受控合成,在AI辅助生命周期评估中实现结构化解释,减少幻觉风险并保持跨领域多样性。
Comments 23 pages, 14 figures, 6 tables. Includes Supplementary Information
LLM 生成的 VeriFast 规范实证研究
机构 * Purdue University(普渡大学) ; University of Michigan(密歇根大学) ; Meta ; Ann Arbor, Michigan, USA(美国密歇根州安阿伯) ; Menlo Park, California, USA(美国加州Menlo Park) ; West Lafayette, Indiana, USA(美国印第安纳州西拉法叶)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 本研究评估了大型语言模型为分离逻辑验证器 VeriFast 生成规范的能力,发现虽然功能保持良好(>91%),但验证成功率仅31.4%,主要错误源于领域知识不足。
大语言模型在研究级数学问题上的失败模式:分类与实证刻画
机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。
TheoremGraph:连接形式化与非形式化数学
机构 * University of Washington Math AI Lab(华盛顿大学数学人工智能实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出TheoremGraph,构建统一语句级依赖图,连接非形式化(arXiv论文)和形式化(Lean)数学,通过嵌入自然语言标语实现跨域链接,并验证了检索性能。
Comments 31 pages, 9 figures, 21 tables
形式验证证书的循环一致性神经解释
机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。
Comments 15 pages of main text
闭环:形式化验证的法律作为自我改进法律AI的奖励信号
机构 * Harvard University(哈佛大学) ; Columbia University(哥伦比亚大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG
AI总结 提出一种架构,通过LLM驱动的形式化转换和验证内核,为法律AI提供可验证的奖励信号,实现闭环强化学习,并在多个法律领域展示其优势。
Comments 14 pages, no figures
可信AI的密码学有效性证书
机构 * Heriot-Watt University(赫瑞思-瓦特大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。
机器人安全的可验证基础模型
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。
GIF: 局部几何信息流控制用于大语言模型
机构 * Columbia University(哥伦比亚大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。
Grounded Scaling: 为什么代理型AI需要确定性环境
机构 * Alibaba Group(阿里巴巴集团)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 本文论证环境确定性是影响长链代理任务成功的关键因素,提出确定性-效率界限、验证者-古德哈特下限等理论,并构建供应确定性指数和确定性成熟度模型。
由AI编写,由AI管理:跨越391个连续会话的语义空间控制与索引病消除
机构 * Shenzhen Yunxi Technology Co., Ltd.(深圳云曦科技有限公司) ; Information Technology Center, Tsinghua University(清华大学信息科学技术中心)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL
AI总结 本文通过真实软件项目中的行动研究,发现长期LLM协作中增加形式约束反而导致“索引病”,提出“基线-日志物理分离”机制,有效消除该问题。
Comments 22 pages, 2 tables, 1 figure. Action research. Bilingual submission (Chinese companion version included as supplementary). Submitted to ICSE 2027 IOR track