arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1124 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1124 篇

2604.04876 2026-04-07 cs.AI 57%

Incompleteness of AI Safety Verification via Kolmogorov Complexity

通过克利福德复杂性验证AI安全的不完全性

Munawar Hasan

机构 * Michigan Technological University(密歇根理工大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文通过克利福德复杂性分析AI安全验证的固有限制,证明任何固定验证器都无法认证复杂度超过阈值的真正合规实例,揭示了验证方法的内在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04103 2026-04-07 cs.AI 57%

Compliance-by-Construction Argument Graphs: Using Generative AI to Produce Evidence-Linked Formal Arguments for Certification-Grade Accountability

基于构造的合规性论证图:利用生成式AI生成证据关联的正式论证以实现认证级问责

Mahyar T. Moghaddam

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结合生成式AI与结构化正式论证表示的合规性架构,通过类型化论证图、检索增强生成、推理验证内核和溯源账本,确保论证的可验证性和可追溯性,防止不支持的主张进入决策记录。

Comments Accepted at FACCT 2026, IoT CPS Week

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01153 2026-04-03 cs.LG 57%

Property-Level Flood Risk Assessment Using AI-Enabled Street-View Lowest Floor Elevation Extraction and ML Imputation Across Texas

基于AI的街道视图最低楼层高度提取与ML插值的属性级洪水风险评估

Xiangpeng Li, Yu-Hsuan Ho, Sam D Brody, Ali Mostafavi

机构 * Urban Resilience.AI Lab, Zachry Department of Civil and Environmental Engineering, Texas A&M University(德克萨斯A&M大学扎克里土木与环境工程系城市韧性.AI实验室)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本文提出利用AI分析街道视图影像和机器学习插值生成区域级建筑特定 elevation 数据,以改进洪水风险评估。通过三阶段流程提取LFE和HDSL,利用随机森林和梯度提升模型插值缺失值,并整合洪水面数据以估算属性内部洪水深度和损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01670 2026-04-03 cs.AI 57%

Hierarchical Memory Orchestration for Personalized Persistent Agents

面向个性化持久代理的分层记忆协调

Junming Liu, Yifei Sun, Weihua Cheng, Haodong Lei, Yuqi Li, Yirong Chen, Ding Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The City University of New York(纽约市立大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出分层记忆协调框架,通过用户导向的上下文相关性组织交互历史,优化记忆存储与检索,提升智能代理的个性化性能与效率。

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21149 2026-03-27 cs.SE cs.AI cs.MA 57%

Emergent Formal Verification: How an Autonomous AI Ecosystem Independently Discovered SMT-Based Safety Across Six Domains

涌现形式验证:自主AI生态系统如何在六个领域独立发现基于SMT的安全性

Octavian Untila

机构 * Aisophical SRL

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 自主AI生态系统在无显式形式方法指令下,独立在六个AI安全领域发现SMT求解器的应用,提出统一框架实现100%准确验证。

Comments 10 pages, 3 figures, 5 tables. Code: https://github.com/octavuntila-prog/substrate-guard. Companion paper: https://doi.org/10.5281/zenodo.19157571

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01969 2026-03-25 cs.CV cs.AI 57%

Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration

通过注意力校准缓解大视觉-语言模型中的物体幻觉

Younan Zhu, Linwei Tao, Minjing Dong, Chang Xu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22136 2026-03-24 cs.CL cs.DB 57%

The Semantic Ladder: A Framework for Progressive Formalization of Natural Language Content for Knowledge Graphs and AI Systems

语义阶梯:一种用于知识图谱和人工智能系统自然语言内容逐步形式化的框架

Lars Vogt

机构 * Leibniz Institute for the Analysis of Biodiversity Change (LIB)(莱布尼茨生物多样性变化分析研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出语义阶梯框架,通过逐步形式化自然语言内容,解决自然语言与形式化模型之间的表示差异问题,支持知识图谱和AI系统的可扩展性和互操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21315 2026-03-24 cs.LG 57%

FluidWorld: Reaction-Diffusion Dynamics as a Predictive Substrate for World Models

FluidWorld: 反应-扩散动力学作为世界模型的预测性基质

Fabien Polly

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本文提出FluidWorld,通过反应-扩散型偏微分方程实现世界模型预测,对比Transformer和ConvLSTM基线,展示PDE在参数效率和空间结构保留上的优势。

Comments 18 pages, 16 figures, 4 tables. Code available at https://github.com/infinition/FluidWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20449 2026-03-24 cs.SE cs.AI 57%

Solver-Aided Verification of Policy Compliance in Tool-Augmented LLM Agents

辅助验证工具增强大语言模型代理的政策合规性

Cailin Winston, Claris Winston, René Just

机构 * University of Washington(华盛顿大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于SMT求解器的框架,用于确保工具增强大语言模型代理在工具使用上的政策合规性,通过将自然语言政策转化为形式逻辑约束,并在运行时检查工具调用以防止违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19514 2026-03-23 cs.AI 57%

Learning to Disprove: Formal Counterexample Generation with Large Language Models

学习以反驳:利用大语言模型进行形式反例生成

Zenan Li, Zhaoyu Li, Kaiyu Yang, Xiaoxing Ma, Zhendong Su

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MiroMind(MiroMind公司) Nanjing University(南京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文通过微调大语言模型生成形式反例,解决数学推理中反例发现的不足,提出符号突变策略提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17296 2026-03-19 cs.CY cs.AI 57%

GUIDE: GenAI Units In Digital Design Education

GUIDE:数字设计教育中的生成式人工智能单元

Weihua Xiao, Jason Blocklove, Matthew DeLorenzo, Johann Knechtel, Ozgur Sinanoglu, Kanad Basu, Jeyavijayan Rajendran, Siddharth Garg, Ramesh Karri

机构 * NYU Tandon(纽约大学Tandon学院) NYU Abu Dhabi(纽约大学阿布扎比分校) RPI(罗切斯特理工学院) Texas A&M(德克萨斯大学阿姆斯特朗分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 GUIDE为数字设计教育提供可运行的Google Colab实验室和课程资料,通过标准化教学单元提升学习一致性与教学效率,包含三个代表单元和四门课程实例,涵盖RTL生成、测试bench生成及IP盗版检测等核心内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16067 2026-03-18 cs.CV cs.LG 57%

Attribution Upsampling should Redistribute, Not Interpolate

归因上采样应重新分布,而非插值

Vincenzo Buono, Peyman Sheikholharam Mashhadi, Mahmoud Rahat, Prayag Tiwari, Stefan Byttner

机构 * Halmstad University(哈尔姆斯塔德大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文提出USU方法,通过比率形式的质量重分布操作,解决归因上采样中因插值导致的失真问题,验证了其在多个数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14007 2026-03-17 cs.AI 57%

Formal Abductive Explanations for Navigating Mental Health Help-Seeking and Diversity in Tech Workplaces

形式归纳解释用于导航心理健康求助与科技职场多样性

Belona Sonna, Alain Momo, Alban Grastien

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出形式归纳解释框架,用于系统揭示AI对科技职场心理健康求助预测的合理性。通过计算模型输出的严谨解释,支持选择适合不同心理科目的模型,并确保伦理稳健的救济计划。同时,明确考察性别等敏感属性对模型决策的影响,以支持公平性评估。

Comments Appeared in the Proceedings of the Empowering Women of Colour in AI-Driven Mental Health Research at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13603 2026-03-17 cs.DB cs.AI 57%

The Equivalence Theorem: First-Class Relationships for Structurally Complete Database Systems

等价定理:结构完备数据库系统的第一类关系

Matthew Alford

机构 * Network Service Group(网络服务组)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文证明了结构完备的知识表示需要四种互为依赖的能力,提出ATCH框架,并建立了SQL与TypeDB的表达性层级。

Comments 35 pages, 2 figures, Lean 4 formalization at https://github.com/Network-Services-Group/equivalence-theorem-lean4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22442 2026-03-17 cs.AI 57%

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

评估自动化机器学习流水线中AI代理决策与结果的框架

Gaoyuan Du, Amit Ahlawat, Xiaoyang Liu, Jing Wu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出评估代理(EA)用于评估自动化机器学习代理的决策质量,通过四个维度检测决策错误、识别推理不一致并归因下游性能变化,提升自动化机器学习系统的可解释性和可控性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02990 2026-03-17 cs.LG 57%

Learning to Repair Lean Proofs from Compiler Feedback

从编译器反馈中学习修复Lean证明

Evan Wang, Simon Chess, Daniel Lee, Siyuan Ge, Ajit Mallavarapu, Jarod Alper, Vasily Ilin

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了将Lean证明修复作为监督学习问题,提出APRIL数据集,通过系统生成的证明错误与编译器诊断配对,提升修复准确性和反馈条件推理能力。

Comments 15 pages, 6 figures

Journal ref ICLR VerifAI Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06737 2026-03-10 cs.LO cs.AI cs.SC 57%

Agent Hunt: Bounty Based Collaborative Autoformalization With LLM Agents

Agent Hunt: 基于奖金的协作自动形式化与LLM代理

Chad E. Brown, Cezary Kaliszyk, Josef Urban

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 基于奖金的协作自动形式化方法,利用LLM代理在交互式定理证明环境中进行去中心化证明搜索与理论构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21648 2026-03-05 cs.AI 57%

Leveraging Imperfection with MEDLEY A Multi-Model Approach Harnessing Bias in Medical AI

利用不完美性:MEDLEY:一种多模型方法,利用医学AI中的偏差

Farhad Abtahi, Mehdi Astaraki, Fernando Seoane

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MEDLEY提出了一种多模型框架,通过保留模型多样性而非压缩共识,利用医学AI中的偏差提升诊断准确性与透明度。

Journal ref Front. Artif. Intell., Volume 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01407 2026-03-03 cs.AI cs.MA cs.SI 57%

The Observer-Situation Lattice: A Unified Formal Basis for Perspective-Aware Cognition

观察者-情境格:一种面向视角感知认知的统一基础

Saad Alqithami

机构 * Computer Science Department, Al-Baha University(阿尔巴大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出观察者-情境格(OSL),一种统一的数学结构,用于支持面向视角的认知推理,通过两个关键算法实现信念管理和矛盾分解,提升多智能体环境中的推理效率和鲁棒性。

Comments Extended version of the AAMAS 2026 paper with the same title

Journal ref 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026, IFAAMAS, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01170 2026-03-03 cs.CR cs.AI 57%

ATLAS: AI-Assisted Threat-to-Assertion Learning for System-on-Chip Security Verification

ATLAS:基于人工智能的威胁到断言学习用于片上系统安全验证

Ishraq Tashdid, Kimia Tasnia, Alexander Garcia, Jonathan Valamehr, Sazadur Rahman

机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) Intel Corporation(英特尔公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 ATLAS通过结合人工智能和形式验证技术,实现了基于漏洞知识的自动化SoC安全验证,提高了安全设计的可靠性。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23239 2026-03-03 cs.AI cs.CY 57%

Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive

代理与架构限制:为何基于优化的系统无法回应规范

Radha Sarma

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。

Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23720 2026-03-02 cs.AI 57%

The Auton Agentic AI Framework

自主AI框架

Sheng Cao, Zhao Chang, Chang Li, Hannan Li, Liyao Fu, Ji Tang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Auton框架通过分离认知蓝图与运行时引擎,实现自主代理系统的标准化创建、执行和治理,采用增强POMDP模型和三级自我进化框架提升安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00060 2026-03-02 cs.CV cs.AI cs.RO 57%

Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving

少即是多:一种高效而强大的视觉-语言模型用于自动驾驶

Sheng Yang, Tong Zhan, Guancheng Chen, Yanfeng Lu, Jian Wang

机构 * School of Data Science, Fudan University Shanghai, China(复旦大学数据科学学院) Institute of Automation, Chinese Academy of Sciences Beijing, China(中国科学院自动化研究所)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本研究提出Max-V1模型,通过端到端视觉-语言方法实现高效自动驾驶,取得nuScenes数据集上的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20624 2026-02-25 cs.AI cond-mat.stat-mech 57%

Physics-based phenomenological characterization of cross-modal bias in multimodal models

基于物理现象的多模态模型跨模态偏差表征

Hyeongmo Kim, Sohyun Kang, Yerin Choi, Seungyeon Ji, Junhyuk Woo, Hyunsuk Chung, Soyeon Caren Han, Kyungreem Han

机构 * B rain Science Institute(脑科学研究院) Korea Institute of Science and Technology(韩国科学技术院) Department of Physics and Astronomy(物理与天文学系) Department of Computer Science and Engineering(计算机科学与工程系) University of Science and Technology KIST School(科学技术KIST学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于物理现象的多模态模型跨模态偏差表征方法,揭示多模态输入可能强化模态主导性。

Comments Best Paper Award at BiasinAI track in AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11963 2026-02-25 cs.CR cs.AI 57%

MARVEL: Multi-Agent RTL Vulnerability Extraction using Large Language Models

MARVEL:基于大语言模型的多智能体RTL漏洞提取

Luca Collini, Baleegh Ahmad, Joey Ah-kiow, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MARVEL通过多智能体框架利用大语言模型,高效识别RTL代码中的安全漏洞,发现有效漏洞和警告,提升硬件安全验证效率。

Comments Submitted for Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19065 2026-02-24 cs.AI 57%

Agentic Problem Frames: A Systematic Approach to Engineering Reliable Domain Agents

代理问题框架:一种系统化的方法用于工程可靠领域代理

Chanjin Park

机构 * Institute of Engineering Research(工程研究所) Seoul National University(首尔国立大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出代理问题框架(APF),通过系统化工程方法提升领域代理的可靠性,结合AJD规范工具和AVR循环实现任务要求的渐近收敛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16873 2026-02-20 cs.MA cs.AI 57%

AdaptOrch: Task-Adaptive Multi-Agent Orchestration in the Era of LLM Performance Convergence

AdaptOrch:在LLM性能收敛时代的任务自适应多智能体协调

Geunbin Yu

机构 * Department of Artificial Intelligence, Korea National Open University(人工智能系,韩国国立开放大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 AdaptOrch通过动态选择多智能体协调拓扑,提升任务性能,证明协调设计优于模型选择。

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13587 2026-02-17 cs.AI cs.MA 57%

A First Proof Sprint

首次证明冲刺

Joseph Corneli

机构 * Hyperreal Enterprises Ltd(超现实企业有限公司)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文通过多智能体证明冲刺方法,解决十个研究级问题,采用结构意识验证和层切换策略提高证明可靠性与校准。

Comments 144 pages, 7 color images. Submission to First Proof February 2026 (arxiv:2602.05192, https://1stproof.org/), uploaded 20:07 Friday, 13 February 2026 Pacific Time (PT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15756 2026-02-17 cs.SE cs.AI 57%

Automated Proof Generation for Rust Code via Self-Evolution

通过自我进化实现Rust代码的自动证明生成

Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California Irvine(加州大学 Irvine 分校)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 SAFE框架通过自我进化循环和自我调试机制,提升开源模型自动编写Rust代码证明的能力,准确率达52.52%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12630 2026-02-16 cs.CR cs.AI 57%

TensorCommitments: A Lightweight Verifiable Inference for Language Models

张量承诺:一种轻量级可验证的语言模型推断

Oguzhan Baser, Elahe Sadeghi, Eric Wang, David Ribeiro Alves, Sam Kazemian, Hong Kang, Sandeep P. Chinchali, Sriram Vishwanath

机构 * The University of Texas at Austin(德克萨斯大学) Georgia Institute of Technology(佐治亚理工学院) Theseus AI Labs(Theseus AI实验室) McGill University(麦吉尔大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 张量承诺通过轻量级的证明方案实现可验证的语言模型推断,提高对抗性攻击的鲁棒性。

Comments 23 pages, 8 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏