arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1124 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1124 篇

2603.00617 2026-03-03 cs.CY 50%

Dial E for Ethical Enforcement: institutional VETO power as a governance primitive

为伦理执行而 Dial E:作为治理原语的机构 veto 权力

Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出机构 veto 权力作为治理原语,旨在通过正式权威阻止潜在武器化风险,推动模型去武装和伦理执行。

Comments Accepted at the AI for Peace Workshop at ICLR 2026.32 Pages and 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00168 2026-02-27 cs.FL cs.LO 50%

Generalised Möbius Categories and Convolution Kleene Algebras

广义莫比乌斯范畴与卷积克里勒代数

James Cranch, Georg Struth, Jana Wagemaker

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出广义莫比乌斯范畴与经典星定义的结合,用于构建卷积克里勒代数,应用于程序验证和高维重写中的代数推理。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15831 2026-02-19 cs.HC cs.MA 50%

A2H: Agent-to-Human Protocol for AI Agent

A2H:AI代理的代理到人类协议

Zhiyuan Liang, Enfang Cui, Qian Wei, Rui She, Tianzheng Li, Minxin Guo, Yujun Cheng

专题命中 代码与定理证明 :planning(abstract)

AI总结 A2H协议通过统一机制使人类成为可发现的可解析实体,推动AI代理向人类连接的智能基础设施发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13212 2026-02-17 cs.RO cs.MA cs.SY eess.SY 50%

UAVGENT: A Language-Guided Distributed Control Framework

UAVGENT: 一种语言引导的分布式控制框架

Ziyi Zhang, Xiyu Deng, Guannan Qu, Yorie Nakahira

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 UAVGENT通过结合语言引导的任务推理与分布式反馈控制,实现了多无人机系统在复杂任务中的鲁棒性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12540 2026-02-16 cs.CV cs.RO 50%

Self-Supervised JEPA-based World Models for LiDAR Occupancy Completion and Forecasting

基于JEPA的世界模型的自监督LiDAR占用完成与预测

Haoran Zhu, Anna Choromanska

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出AD-LiST-JEPA,一种基于JEPA框架的自监督世界模型,用于自动驾驶中通过LiDAR数据预测未来时空演变,并在占用完成与预测任务中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04846 2026-02-05 cs.LO cs.PL 50%

CSLib: The Lean Computer Science Library

CSLib: 用于证明计算机科学定理和编写形式验证代码的轻量级框架

Clark Barrett, Swarat Chaudhuri, Fabrizio Montesi, Jim Grundy, Pushmeet Kohli, Leonardo de Moura, Alexandre Rademaker, Sorrachai Yingchareonthawornchai

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 CSLib是一个旨在提升Lean在计算机科学领域应用的开源框架,通过增强形式验证能力促进教育与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09696 2026-02-05 cs.HC 50%

Patterns for a New Generation: AI and Agents

新一代的模式:人工智能与代理

Joseph Corneli, Charles J. Danoff, Raymond S. Puzio, Sridevi Ayloo, Sergio Belich, Andre Wilkinson, Mary Tedeschi, Pauline Mosley

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出利用设计模式指导代理行为,展示基于LLM的系统能读取生成模式,并探讨其在软件开发、教育等领域的应用潜力。

Comments 10 pages with 4 page appendix; to appear in Proceedings of Pattern Languages of Programs 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01291 2026-02-03 cs.LO 50%

Construction-Verification: A Benchmark for Applied Mathematics in Lean 4

构造-验证:Lean 4中的应用数学基准

Bowen Yang, Yi Yuan, Chenyi Li, Ziyu Wang, Liangqi Li, Bo Zhang, Zhe Li, Zaiwen Wen

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20764 2026-01-29 cs.DC cs.MA 50%

Agentic Fog: A Policy-driven Framework for Distributed Intelligence in Fog Computing

代理雾:一种基于策略的雾计算分布式智能框架

Saeed Akbar, Muhammad Waqas, Rahmat Ullah

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种基于策略的雾计算框架,通过将雾节点建模为自主代理并利用势博弈理论,实现了动态环境下的高效资源管理和稳定系统收敛。

Comments 09 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12845 2026-01-21 cs.SE 50%

Automatic Generation of Formal Specification and Verification Annotations Using LLMs and Test Oracles

利用LLMs和测试或acles自动生成形式规范和验证注解

João Pascoal Faria, Emanuel Trigo, Vinicius Honorato, Rui Abreu

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文利用LLMs和测试或acles自动为Dafny程序生成形式规范和验证注解,实验表明该方法在多数情况下有效,并展示了IDE集成的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01298 2026-01-19 cs.IR 50%

Augmented Knowledge Graph Querying leveraging LLMs

增强知识图谱查询利用大语言模型

Marco Arazzi, Davide Ligari, Serena Nicolazzo, Antonino Nocera

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 SparqLLM通过结合RAG和LLM技术,实现高效的知识图谱查询与可视化,提升非专家用户的数据交互能力。

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23780 2026-01-09 cs.SE 50%

Test Case Specification Techniques and System Testing Tools in the Automotive Industry: A Review

汽车行业中测试用例规范技术与系统测试工具:综述

Denesa Zyberaj, Pascal Hirmer, Marco Aiello, Stefan Wagner

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文通过系统文献综述和行业经验,综述了汽车行业测试用例规范技术与系统测试工具的挑战与需求,提出了优先级标准目录,支持技术选择和未来测试框架改进。

Comments This is the author accepted manuscript (AAM) of a paper accepted for publication in The Journal of Systems and Software (Elsevier). The final published version will be available via the journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03923 2026-01-08 cs.CR 50%

Human Challenge Oracle: Designing AI-Resistant, Identity-Bound, Time-Limited Tasks for Sybil-Resistant Consensus

人类挑战Oracle:设计抗AI、身份绑定、时间限制的任务以实现抗Sybil共识

Homayoun Maleki, Nekane Sainz, Jon Legarda

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出HCO,一种通过时间限制、身份绑定挑战来对抗Sybil攻击的新型安全机制,旨在提升共识系统的抗AI能力。

Comments 21 pages, 4 tables. Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03768 2026-01-08 cs.PL 50%

Agentic Proof Automation: A Case Study

代理证明自动化:一个案例研究

Yichen Xu, Martin Odersky

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本研究提出代理证明自动化方案,利用LLM代理高效完成证明工程任务,通过案例研究展示其在形式化系统中的应用与成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13961 2026-01-07 cs.RO 50%

FICO: Finite-Horizon Closed-Loop Factorization for Unified Multi-Agent Path Finding

FICO:有限时间闭环因子分解用于统一多智能体路径寻找

Jiarui Li, Alessandro Zanardi, Federico Pecora, Runyu Zhang, Gioele Zardini

专题命中 代码与定理证明 :planning(abstract)

AI总结 FICO通过系统级建模和闭环设计,实现了多智能体路径寻找问题的高效解决,显著提升了计算效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02377 2026-01-07 cs.RO 50%

Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges

对LLM控制的机器人信任:安全威胁、防御和挑战的综述

Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00433 2026-01-05 physics.soc-ph 50%

Modelling cultural evolution

文化进化建模

Fredrik Jansson

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种文化进化建模的通用模板,通过动态循环连接系统状态、认知过程、行为和宏观结果,以理解文化变化的多元但一致的机制。

Comments Chapter in Johan Lind and Anna Jon-And, eds.: Cultural Evolution from Minimal Principles, Cambridge University Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22892 2025-12-30 stat.AP 50%

Counterfactual Harm: A Counter-argument

反事实伤害:一种反论点

Amit N. Sawant, Mats J. Stensrud

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文指出基于反事实的伤害定义在多治疗选项场景下会产生不一致性,提出基于预期效用的干预定义以确保治疗排名的传递性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20457 2025-12-24 cs.MA cs.LO 50%

When Natural Strategies Meet Fuzziness and Resource-Bounded Actions (Extended Version)

当自然策略与模糊性及资源受限行动相遇(扩展版本)

Marco Aruta, Francesco Improta, Vadim Malvone, Aniello Murano

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出HumanATLF逻辑,结合模糊语义和资源受限行动,解决自然策略中成本和不确定性的问题,并证明模型检查的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18885 2025-12-24 cs.PL 50%

A Minimalist Proof Language for Neural Theorem Proving over Isabelle/HOL

为Isabelle/HOL上的神经定理证明设计的最小化证明语言

Qiyuan Xu, Renxi Wang, Peixin Wang, Haonan Li, Conrad Watt

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出Minilang,一种简洁的证明语言,用于提升神经定理证明在形式证明中的性能。

Comments Accepted in OOPSLA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14673 2025-12-17 cs.SE 50%

Reconsidering Conversational Norms in LLM Chatbots for Sustainable AI

重新审视LLM聊天机器人中的会话规范以实现可持续AI

Ronnie de Souza Santos, Cleyton Magalhães, Italo Santos

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文探讨了LLM聊天机器人中会话规范对可持续性的影响,指出交互行为、对话模式、用户习惯及上下文积累是影响系统能耗的关键因素,需重新设计交互方式以实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21230 2025-12-17 cs.LO 50%

Kimina Lean Server: A High-Performance Lean Server for Large-Scale Verification

Kimina Lean Server: 一种高性能的大型验证用Lean服务器

Marco Dos Santos, Hugues de Saxcé, Haiming Wang, Ran Wang, Mantas Baksys, Mert Unsal, Junqi Liu, Zhengying Liu, Jia Li

专题命中 代码与定理证明 :verifier(abstract)

AI总结 Kimina Lean Server通过高效的并行处理和缓存机制,提升了大规模验证和数据提取的效率,适用于强化学习管道中的高性能验证任务。

Comments Accepted to the 5th MATH-AI Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11369 2025-12-12 cs.CY 50%

Beyond the Hype: Critical Analysis of Student Motivations and Ethical Boundaries in Educational AI Use in Higher Education

超越 hype:批判性分析高等教育中教育 AI 使用的学生动机与伦理边界

Adeleh Mazaherian, Erfan Nourbakhsh

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文探讨高等教育中学生使用 AI 的动机与伦理问题,指出学生普遍依赖 AI 工具但缺乏指导,女性更关注 AI 滥用风险,提出通过 AI 文化课程和评估改革促进负责任的 AI 采用。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07452 2025-12-09 cs.IR 50%

From Show Programmes to Data: Designing a Workflow to Make Performing Arts Ephemera Accessible Through Language Models

从节目到数据:设计一种工作流,通过语言模型使表演艺术的临时性资料可访问

Clarisse Bardiot, Pierre-Carl Langlais, Bernard Jacquemin, Jacob Hart, Antonios Lagarias, Nicolas Foucault, Aurélie Lemaître-Legargeant, Jeanne Fras

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出利用多模态语言模型和本体推理模型,将戏剧节目转化为结构化数据,以提升文化遗产资料的可访问性和分析能力。

Comments 19 pages, 8 figures, 5 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06178 2025-12-09 cs.SE 50%

Systematically Thinking about the Complexity of Code Structuring Exercises at Introductory Level

在初级课程中系统思考代码结构练习的复杂性

Georgiana Haldeman, Peter Ohmann, Paul Denny

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一个框架,用于系统评估初级课程中代码结构练习的复杂性,通过定义重复、代码模式和数据依赖性三个维度,帮助设计提升学生分解与抽象能力的教育任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03635 2025-12-04 cs.LO cs.SE 50%

Formal Analysis of the Sigmoid Function and Formal Proof of the Universal Approximation Theorem

对Sigmoid函数的正式分析及通用逼近定理的正式证明

Dustin Bryant, Jim Woodcock, Simon Foster

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文在Isabelle/HOL中形式化分析了Sigmoid函数并证明了通用逼近定理,填补了形式化证明库的空白,提升了神经网络的可信度。

Comments 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02544 2025-12-03 cs.CY 50%

A Human-centric Framework for Debating the Ethics of AI Consciousness Under Uncertainty

以人为中心的AI意识伦理争论框架

Zhou Ziheng, Haiqiang Dai, Bin Ling, Ying Nian Wu, Demetri Terzopoulos

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出以人为中心的AI意识伦理框架,通过哲学不确定性的三级结构,确立无意识假设、风险谨慎和透明推理原则,以平衡哲学严谨性与实践指导,为AI伦理问题提供负责任的演进路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23188 2025-12-01 cs.HC 50%

Can Intelligent User Interfaces Engage in Philosophical Discussions? A Longitudinal Study of Philosophers' Evolving Perceptions

智能用户界面能否参与哲学讨论?哲学家们观念演变的纵向研究

Yibo Meng, Lyumanshan Ye, Eve He, Zhe Yan, Zhiming Liu, Yipeng Yu, Yan Guan, Xiaolan Ding

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本研究通过纵向研究探讨哲学学者对生成式AI智能用户界面参与哲学讨论态度的演变,发现其从抵制到接受再到质疑的三阶段变化,揭示IUI在哲学推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18509 2025-11-27 cs.PL 50%

Higher-Order Behavioural Conformances via Fibrations

通过纤维化实现更高阶的行为一致性

Henning Urbat

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种统一的范畴方法,通过纤维化实现高阶语言的行为一致性,证明了最大行为一致性在一般条件下的合同性质。

详情

展开后加载摘要…

URL PDF HTML 收藏