arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2502.01298 2026-01-19 cs.IR 50%

Augmented Knowledge Graph Querying leveraging LLMs

增强知识图谱查询利用大语言模型

Marco Arazzi, Davide Ligari, Serena Nicolazzo, Antonino Nocera

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 SparqLLM通过结合RAG和LLM技术,实现高效的知识图谱查询与可视化,提升非专家用户的数据交互能力。

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23780 2026-01-09 cs.SE 50%

Test Case Specification Techniques and System Testing Tools in the Automotive Industry: A Review

汽车行业中测试用例规范技术与系统测试工具:综述

Denesa Zyberaj, Pascal Hirmer, Marco Aiello, Stefan Wagner

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文通过系统文献综述和行业经验,综述了汽车行业测试用例规范技术与系统测试工具的挑战与需求,提出了优先级标准目录,支持技术选择和未来测试框架改进。

Comments This is the author accepted manuscript (AAM) of a paper accepted for publication in The Journal of Systems and Software (Elsevier). The final published version will be available via the journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03923 2026-01-08 cs.CR 50%

Human Challenge Oracle: Designing AI-Resistant, Identity-Bound, Time-Limited Tasks for Sybil-Resistant Consensus

人类挑战Oracle:设计抗AI、身份绑定、时间限制的任务以实现抗Sybil共识

Homayoun Maleki, Nekane Sainz, Jon Legarda

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出HCO,一种通过时间限制、身份绑定挑战来对抗Sybil攻击的新型安全机制,旨在提升共识系统的抗AI能力。

Comments 21 pages, 4 tables. Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03768 2026-01-08 cs.PL 50%

Agentic Proof Automation: A Case Study

代理证明自动化:一个案例研究

Yichen Xu, Martin Odersky

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本研究提出代理证明自动化方案,利用LLM代理高效完成证明工程任务,通过案例研究展示其在形式化系统中的应用与成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13961 2026-01-07 cs.RO 50%

FICO: Finite-Horizon Closed-Loop Factorization for Unified Multi-Agent Path Finding

FICO:有限时间闭环因子分解用于统一多智能体路径寻找

Jiarui Li, Alessandro Zanardi, Federico Pecora, Runyu Zhang, Gioele Zardini

专题命中 代码与定理证明 :planning(abstract)

AI总结 FICO通过系统级建模和闭环设计,实现了多智能体路径寻找问题的高效解决,显著提升了计算效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02377 2026-01-07 cs.RO 50%

Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges

对LLM控制的机器人信任:安全威胁、防御和挑战的综述

Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00433 2026-01-05 physics.soc-ph 50%

Modelling cultural evolution

文化进化建模

Fredrik Jansson

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种文化进化建模的通用模板,通过动态循环连接系统状态、认知过程、行为和宏观结果,以理解文化变化的多元但一致的机制。

Comments Chapter in Johan Lind and Anna Jon-And, eds.: Cultural Evolution from Minimal Principles, Cambridge University Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22892 2025-12-30 stat.AP 50%

Counterfactual Harm: A Counter-argument

反事实伤害:一种反论点

Amit N. Sawant, Mats J. Stensrud

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文指出基于反事实的伤害定义在多治疗选项场景下会产生不一致性,提出基于预期效用的干预定义以确保治疗排名的传递性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20457 2025-12-24 cs.MA cs.LO 50%

When Natural Strategies Meet Fuzziness and Resource-Bounded Actions (Extended Version)

当自然策略与模糊性及资源受限行动相遇(扩展版本)

Marco Aruta, Francesco Improta, Vadim Malvone, Aniello Murano

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出HumanATLF逻辑,结合模糊语义和资源受限行动,解决自然策略中成本和不确定性的问题,并证明模型检查的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18885 2025-12-24 cs.PL 50%

A Minimalist Proof Language for Neural Theorem Proving over Isabelle/HOL

为Isabelle/HOL上的神经定理证明设计的最小化证明语言

Qiyuan Xu, Renxi Wang, Peixin Wang, Haonan Li, Conrad Watt

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出Minilang,一种简洁的证明语言,用于提升神经定理证明在形式证明中的性能。

Comments Accepted in OOPSLA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14673 2025-12-17 cs.SE 50%

Reconsidering Conversational Norms in LLM Chatbots for Sustainable AI

重新审视LLM聊天机器人中的会话规范以实现可持续AI

Ronnie de Souza Santos, Cleyton Magalhães, Italo Santos

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文探讨了LLM聊天机器人中会话规范对可持续性的影响,指出交互行为、对话模式、用户习惯及上下文积累是影响系统能耗的关键因素,需重新设计交互方式以实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21230 2025-12-17 cs.LO 50%

Kimina Lean Server: A High-Performance Lean Server for Large-Scale Verification

Kimina Lean Server: 一种高性能的大型验证用Lean服务器

Marco Dos Santos, Hugues de Saxcé, Haiming Wang, Ran Wang, Mantas Baksys, Mert Unsal, Junqi Liu, Zhengying Liu, Jia Li

专题命中 代码与定理证明 :verifier(abstract)

AI总结 Kimina Lean Server通过高效的并行处理和缓存机制,提升了大规模验证和数据提取的效率,适用于强化学习管道中的高性能验证任务。

Comments Accepted to the 5th MATH-AI Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11369 2025-12-12 cs.CY 50%

Beyond the Hype: Critical Analysis of Student Motivations and Ethical Boundaries in Educational AI Use in Higher Education

超越 hype:批判性分析高等教育中教育 AI 使用的学生动机与伦理边界

Adeleh Mazaherian, Erfan Nourbakhsh

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文探讨高等教育中学生使用 AI 的动机与伦理问题,指出学生普遍依赖 AI 工具但缺乏指导,女性更关注 AI 滥用风险,提出通过 AI 文化课程和评估改革促进负责任的 AI 采用。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07452 2025-12-09 cs.IR 50%

From Show Programmes to Data: Designing a Workflow to Make Performing Arts Ephemera Accessible Through Language Models

从节目到数据:设计一种工作流,通过语言模型使表演艺术的临时性资料可访问

Clarisse Bardiot, Pierre-Carl Langlais, Bernard Jacquemin, Jacob Hart, Antonios Lagarias, Nicolas Foucault, Aurélie Lemaître-Legargeant, Jeanne Fras

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出利用多模态语言模型和本体推理模型,将戏剧节目转化为结构化数据,以提升文化遗产资料的可访问性和分析能力。

Comments 19 pages, 8 figures, 5 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06178 2025-12-09 cs.SE 50%

Systematically Thinking about the Complexity of Code Structuring Exercises at Introductory Level

在初级课程中系统思考代码结构练习的复杂性

Georgiana Haldeman, Peter Ohmann, Paul Denny

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一个框架,用于系统评估初级课程中代码结构练习的复杂性,通过定义重复、代码模式和数据依赖性三个维度,帮助设计提升学生分解与抽象能力的教育任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03635 2025-12-04 cs.LO cs.SE 50%

Formal Analysis of the Sigmoid Function and Formal Proof of the Universal Approximation Theorem

对Sigmoid函数的正式分析及通用逼近定理的正式证明

Dustin Bryant, Jim Woodcock, Simon Foster

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文在Isabelle/HOL中形式化分析了Sigmoid函数并证明了通用逼近定理,填补了形式化证明库的空白,提升了神经网络的可信度。

Comments 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02544 2025-12-03 cs.CY 50%

A Human-centric Framework for Debating the Ethics of AI Consciousness Under Uncertainty

以人为中心的AI意识伦理争论框架

Zhou Ziheng, Haiqiang Dai, Bin Ling, Ying Nian Wu, Demetri Terzopoulos

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出以人为中心的AI意识伦理框架,通过哲学不确定性的三级结构,确立无意识假设、风险谨慎和透明推理原则,以平衡哲学严谨性与实践指导,为AI伦理问题提供负责任的演进路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23188 2025-12-01 cs.HC 50%

Can Intelligent User Interfaces Engage in Philosophical Discussions? A Longitudinal Study of Philosophers' Evolving Perceptions

智能用户界面能否参与哲学讨论?哲学家们观念演变的纵向研究

Yibo Meng, Lyumanshan Ye, Eve He, Zhe Yan, Zhiming Liu, Yipeng Yu, Yan Guan, Xiaolan Ding

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本研究通过纵向研究探讨哲学学者对生成式AI智能用户界面参与哲学讨论态度的演变,发现其从抵制到接受再到质疑的三阶段变化,揭示IUI在哲学推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18509 2025-11-27 cs.PL 50%

Higher-Order Behavioural Conformances via Fibrations

通过纤维化实现更高阶的行为一致性

Henning Urbat

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种统一的范畴方法,通过纤维化实现高阶语言的行为一致性,证明了最大行为一致性在一般条件下的合同性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18438 2025-11-25 cs.CR cs.SE 50%

LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework

LLMs作为固件专家:一种运行时增长的代理树框架

Xiangrui Zhang, Zeyu Chen, Haining Wang, Qiang Li

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出FIRMHIVE框架,利用LLMs作为固件安全分析师,通过递归代理蜂群实现更深入的固件漏洞检测,提升漏洞识别率和精度。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22085 2025-11-25 cs.SE 50%

BOOP: Write Right Code

BOOP:写出正确的代码

Vaani Goenka, Aalok Thakkar

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 BOOP通过结构化框架提升编程教育中的计算思维能力,强调正确性优先的开发方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09971 2025-11-14 cs.CR 50%

Proofs of Useful Work from Arbitrary Matrix Multiplication

Ilan Komargodski, Omri Weinstein

专题命中 代码与定理证明 :verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15112 2025-11-05 cs.CR 50%

AndroByte: LLM-Driven Privacy Analysis through Bytecode Summarization and Dynamic Dataflow Call Graph Generation

Mst Eshita Khatun, Lamine Noureddine, Zhiyong Sui, Aisha Ali-Gombe

专题命中 代码与定理证明 :reasoning(abstract)

Comments Accepted at the Annual Computer Security Applications Conference (ACSAC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17657 2025-10-24 cs.DB 50%

My Ontologist: Evaluating BFO-Based AI for Definition Support

Carter Benson, Alec Sculley, Austin Liebers, John Beverley

专题命中 代码与定理证明 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01536 2025-10-22 cs.IR 50%

AI4DiTraRe: Building the BFO-Compliant Chemotion Knowledge Graph

Ebrahim Norouzi, Nicole Jung, Anna M. Jacyszyn, Jörg Waitelonis, Harald Sack

专题命中 代码与定理证明 :reasoning(abstract)

Comments 12 pages, 7 figures. Camera-ready version. Accepted to the 5th International Workshop on Scientific Knowledge: Representation, Discovery, and Assessment; 2 November 2025 - Nara, Japan; co-located with The 24th International Semantic Web Conference, ISWC 2025. Published in CEUR proceedings Vol-4065, pages 45-56

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09585 2025-10-20 cs.CV 50%

Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation

Jitesh Jain, Zhengyuan Yang, Humphrey Shi, Jianfeng Gao, Jianwei Yang

机构 * Microsoft Research, Redmond(微软研究院(红mond)) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 代码与定理证明 :reasoning(abstract)

Comments Project Page: https://praeclarumjj3.github.io/visper_lm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10148 2025-10-14 cs.SE 50%

A Systematic Study on Generating Web Vulnerability Proof-of-Concepts Using Large Language Models

Mengyao Zhao, Kaixuan Li, Lyuye Zhang, Wenjing Dang, Chenggong Ding, Sen Chen, Zheli Liu

专题命中 代码与定理证明 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03874 2025-10-08 quant-ph 50%

Any theory that admits a Wigner's Friend type multi-agent paradox is logically contextual

Nuriya Nurgalieva, V. Vilasini

专题命中 代码与定理证明 :reasoning(abstract)

Comments 39+16 pages. Both authors contributed equally to this work. Initial versions of some of these results were included in NN's PhD thesis (ETH Zurich, 2023). v2 includes additional citations and clarifications in the outlook section

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04689 2025-10-07 cs.SE 50%

Evolaris: A Roadmap to Self-Evolving Software Intelligence Management

Chengwei Liu, Wenbo Guo, Yuxin Zhang, Limin Wang, Sen Chen, Lei Bu, Yang Liu

专题命中 代码与定理证明 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23675 2025-09-30 cs.SE 50%

PAT-Agent: Autoformalization for Model Checking

Xinyue Zuo, Yifan Zhang, Hongshu Wang, Yufan Cai, Zhe Hou, Jing Sun, Jin Song Dong

专题命中 代码与定理证明 :planning(abstract)

Comments Accepted in ASE 2025 (International Conference on Automated Software Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏