arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2312.05209 2024-04-03 cs.AI cs.CL 62%

HALO: An Ontology for Representing and Categorizing Hallucinations in Large Language Models

Navapat Nananukul, Mayank Kejriwal

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted and orally presented in "SPIE Defense + Commercial Sensing (DCS 2024)" in National Harbor, Maryland, April 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18239 2024-04-02 cs.AI cs.CL cs.FL cs.RO 62%

Fine-Tuning Language Models Using Formal Methods Feedback

Yunhao Yang, Neel P. Bhatt, Tyler Ingebrand, William Ward, Steven Carr, Zhangyang Wang, Ufuk Topcu

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04488 2024-03-19 cs.LG cs.AI cs.LO 62%

Magnushammer: A Transformer-Based Approach to Premise Selection

Maciej Mikuła, Szymon Tworkowski, Szymon Antoniak, Bartosz Piotrowski, Albert Qiaochu Jiang, Jin Peng Zhou, Christian Szegedy, Łukasz Kuciński, Piotr Miłoś, Yuhuai Wu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10051 2024-02-16 cs.AI cs.CL 62%

SwissNYF: Tool Grounded LLM Agents for Black Box Setting

Somnath Sendhil Kumar, Dhruv Jain, Eshaan Agarwal, Raunak Pandey

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06973 2023-12-13 cs.AI cs.LG cs.LO 62%

Anytime Approximate Formal Feature Attribution

Jinqiang Yu, Graham Farr, Alexey Ignatiev, Peter J. Stuckey

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01866 2023-11-06 cs.CL cs.AI 62%

Towards Concept-Aware Large Language Models

Chen Shani, Jilles Vreeken, Dafna Shahaf

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2023 findings long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14250 2023-10-31 cs.CL cs.AI 62%

Language Models with Rationality

Nora Kassner, Oyvind Tafjord, Ashish Sabharwal, Kyle Richardson, Hinrich Schuetze, Peter Clark

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05689 2023-09-13 cs.CL cs.AI 62%

Large Language Model for Science: A Study on P vs. NP

Qingxiu Dong, Li Dong, Ke Xu, Guangyan Zhou, Yaru Hao, Zhifang Sui, Furu Wei

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 73 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04505 2023-06-08 cs.LG cs.AI cs.CC cs.CR 62%

Hardness of Deceptive Certificate Selection

Stephan Wäldchen

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07961 2023-05-18 cs.IR cs.CL cs.LG 62%

Leveraging Large Language Models in Conversational Recommender Systems

Luke Friedman, Sameer Ahuja, David Allen, Zhenning Tan, Hakim Sidahmed, Changbo Long, Jun Xie, Gabriel Schubiner, Ajay Patel, Harsh Lara, Brian Chu, Zexi Chen, Manoj Tiwari

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12283 2023-02-21 cs.AI cs.LG 62%

Draft, Sketch, and Prove: Guiding Formal Theorem Provers with Informal Proofs

Albert Q. Jiang, Sean Welleck, Jin Peng Zhou, Wenda Li, Jiacheng Liu, Mateja Jamnik, Timothée Lacroix, Yuhuai Wu, Guillaume Lample

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.04901 2022-11-15 cs.CL cs.LG 62%

Exploring Length Generalization in Large Language Models

Cem Anil, Yuhuai Wu, Anders Andreassen, Aitor Lewkowycz, Vedant Misra, Vinay Ramasesh, Ambrose Slone, Guy Gur-Ari, Ethan Dyer, Behnam Neyshabur

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12910 2022-11-02 cs.CL cs.AI 62%

NaturalProver: Grounded Mathematical Proof Generation with Language Models

Sean Welleck, Jiacheng Liu, Ximing Lu, Hannaneh Hajishirzi, Yejin Choi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10914 2022-08-24 cs.LG cs.AI 62%

Home Run: Finding Your Way Home by Imagining Trajectories

Daria de Tinguy, Pietro Mazzaglia, Tim Verbelen, Bart Dhoedt

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

Comments accepted for International Workshop on Active Inference IWAI 2022, ECML PKDD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.00558 2021-10-04 cs.CL cs.AI cs.LO 62%

Natural language understanding for logical games

Adrian Groza, Cristian Nitu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.00739 2021-04-05 cs.SE cs.AI cs.LG cs.PL q-bio.OT 62%

Formal Methods for the Informal Engineer: Workshop Recommendations

Gopal Sarma, James Koppel, Gregory Malecha, Patrick Schultz, Eric Drexler, Ramana Kumar, Cody Roux, Philip Zucker

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.02231 2021-01-08 cs.AI cs.LG 62%

Controlling Synthetic Characters in Simulations: A Case for Cognitive Architectures and Sigma

Volkan Ustun, Paul S. Rosenbloom, Seyed Sajjadi, Jeremy Nuttal

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

Journal ref Interservice/Industry Training, Simulation, and Education Conference (I/ITSEC) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.02185 2021-01-07 cs.AI cs.LG 62%

Adaptive Synthetic Characters for Military Training

Volkan Ustun, Rajay Kumar, Adam Reilly, Seyed Sajjadi, Andrew Miller

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

Journal ref 2020 Interservice/Industry Training, Simulation, and Education Conference (I/ITSEC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.05867 2020-05-06 cs.CL cs.AI 62%

Transformers as Soft Reasoners over Language

Peter Clark, Oyvind Tafjord, Kyle Richardson

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments IJCAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.00840 2019-09-19 cs.AI cs.CL 62%

Knowledge Authoring and Question Answering with KALM

Tiantian Gao

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments In Proceedings ICLP 2019, arXiv:1909.07646

Journal ref EPTCS 306, 2019, pp. 389-395

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.01458 2019-09-12 cs.MA cs.AI cs.LG 62%

Bayesian Action Decoder for Deep Multi-Agent Reinforcement Learning

Jakob N. Foerster, Francis Song, Edward Hughes, Neil Burch, Iain Dunning, Shimon Whiteson, Matthew Botvinick, Michael Bowling

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1309.4962 2013-09-20 cs.AI cs.DL cs.LG cs.LO cs.MS 62%

HOL(y)Hammer: Online ATP Service for HOL Light

Cezary Kaliszyk, Josef Urban

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18404 2026-04-21 cs.AI 61%

Six Llamas: Comparative Religious Ethics Through LoRA-Adapted Language Models

六头 llama:通过 LoRA 调整的语言模型进行比较宗教伦理研究

Chad Coleman, W. Russell Neuman, Manan Shah, Ali Dasdan, Matthew Crispi, Morris Chiang, Zack Leitman, Mustafa Poonawala

机构 * Meta

专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文通过 LoRA 调整的语言模型比较不同宗教文本对伦理推理的影响,发现调整模型在伦理推理上与基础模型有系统性差异,并在不同温度设置下表现出稳定性与多样性。

Comments 51 pages, 14 figures. We present Six Llamas, a comparative study examining whether Llama-3.1-8B models fine-tuned on distinct religious corpora encode systematically different patterns of ethical reasoning. Five LoRA-adapted variants are constructed for Christianity, Islam, Judaism, Hinduism, and Buddhism. For theoretical background on the condensate comparative method, see arXiv:2603.07329

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10249 2025-09-15 cs.AI 61%

Investigating Language Model Capabilities to Represent and Process Formal Knowledge: A Preliminary Study to Assist Ontology Engineering

Hanna Abi Akl

机构 * Université Côte d’Azur(法国滨海大学) Inria(法国国家信息与自动化技术研究所) CNRS(法国国家科学研究中心) I3S(国际科学计算研究所) Sophia Antipolis, France(法国索菲亚大学) Data ScienceTech Institute (DSTI)(数据科学技术研究所)

专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI

Comments accepted for the International Joint Conference on Rules and Reasoning (RuleML+RR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20781 2026-08-13 cs.AI cs.CY econ.GN q-fin.EC 版本更新 57%

The Human-AI Substitution Principle: When will you be replaced by AI in your organization?

人类-人工智能替代原则:在你的组织中,你何时会被人工智能取代?

Bonny Banerjee, Shreya Singh

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究人类员工何时被人工智能取代,提出HAT分析模型,编码人类技能与人工智能能力的经济不对称,推导多因素对人机替代的影响,得出替代原则,揭示其引发的组织变化及中层管理与高技能工人的脆弱性,统一相关理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07476 2026-08-11 cs.AI cs.LO 新提交 57%

Determinization in Structure Theories: A Unified Framework via Closure, Comparability, and Joint Admissibility

结构理论中的确定化:基于闭包、可比性与联合可容许性的统一框架

Hai Hai Fu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出了基于闭包、可比性与联合可容许性的统一框架,用于从多结构理论构造典范解释,区分非确定性类型并给出对应确定化机制,还可应用于LLM辅助推理以分析幻觉问题。

Comments Formal framework paper on canonicalization and determinization in structure theories; version v2.16.4; 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04273 2026-08-11 cs.AI 版本更新 57%

Human agency in initial human-AI proof formalization workflows

表征初始人机交互的证明形式化工作流

Katherine M. Collins, Simon Frieder, Jonas Bayer, Jacob Loader, Jeck Lim, Peiyang Song, Fabian Zaiser, Lexin Zhou, Shanda Li, Sam Looi, Joshua B. Tenenbaum, Umang Bhatt, Adrian Weller, Jose Hernandez-Orallo, Cameron E. Freer, Valerie Chen, Ilia Sucholutsky

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学) Caltech(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Universitat Politècnica de València(瓦伦西亚理工大学) New York University(纽约大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 通过混合方法分析,研究人们在形式化证明过程中对AI工具的需求、障碍及实际使用模式,发现AI辅助能提高形式化准确率且用户偏好多样但普遍希望保持人类对证明发现过程的高层控制。

Comments Updated working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19329 2026-08-11 cs.SE cs.AI 版本更新 57%

Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification

Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索

Zenan Li, Ziran Yang, Deyuan He, Haoyu Zhao, Andrew Zhao, Shange Tang, Kaiyu Yang, Aarti Gupta, Zhendong Su, Chi Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Princeton Language and Intelligence(普林斯顿语言与智能实验室) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) MiroMind

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。

Comments Published as a COLM paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07317 2026-08-10 cs.SE cs.AI 新提交 57%

Towards Assurance Closure in AI-Native Large-Scale Agile Software Development

面向AI原生大规模敏捷软件开发中的保证闭合

Ricardo Britto

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 针对AI原生大规模敏捷软件开发中保证推理机器可操作的缺口,提出基于共享语义保证层的高层架构及六项对应能力,以实现保证闭合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-10 cs.AI 新提交 57%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏