arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2602.12811 2026-07-16 cs.CL cs.AI q-bio.NC 版本更新 62%

Left-right asymmetry in predicting brain activity from LLMs' representations emerges with their formal linguistic competence

在LLM表示中预测脑活动的左右不对称性随着其正式语言能力的出现而出现

Laurent Bonnasse-Gahot, Christophe Pallier

机构 * Centre d’Analyse et de Mathématique Sociales CNRS, EHESS, Paris, France(分析与数学社会中心 CNRS,EHESS,巴黎,法国) Cognitive Neuroimaging Unit CNRS, INSERM, CEA, Neurospin Center, 91191 Gif-sur-Yvette, France(认知神经成像单元 CNRS,INSERM,CEA,Neurospin中心,法国91191 Gif-sur-Yvette)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现LLM的正式语言能力与大脑预测活动的左右不对称性同步发展,且与算术或世界知识任务无关。

Journal ref Neurobiology of Language 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07779 2026-07-10 cs.CL cs.AI 新提交 62%

From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier

从求解器到研究:前沿研究中的大语言模型驱动形式数学

Eric Jiang, Xiao Liang, Yikai Zhang, Yingjia Wan, Mengting Li, Haikang Deng, Alexander K. Taylor, Justin Baker, Rushil Raghavan, Junyi Zhang, Ying Nian Wu, Andrea L. Bertozzi, Kai-Wei Chang, Raghu Meka, Matthew Sottile, Nanyun Peng, Amit Sahai, Terence Tao, Wei Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 探讨AI4Math领域进展,指出当前系统处理前沿数学问题有局限。主张从预定义求解器转向研究代理,对该领域进行系统综述,识别现有系统局限性,为AI4Math未来发展规划战略路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13213 2026-07-08 cs.AI cs.HC cs.LG 版本更新 62%

Agentic AI for Commercial Insurance Underwriting with Adversarial Self-Critique

用于商业保险承保的具有对抗性自我批评的智能体人工智能

Joyjit Roy, Samaresh Kumar Singh

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对商业保险承保中AI可靠性问题,提出含对抗性自我批评机制的人在回路智能体系统,开发故障模式分类法。实验表明该机制降低幻觉率、提高准确率,还确保人类权威,为受监管领域安全部署AI提供模型。

Comments 9 pages, 8 figuers, 6 tables, Presented at 9th International Conference on Modern Computing, Networking and Applications (MCNA2026)

Journal ref 2026 International Conference on Modern Computing, Networking and Applications (MCNA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22431 2026-07-03 cs.AI cs.CL cs.FL 62%

Monadic Context Engineering

单子上下文工程

Yifan Zhang, Yang Yuan, Mengdi Wang, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学人工智能研究院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Monadic Context Engineering,利用函子、应用函子和单子的代数结构,为智能体设计提供形式基础,通过分层方法构建高效可靠的AI智能体。

Comments We found some issues in the categorical foundations of this work, so we respectfully withdraw it

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29687 2026-06-30 quant-ph cs.AI cs.LG cs.LO math.OC 62%

A Machine-Verified Proof of a Quantum-Optimization Conjecture

一个量子优化猜想的机器验证证明

Uri Kol, Maor Ben-Shahar, Kfir Sulimany, Dirk Englund

机构 * Center of Mathematical Sciences and Applications, Harvard University(哈佛大学数学科学中心) MIT Center for Theoretical Physics - a Leinweber Institute(麻省理工学院理论物理中心 - 莱因韦伯研究所) Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型Claude Fable 5发现证明,并通过Lean 4证明助手端到端验证了Farhi-Goldstone-Gutmann猜想,即深度p的量子近似优化算法在环上的近似比恰好为(2p+1)/(2p+2)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29091 2026-06-30 cs.LG cs.AI cs.DB 62%

Statistically Indistinguishable, Operationally Distinct: A Formal Barrier for Tabular Foundation Models

统计不可区分,操作上截然不同:表格基础模型的形式化障碍

Tassilo Klein, Johannes Hoffart

机构 * SAP SE(SAP公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出操作图灵测试,证明仅基于值的表格模型无法区分合法与违规数据库状态,而操作审计特征可突破该障碍,揭示可识别性而非模型容量是根本限制。

Comments Accepted at the 2nd ICML Workshop on Foundation Models for Structured Data, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28747 2026-06-30 cs.AI cs.LG 62%

Self-Supervised Theorem Discovery in a Formal Axiomatic System

形式化公理系统中的自监督定理发现

Kazuki Ota, Takayuki Osa, Tatsuya Harada

机构 * The University of Tokyo, Japan(东京大学,日本) RIKEN AIP, Japan(日本RIKEN AIP)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种自监督定理发现算法,通过交替进行证明搜索和有用定理提取,从公理和推理规则出发逐步构建定理库,实验表明发现的定理具有人类数学意义且能提升大语言模型证明性能。

Comments AI for Math Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22953 2026-06-23 cs.AI cs.CL 新提交 62%

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

计划不会持久:为什么上下文管理对LLM代理至关重要

Aman Mehta, Anupam Datta

机构 * Snowflake AI Research(Snowflake AI研究)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20740 2026-06-23 cs.CL cs.LG 新提交 62%

VeriBound: PAC-Bayesian Generalization Bounds for Process Reward Models Trained with Formal Verification Tools

VeriBound: 使用形式验证工具训练的过程奖励模型的PAC-Bayesian泛化界

Amirul Rahman, Mohammed Sabih Alsharari

机构 * University of Malaya(马来亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对形式验证工具标注的过程奖励模型(PRM)缺乏理论解释的问题,提出VeriBound框架,给出PAC-Bayesian泛化界、样本复杂度、收敛速率及下游Best-of-K性能的误差传播界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20642 2026-06-23 cs.AI cs.LG cs.LO math.ST stat.TH 新提交 62%

Hypothesis-Disciplined Multi-Agent Automated Formalization of Asymptotic Statistical Theory

假设约束的多智能体自动形式化渐近统计理论

Tingzhou Wei, Zeyu Zheng, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) Department of Mathematical Sciences, Carnegie Mellon University(卡内基梅隆大学数学科学系) Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院生物统计系)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种假设约束的多智能体Lean 4形式化流程,通过七个专业角色协调工作,实现渐近统计理论中参数和半参数模型的形式化,确保公理干净且忠实于原文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05171 2026-06-17 cs.CL cs.AI 版本更新 62%

Guidelines for the Annotation and Visualization of Legal Argumentation Structures in Chinese Judicial Decisions

中国司法判决中法律论证结构的标注与可视化指南

Kun Chen, Xianglei Liao, Kaixue Fei, Yi Xing, Xinrui Li

机构 * Law School, Nanjing University(南京大学法学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出一个系统化、可操作的标注框架,用于表示司法判决中的法律论证结构,支持大规模司法推理分析和法律论证挖掘。

Comments This Guideline has been developed through revision and refinement based on the first edition. The element label system has been adjusted, and the annotation granularity and annotation workflow have been further optimized

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06646 2026-06-16 cs.CL cs.AI 新提交 62%

CAF-Gen: A Multi-Agent System for Enriching Argumentation Structures

CAF-Gen: 一种用于丰富论证结构的多智能体系统

Jakub Bąba, Jarosław A. Chudziak

机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(电子与信息技术学院,华沙技术大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CAF-Gen多智能体框架,通过迭代创建-评审流程将浅层论证结构自动转换为符合Carneades论证框架的丰富模型,克服单次生成的结构不稳定性。

Comments Accepted for publication in the proceedings of ICCCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13610 2026-06-12 cs.CL cs.AI 新提交 62%

One Polluted Page Is Enough: Evaluating Web Content Pollution in Generative Recommenders

一个被污染的页面就够了:评估生成式推荐系统中的网页内容污染

Minghao Luo, Liang Chen

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出FORGE基准,评估搜索增强LLM在检索结果被污染时推荐虚假产品的脆弱性,发现单个污染页面即可导致高达27%的推荐错误率,且推理能力无法缓解此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09464 2026-06-04 cs.SE cs.AI cs.CL 62%

AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms

AlgoVeri:面向经典算法的验证代码生成对齐基准

Haoyu Zhao, Ziran Yang, Jiawei Li, Deyuan He, Zenan Li, Chi Jin, Venugopal V. Veeravalli, Aarti Gupta, Sanjeev Arora

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 代码与定理证明 :test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 为解决跨范式验证代码生成评估缺乏统一方法的问题,提出AlgoVeri基准,在Dafny、Verus和Lean三种语言上评估77个经典算法的验证代码生成,揭示不同验证系统的能力差距。

Comments Accepted to ICML 2026, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03789 2026-06-02 cs.LG cs.AI 62%

Automated Conjecture Resolution with Formal Verification

自动猜想解决与形式化验证

Haocheng Ju, Guoxiong Gao, Jiedong Jiang, Bin Wu, Zeming Sun, Shurui Liu, Leheng Chen, Yutong Wang, Yuefeng Wang, Zichen Wang, Wanyi He, Peihao Wu, Liang Xiao, Ruochuan Liu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) School of Mathematics, Tianjin University(天津大学数学学院) Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) Department of Mathematics, Stanford University(斯坦福大学数学系) IQuest Research(IQuest研究) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。

Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03415 2026-06-01 cs.PL cs.AI cs.CL cs.SE 62%

LLMs Lean on Priors, Not Programming Language Semantics

LLMs 依赖先验而非编程语言语义

Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco Research(思科研究)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过 PLSemanticsBench 基准测试,发现前沿大语言模型在程序执行任务中依赖预训练统计规律而非形式语义规则,语义变异和结构复杂度导致准确率大幅下降。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02561 2026-05-28 cs.LO cs.AI cs.LG 62%

MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics

MathlibLemma: 形式化数学中的民间引理生成与基准测试

Xinyu Liu, Zixuan Xie, Amir Moeini, Claire Chen, Shuze Daniel Liu, Yu Meng, Aidong Zhang, Shangtong Zhang

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) Astronomy , California Institute of Technology(加州理工学院天文学系) Purdue University(普渡大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于LLM的模块化流水线MathlibLemma,自动挖掘、形式化并证明数学中缺失的民间引理,生成包含4028个类型检查的Lean语句的基准测试集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26457 2026-05-27 cs.SE cs.AI cs.CL cs.PL 62%

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

Verus-SpecGym: 用于评估规范自动形式化的智能体环境

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parno, Sean Welleck

机构 * CMU(卡内基梅隆大学) Amazon(亚马逊)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出 Verus-SpecGym 环境与 Verus-SpecBench 基准,通过执行规范机制和对抗性测试评估 LLM 智能体将非正式编程问题转化为形式规范的能力,发现前沿模型可解决 77.8% 的任务但存在遗漏假设等脆弱性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20988 2026-05-27 cs.LG cs.AI 62%

A Sharper Picture of Generalization in Transformers

Transformer 泛化能力的更清晰图景

Paul Lintilhac, Sair Shaikh

机构 * Thayer School of Engineering Dartmouth College(达特茅斯学院泰勒工程学院)

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过PAC-Bayes理论研究Transformer在布尔域上的泛化行为,证明稀疏低阶频谱可实现低锐度构造并得到非平凡的泛化界,解释了思维链为何能改善高阶目标函数的泛化。

Comments 10 pages, 9 figures, 41 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20242 2026-05-21 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph 62%

LEAP: A closed-loop framework for perovskite precursor additive discovery

LEAP:一种用于钙钛矿前驱体添加剂发现的闭环框架

Xin-De Wang, Zhi-Rui Chen, Ze-Feng Gao, Peng-Jie Guo, Cheng Mu, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院) School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出LEAP框架,结合大语言模型和主动学习,通过文献驱动的机制相关描述符和贝叶斯优化,实现了钙钛矿太阳能电池添加剂的高效发现,实验验证显示其在性能提升方面优于通用模型。

Comments 30 pages; 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16198 2026-05-18 cs.AI cs.CY cs.LG cs.LO 62%

Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

形式方法与大语言模型交汇:面向高级AI系统合规性的审计、监控与干预

Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraith

机构 * University of Toronto, Vector Institute(多伦多大学,向量研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合形式方法与机器学习的审计和监控技术,用于检测AI系统中时间扩展行为约束的违规,实验表明其在检测违规方面优于LLM基方法,且能有效降低LLM代理的违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07147 2026-05-14 cs.LO cs.AI cs.LG 62%

MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries

MathlibPR: 用于正式数学库的拉取请求合并准备性基准

Zixuan Xie, Xinyu Liu, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MathlibPR基准,通过真实Mathlib4 PR历史评估LLM在审查合并准备性PR中的能力,揭示LLM在区分有效PR与需修订PR中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10974 2026-05-13 cs.LG cs.AI 62%

Vertex-Softmax: Tight Transformer Verification via Exact Softmax Optimization

顶点softmax:通过精确softmax优化实现严格的transformer验证

Navid Rezazadeh, Arash Gholami Davoodi

机构 * University of California, Irvine(加州大学尔湾分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出顶点softmax方法,通过精确优化softmax函数,实现transformer注意力的严格验证,提升了认证率并收紧了下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09184 2026-05-12 cs.AI cs.CL cs.DB 62%

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

开放本体:基于稳定匹配对齐的工具增强本体工程

Fabio Rovai

机构 * The Tesseract Academy, London, United Kingdom(泰斯拉学院,伦敦,英国)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Open Ontologies系统,结合LLM驱动构建与形式OWL推理及本体对齐,发现稳定1对1匹配是本体对齐质量关键,且工具增强访问优于纯LLM解析。

Comments 10 pages, 6 tables. Code: https://github.com/fabio-rovai/open-ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08037 2026-05-11 cs.LG cs.AI 62%

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

超越成对:你的语言模型其实是在优化一个偏好图

Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02079 2026-05-08 cs.CL cs.AI 62%

Argumentative Large Language Models for Explainable and Contestable Claim Verification

用于可解释和可争议主张验证的论证大型语言模型

Gabriel Freedman, Adam Dejl, Deniz Gorur, Xiang Yin, Antonio Rago, Francesca Toni

机构 * Department of Computing, Imperial College London, UK(伦敦帝国学院计算机系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出论证大型语言模型(ArgLLMs),通过引入论证推理增强LLMs,使其决策可解释且可争议,通过实验验证其在主张验证任务中的性能。

Comments 18 pages, 18 figures. Accepted as an oral presentation at AAAI 2025

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(14), 14930-14939. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27586 2026-05-01 cs.AI cs.LG 62%

Trace-Level Analysis of Information Contamination in Multi-Agent Systems

多智能体系统中信息污染的跟踪级分析

Anna Mazhar, Huzaifa Suri, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) University of Illinois(伊利诺伊大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体系统中信息污染现象,通过跟踪差异量化污染影响,提出污染表现类型分类及测量框架,揭示验证防护失效原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22750 2026-04-30 cs.CL cs.AI cs.CY cs.HC cs.SE 62%

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

AI代理如何花费你的钱?分析和预测代理编码任务中的令牌消耗

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) All Hands AI Google Deepmind(谷歌DeepMind) Microsoft AI(微软AI) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了代理编码任务中令牌消耗模式,发现代理任务消耗远高于代码推理和代码聊天,且模型在任务执行前难以准确预测自身令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25236 2026-04-30 cs.AI cs.LG eess.SP 62%

Networks of Causal Abstractions: A Sheaf-theoretic Framework

因果抽象网络:一种她夫理论框架

Gabriele D'Acunto, Paolo Di Lorenzo, Sergio Barbarossa

机构 * DIET Sapienza University of Rome(Sapienza罗马大学DIET)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果抽象网络(CAN)框架,通过她夫理论统一多个上下文依赖因果机制模型,解决分布式智能体间因果视角协调问题,实现因果学习与推理。

Comments Major changes: added convergence proof for CK diffusion dynamics; clarified relation with our prior work arXiv:2602.02623, removing substantial overlap; shortened background

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY 62%

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏