arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2606.13610 2026-06-12 cs.CL cs.AI 新提交 62%

One Polluted Page Is Enough: Evaluating Web Content Pollution in Generative Recommenders

一个被污染的页面就够了:评估生成式推荐系统中的网页内容污染

Minghao Luo, Liang Chen

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出FORGE基准,评估搜索增强LLM在检索结果被污染时推荐虚假产品的脆弱性,发现单个污染页面即可导致高达27%的推荐错误率,且推理能力无法缓解此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09464 2026-06-04 cs.SE cs.AI cs.CL 62%

AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms

AlgoVeri:面向经典算法的验证代码生成对齐基准

Haoyu Zhao, Ziran Yang, Jiawei Li, Deyuan He, Zenan Li, Chi Jin, Venugopal V. Veeravalli, Aarti Gupta, Sanjeev Arora

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 代码与定理证明 :test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 为解决跨范式验证代码生成评估缺乏统一方法的问题,提出AlgoVeri基准,在Dafny、Verus和Lean三种语言上评估77个经典算法的验证代码生成,揭示不同验证系统的能力差距。

Comments Accepted to ICML 2026, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03789 2026-06-02 cs.LG cs.AI 62%

Automated Conjecture Resolution with Formal Verification

自动猜想解决与形式化验证

Haocheng Ju, Guoxiong Gao, Jiedong Jiang, Bin Wu, Zeming Sun, Shurui Liu, Leheng Chen, Yutong Wang, Yuefeng Wang, Zichen Wang, Wanyi He, Peihao Wu, Liang Xiao, Ruochuan Liu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) School of Mathematics, Tianjin University(天津大学数学学院) Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) Department of Mathematics, Stanford University(斯坦福大学数学系) IQuest Research(IQuest研究) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。

Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03415 2026-06-01 cs.PL cs.AI cs.CL cs.SE 62%

LLMs Lean on Priors, Not Programming Language Semantics

LLMs 依赖先验而非编程语言语义

Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco Research(思科研究)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过 PLSemanticsBench 基准测试,发现前沿大语言模型在程序执行任务中依赖预训练统计规律而非形式语义规则,语义变异和结构复杂度导致准确率大幅下降。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02561 2026-05-28 cs.LO cs.AI cs.LG 62%

MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics

MathlibLemma: 形式化数学中的民间引理生成与基准测试

Xinyu Liu, Zixuan Xie, Amir Moeini, Claire Chen, Shuze Daniel Liu, Yu Meng, Aidong Zhang, Shangtong Zhang

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) Astronomy , California Institute of Technology(加州理工学院天文学系) Purdue University(普渡大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于LLM的模块化流水线MathlibLemma,自动挖掘、形式化并证明数学中缺失的民间引理,生成包含4028个类型检查的Lean语句的基准测试集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26457 2026-05-27 cs.SE cs.AI cs.CL cs.PL 62%

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

Verus-SpecGym: 用于评估规范自动形式化的智能体环境

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parno, Sean Welleck

机构 * CMU(卡内基梅隆大学) Amazon(亚马逊)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出 Verus-SpecGym 环境与 Verus-SpecBench 基准,通过执行规范机制和对抗性测试评估 LLM 智能体将非正式编程问题转化为形式规范的能力,发现前沿模型可解决 77.8% 的任务但存在遗漏假设等脆弱性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20988 2026-05-27 cs.LG cs.AI 62%

A Sharper Picture of Generalization in Transformers

Transformer 泛化能力的更清晰图景

Paul Lintilhac, Sair Shaikh

机构 * Thayer School of Engineering Dartmouth College(达特茅斯学院泰勒工程学院)

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过PAC-Bayes理论研究Transformer在布尔域上的泛化行为,证明稀疏低阶频谱可实现低锐度构造并得到非平凡的泛化界,解释了思维链为何能改善高阶目标函数的泛化。

Comments 10 pages, 9 figures, 41 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20242 2026-05-21 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph 62%

LEAP: A closed-loop framework for perovskite precursor additive discovery

LEAP:一种用于钙钛矿前驱体添加剂发现的闭环框架

Xin-De Wang, Zhi-Rui Chen, Ze-Feng Gao, Peng-Jie Guo, Cheng Mu, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院) School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出LEAP框架,结合大语言模型和主动学习,通过文献驱动的机制相关描述符和贝叶斯优化,实现了钙钛矿太阳能电池添加剂的高效发现,实验验证显示其在性能提升方面优于通用模型。

Comments 30 pages; 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16198 2026-05-18 cs.AI cs.CY cs.LG cs.LO 62%

Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

形式方法与大语言模型交汇:面向高级AI系统合规性的审计、监控与干预

Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraith

机构 * University of Toronto, Vector Institute(多伦多大学,向量研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合形式方法与机器学习的审计和监控技术,用于检测AI系统中时间扩展行为约束的违规,实验表明其在检测违规方面优于LLM基方法,且能有效降低LLM代理的违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07147 2026-05-14 cs.LO cs.AI cs.LG 62%

MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries

MathlibPR: 用于正式数学库的拉取请求合并准备性基准

Zixuan Xie, Xinyu Liu, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MathlibPR基准,通过真实Mathlib4 PR历史评估LLM在审查合并准备性PR中的能力,揭示LLM在区分有效PR与需修订PR中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10974 2026-05-13 cs.LG cs.AI 62%

Vertex-Softmax: Tight Transformer Verification via Exact Softmax Optimization

顶点softmax:通过精确softmax优化实现严格的transformer验证

Navid Rezazadeh, Arash Gholami Davoodi

机构 * University of California, Irvine(加州大学尔湾分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出顶点softmax方法,通过精确优化softmax函数,实现transformer注意力的严格验证,提升了认证率并收紧了下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09184 2026-05-12 cs.AI cs.CL cs.DB 62%

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

开放本体:基于稳定匹配对齐的工具增强本体工程

Fabio Rovai

机构 * The Tesseract Academy, London, United Kingdom(泰斯拉学院,伦敦,英国)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Open Ontologies系统,结合LLM驱动构建与形式OWL推理及本体对齐,发现稳定1对1匹配是本体对齐质量关键,且工具增强访问优于纯LLM解析。

Comments 10 pages, 6 tables. Code: https://github.com/fabio-rovai/open-ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08037 2026-05-11 cs.LG cs.AI 62%

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

超越成对:你的语言模型其实是在优化一个偏好图

Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02079 2026-05-08 cs.CL cs.AI 62%

Argumentative Large Language Models for Explainable and Contestable Claim Verification

用于可解释和可争议主张验证的论证大型语言模型

Gabriel Freedman, Adam Dejl, Deniz Gorur, Xiang Yin, Antonio Rago, Francesca Toni

机构 * Department of Computing, Imperial College London, UK(伦敦帝国学院计算机系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出论证大型语言模型(ArgLLMs),通过引入论证推理增强LLMs,使其决策可解释且可争议,通过实验验证其在主张验证任务中的性能。

Comments 18 pages, 18 figures. Accepted as an oral presentation at AAAI 2025

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(14), 14930-14939. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27586 2026-05-01 cs.AI cs.LG 62%

Trace-Level Analysis of Information Contamination in Multi-Agent Systems

多智能体系统中信息污染的跟踪级分析

Anna Mazhar, Huzaifa Suri, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) University of Illinois(伊利诺伊大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体系统中信息污染现象,通过跟踪差异量化污染影响,提出污染表现类型分类及测量框架,揭示验证防护失效原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22750 2026-04-30 cs.CL cs.AI cs.CY cs.HC cs.SE 62%

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

AI代理如何花费你的钱?分析和预测代理编码任务中的令牌消耗

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) All Hands AI Google Deepmind(谷歌DeepMind) Microsoft AI(微软AI) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了代理编码任务中令牌消耗模式,发现代理任务消耗远高于代码推理和代码聊天,且模型在任务执行前难以准确预测自身令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25236 2026-04-30 cs.AI cs.LG eess.SP 62%

Networks of Causal Abstractions: A Sheaf-theoretic Framework

因果抽象网络:一种她夫理论框架

Gabriele D'Acunto, Paolo Di Lorenzo, Sergio Barbarossa

机构 * DIET Sapienza University of Rome(Sapienza罗马大学DIET)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果抽象网络(CAN)框架,通过她夫理论统一多个上下文依赖因果机制模型,解决分布式智能体间因果视角协调问题,实现因果学习与推理。

Comments Major changes: added convergence proof for CK diffusion dynamics; clarified relation with our prior work arXiv:2602.02623, removing substantial overlap; shortened background

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY 62%

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23002 2026-04-28 cs.AI cs.CL 62%

FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean

FormalScience: 基于代理代码生成的可扩展人类在环科学自动形式化

Jordan Meadows, Lan Zhang, Andre Freitas

机构 * University of Manchester, UK(英国曼彻斯特大学) Idiap Research Institute, Switzerland(瑞士Idiap研究所) National Biomarker Centre, CRUK-MI, UK(英国国家生物标志物中心,CRUK-MI)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FormalScience通过人类在环的代理流程,使非专业领域专家以低成本生成形式化证明,构建了包含200个大学物理问题及解决方案的FormalPhysics数据集,并探讨了现代LLM在自动形式化中的局限性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18471 2026-04-23 cs.SE cs.AI cs.CL 62%

CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment

CodeRL+: 通过执行语义对齐改进代码生成

Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) School of Computer Science, Wuhan University(武汉大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CodeRL+,通过将执行语义对齐整合到RLVR训练流程中,提升代码生成的准确性,实验显示其在pass@1指标上平均提升4.6%。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17252 2026-04-21 cs.CL cs.AI cs.RO 62%

Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents

看见并不等于相信:通过主动干预缓解具身智能体中的信念惯性

Hanlin Wang, Chak Tou Leong, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过主动干预缓解具身智能体中的信念惯性问题,引入EVU机制提升任务成功率。

Comments Accepted by ACL2026 Fingdings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15839 2026-04-20 cs.AI cs.CL cs.LO 62%

Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4

发现与证明:一个开源代理框架用于Lean 4中的硬模式自动定理 proving

Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAP框架,通过LLM自然语言推理与自我反思发现答案,并将硬模式问题转换为易模式问题以提升自动定理证明性能,实现了CombiBench和PutnamBench上的显著提升。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10392 2026-04-14 cs.LG cs.AI cs.LO cs.PL cs.SE 62%

Intent-aligned Formal Specification Synthesis via Traceable Refinement

通过可追溯的细化实现意图对齐的正式规范合成

Zhe Ye, Aidan Z. H. Yang, Huangyuan Su, Zhenyu Liao, Samuel Tenka, Zhizhen Qin, Udaya Ghai, Dawn Song, Soonho Kong

机构 * Amazon Web Services(亚马逊云服务) Harvard University(哈佛大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VeriSpecGen框架,通过需求级归因和局部修复生成意图对齐的规范,提升规范合成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09155 2026-04-13 cs.LG cs.AI 62%

CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation

CORA: 为保障移动GUI自动化设计的符合性风险控制代理

Yushi Feng, Junye Du, Qifan Wang, Zizhan Ma, Qian Niu, Yutaka Matsuo, Long Feng, Lequan Yu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CORA通过统计保障减少有害操作,利用Guardian模型评估行动风险并校准执行/中止边界,结合Goal-Lock机制和Phone-Harm基准验证其在自主GUI执行中的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01346 2026-04-08 cs.CR cs.AI cs.LG cs.RO 62%

Safety, Security, and Cognitive Risks in World Models

世界模型中的安全性、安全性和认知风险

Manoj Parmar

机构 * SovereignAI Security Labs(SovereignAI安全实验室)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了世界模型在自主决策中的安全、安全及认知风险,提出了轨迹持久性和表征风险的定义,并通过实验验证了对抗攻击的效果,强调了对世界模型的严谨性要求。

Comments version 2, 29 pages, 1 figure (6 panels), 3 tables. Empirical proof-of-concept on GRU/RSSM/DreamerV3 architectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28650 2026-04-03 cs.LG cs.AI stat.ML 62%

Information-Theoretic Limits of Safety Verification for Self-Improving Systems

自我改进系统安全验证的信息论极限

Arsenios Scrivens

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究安全验证在允许无界有益自修改的同时维持有限累积风险的理论极限,提出双条件并建立其兼容性理论。

Comments 27 pages, 6 figures. Companion empirical paper: doi:10.5281/zenodo.19237566

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20105 2026-03-23 cs.LG cs.AI 62%

The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus

LLMs的Y-组合子:解决长上下文旋转问题的λ演算

Amartya Roy, Rasul Tutunov, Xiaotong Ji, Matthieu Zimmer, Haitham Bou-Ammar

机构 * The School of Interdisciplinary Research(跨学科研究学院) Indian Institute of Technology (IIT) Delhi(印度理工学院德里分校) Robert Bosch GmbH, India(德国罗伯特·博世有限公司,印度) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Huawei Noah’s Ark UCL Centre for Artificial Intelligence(华为诺亚方舟大学伦敦人工智能中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出λ-RLM框架,通过类型化的功能运行时替代自由递归代码生成,提升长上下文推理的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14312 2026-03-17 cs.AI cond-mat.dis-nn cs.LG cs.MA q-bio.BM 62%

Autonomous Agents Coordinating Distributed Discovery Through Emergent Artifact Exchange

自主代理通过涌现式物品交换协调分布式发现

Fiona Y. Wang, Lee Marom, Subhadeep Pal, Rachel K. Luu, Wei Lu, Jaime A. Berkovich, Markus J. Buehler

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出ScienceClaw + Infinite框架,通过自主代理在无中央协调下进行科学探究,展示异构工具链、代理间涌现式收敛及可追溯推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14087 2026-03-17 cs.LG cs.CL 62%

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

理解下一token预测器中看似无用特征的出现

Mark Rofin, Jalal Naghiyev, Michael Hahn

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02872 2026-03-10 cs.LG cs.AI cs.FL cs.LO 62%

FATE: A Formal Benchmark Series for Frontier Algebra of Multiple Difficulty Levels

FATE:面向多难度层级的前沿代数形式化基准系列

Jiedong Jiang, Wanyi He, Yuefeng Wang, Guoxiong Gao, Yongle Hu, Jingting Wang, Nailin Guan, Peihao Wu, Chunbo Dai, Liang Xiao, Bin Dong

机构 * Westlake Institute for Advanced Study, Westlake University(西拉丘学院先进研究院,西拉丘大学) Peking University(北京大学) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(新基石科学实验室,北京大学数学科学学院) Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(智能计算中心,大湾先进研究院,大湾大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FATE是一个面向多难度层级的前沿代数形式化基准系列,旨在评估和推动高级数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏