arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-02 至 2026-07-02 共收录 114 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2602.03370 2026-07-02 cs.CV cs.LG 版本更新 79%

GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition

GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散

Takaya Kawakatsu, Ryo Ishiyama

机构 * Preferred Networks, Inc.(Preferred Networks公司) Kyushu University(九州大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00254 2026-07-02 cs.DB 新提交 67%

Query-Centric Optimization of AI Workflows via Approximate Query Processing and Proxy Models

基于近似查询处理和代理模型的AI工作流查询中心优化

Huayi Wang, Jun Xu, Gromit Yeuk-Yin Chan

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract)

AI总结 提出将AI工作流视为声明式查询,利用近似查询处理(AQP)和代理模型(PM)过滤减少昂贵模型调用,在TPC-DS和LLM流水线上实现85-90%和60-70%的调用减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01002 2026-07-02 cs.CL cs.AI cs.LG 新提交 67%

Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads

Logit贡献评分识别非字面检索头

Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Heriot-Watt University(赫瑞瓦特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Logit贡献评分(LOCOS),通过OV电路输出投影到答案标记方向,识别大语言模型中执行非字面检索的注意力头,消融实验显著降低ROUGE-L而保持其他能力。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30789 2026-07-02 cs.LG stat.ML 新提交 57%

Predictable GRPO: A Closed-Form Model of Training Dynamics

可预测的GRPO:训练动力学的闭式模型

Rajat Ghosh, Datta Nimmaturi, Aryan Singhal, Vaishnavi Bhargava, Henry Wong, Johnu George, Debojyoti Dutta

机构 * Nutanix Unsloth

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出GRPO训练动力学的第一性原理降阶模型,揭示其指数饱和律的物理含义,预测群大小不变性、稳定性阈值和过阻尼-振荡转变,并在多个模型和基准上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13349 2026-07-02 cs.LG 版本更新 57%

When Less Latent Leads to Better Relay: Information-Preserving Compression for Latent Multi-Agent LLM Collaboration

少而精的潜在信息带来更好的中继:面向潜在多智能体大语言模型协作的信息保持压缩

Yiping Li, Zhiyu An, Wan Du

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California, Merced(加州大学默塞德分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种信息保持压缩方法,通过引入正交回填机制,在减少通信开销的同时保持信息完整性,提升了多智能体大语言模型协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00820 2026-07-02 cs.SE 新提交 50%

Knowledge-Enhanced Agentic Vulnerability Repair

知识增强的智能体漏洞修复

Sicong Cao, Hao Ma, Le Yu, Kangyi Ding, Xiaolei Liu, Terry Yue Zhuo, Bo Wang, Xingwei Lin, Xiaobing Sun, Linzhang Wang, David Lo

专题命中 数学推理 :reasoning(abstract)

AI总结 提出KeaRepair,一种基于智能体的自动化漏洞修复方法,通过提取历史漏洞知识并利用工具增强的智能体进行诊断,生成并迭代优化补丁,在55个C/C++漏洞上修复率达83.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2607.00972 2026-07-02 cs.AI 新提交 57%

Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question Answering

面向智能体RAG管道的贝叶斯不确定性传播:多跳问答的概念验证研究

Louis Donaldson, Connor Walker, Koorosh Aslansefat, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种不确定性感知的智能体RAG框架,通过贝叶斯网络传播各阶段的不确定性信号,以估计系统级不确定性并定位潜在故障点,在HotpotQA上表现有效,但在StrategyQA上受限于校准问题。

Comments Submitted for 7th International Conference on Maintenance and Intelligent Asset Management (ICMIAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 11 篇

2511.17673 2026-07-02 cs.AI cs.CL 84%

Bridging Symbolic Control and Neural Reasoning in LLM Agents -- The Structured Cognitive Loop

连接符号控制与神经推理的LLM代理——结构认知循环

Myung Ho Kim

机构 * JEI University(JEI大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结构认知循环(SCL)架构,通过分离检索、认知、控制、行动和记忆模块,解决LLM代理的推理与执行纠缠、记忆波动和行动序列失控问题,实现零策略违规、防止冗余调用并保持决策可追溯性。

Comments This update clarifies the theoretical architecture by separating Regulation as the Soft Symbolic Control layer from Control as a deterministic runtime engine, while adding explicit discussion of how the current implementation should be interpreted in light of that distinction

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06160 2026-07-02 cs.AI cs.CL cs.CY 版本更新 84%

Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles

通过逻辑网格谜题评估LLM推理中的隐性偏见

Fatima Jahara, Mark Dredze, Sharon Levy

机构 * Rutgers University(罗格斯大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIME框架,利用逻辑网格谜题系统探测LLM在复杂推理中受社会刻板印象的影响,发现模型在解与刻板印象一致时推理更准确。

Comments 26 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04694 2026-07-02 cs.CL cs.AI 版本更新 81%

Reasoning Up the Instruction Ladder for Controllable Language Models

在指令阶梯上推理以实现可控语言模型

Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Microsoft Research(微软研究院) Allen Institute for AI(艾伦人工智能研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过将指令层级解析重构为推理任务,并构建VerIH数据集进行轻量级强化学习,使模型能优先处理高层级指令,在冲突场景下提升约20%的指令遵循准确率,并增强对越狱和提示注入的鲁棒性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 39332-39354

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 78%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 78%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00342 2026-07-02 eess.SP 新提交 75%

Semantic-based Internet of Embodied Intelligence: Visions and Frontiers

基于语义的具身智能物联网:愿景与前沿

Yaheng Wang, Rui Meng, Xiaodong Xu, Yiming Liu, Feiliang Song, Linyuan Hu, Huishi Song, Lexi Xu, Tony Q. S. Quek, Ping Zhang

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)

AI总结 提出基于语义的具身智能物联网(SIoEI),通过语义信息统一度量解决多智能体网络中的多模态数据传输开销和逻辑推理与物理约束解耦问题,并验证其在信道鲁棒性和端到端延迟方面的优势。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00447 2026-07-02 cs.CL 新提交 74%

Understanding Why Language Models Hallucinate: Testing Reasoning Against Priors

理解语言模型为何产生幻觉:针对先验知识的推理测试

Yangfan Hu, Xuhan Tong, Haoyue Bai, Xi Ding, Shashank Muralidhar Bharadwaj, Siyang Cao, Robert Nowak, Jiawei Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL

AI总结 本文提出推理错位假说,认为幻觉源于模型偏向统计显著的潜在关联而非遵循提示约束,并通过TrapQA测试集验证了两种偏差模式。

Comments Project page: https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新 70%

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00924 2026-07-02 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 新提交 67%

Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination

图原生强化学习通过概念重组实现可追溯的科学假设生成

Subhadeep Pal, Shashwat Sourav, Tirthankar Ghosal, Markus J. Buehler

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出图原生推理模型Graph-PRefLexOR,结合GRPO强化学习将推理组织为显式阶段,在材料科学100个开放问题上推理可追溯性提升40-65%,语义多样性增加2-3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01188 2026-07-02 cs.AI cond-mat.mtrl-sci 新提交 57%

Optimal Resource Utilization for Autonomous Laboratory Orchestrators

自主实验室协调器的最优资源利用

Austin McDannald, Julia Tisaranni, Howie Joress

机构 * National Institute of Standards and Technology(美国国家标准与技术研究院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 针对自主实验室中多仪器硬件约束下的资源利用问题,提出两步法:先用约束规划找到最小化总时间的最优调度,再通过状态依赖系统鲁棒执行调度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01006 2026-07-02 cs.CL 新提交 57%

Understanding Large Language Models

理解大型语言模型

Yannik Keller, Thomas Eisenmann

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文综述大型语言模型(LLM)的机制、涌现能力及与人类认知的关系,通过分析注意力机制、符号推理、心智理论等证据,探讨LLM是否真正理解语言,并反对过度简化的人机认知差异观点。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 26 篇

2606.30552 2026-07-02 cs.RO cs.CV 版本更新 85%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00283 2026-07-02 cs.RO cs.AI cs.CV 新提交 83%

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

隐藏之物至关重要:使用视觉语言模型识别规划关键性的被遮挡智能体

Amirhosein Chahe, Tyler Naes, Jovin D'sa, Faizan M. Tariq, Sangjae Bae, Lifeng Zhou, David Isele

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型(VLM)识别对自车轨迹影响最大的被遮挡智能体,通过规划KL散度(PKL)度量进行排序,并微调VLM以提升性能,实验表明该方法比随机采样提升约30%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23405 2026-07-02 cs.MA cs.AI cs.RO 版本更新 83%

Planning over MAPF Agent Dependencies via Multi-Dependency PIBT

通过多依赖PIBT规划MAPF智能体依赖关系

Zixiang Jiang, Yulun Zhang, Rishi Veerapaneni, Jiaoyang Li

机构 * University Of Melbourne(墨尔本大学) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出多依赖PIBT(MD-PIBT)框架,通过搜索智能体依赖关系来规划多智能体路径,在拥挤环境中高效处理多达10000个智能体,支持多种运动学约束。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04453 2026-07-02 cs.CV 版本更新 82%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00147 2026-07-02 cs.AI 新提交 79%

RareDxR1: Autonomous Medical Reasoning for Rare Disease Diagnosis Beyond Human Annotation

RareDxR1:超越人类标注的罕见病诊断自主医学推理

Deyang Jiang, Haoran Wu, Ziyi Wang, Yiming Rong, Yunlong Zhao, Ye Jin, Bo Xu

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出端到端推理大模型RareDxR1,通过知识内化与自主进化学习框架,结合反思增强推理采样和双级课程强化学习,直接从非结构化临床笔记诊断罕见病,无需依赖结构化表型或人类标注,在多个基准上达到最先进准确率。

Comments 7 pages, 3 figures. Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03591 2026-07-02 cs.RO cs.SY eess.SY 版本更新 78%

Manifold-constrained Hamilton-Jacobi Reachability Learning for Decentralized Multi-Agent Motion Planning

流形约束的 Hamilton-Jacobi 可达性学习用于去中心化多智能体运动规划

Qingyi Chen, Ruiqi Ni, Junyoung Kim, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出流形约束的 HJR 学习框架,通过求解流形约束下的 HJR 问题获取任务感知安全条件,并集成到去中心化轨迹优化规划器中,实现安全且任务可行的多智能体运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00427 2026-07-02 cs.SE 新提交 75%

BT-APE: A Computationally Light Backtracking Approach to Automatic Prompt Engineering for Requirements Classification

BT-APE: 一种用于需求分类的轻量级回溯自动提示工程方法

Mohammad Amin Zadenoori, Waad Alhoshan, Jacek Dąbrowski, Liping Zhao, Alessio Ferrari

专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出轻量级回溯自动提示工程方法BT-APE,通过LLM生成候选、回溯搜索和动态示例选择迭代优化提示,在需求分类任务中以更低计算成本达到与资源密集型方法相当的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13148 2026-07-02 cs.AI 新提交 70%

TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?

TerraBench: 智能体能否对异构地球系统数据进行推理?

Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出TerraBench基准,基于TerraAgent框架,通过结合大语言模型规划与科学工具,实现跨网格数据、卫星图像、地理空间和模拟器的交互式推理,包含403个任务和24,500个执行步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04988 2026-07-02 cs.MA cs.AI 版本更新 70%

When AI Agents Compete for Jobs: Strategic Capabilities and Economic Dynamics of AI Labour Markets

当AI代理竞争工作岗位:AI劳动力市场的战略能力与经济动态

Christopher Chiu, Simpson Zhang, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AI-Work模拟平台,研究AI代理在劳动力市场中的竞争行为,发现元认知、竞争意识和长期战略规划能力使代理获得更高利润和市场份额。

Comments Accepted at ICML 2026, Code available at https://github.com/chy-chiu/ai-work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00537 2026-07-02 eess.SP 新提交 67%

B2X Networks: Joint Design of Communication and Control for Embodied Intelligence

B2X网络:具身智能的通信与控制联合设计

Yuanwei Liu, Xu Gan, Zhaolin Wang, Chongjun Ouyang, Hao Jiang, Zongyao Zhao, Kaibin Huang, Robert Schober

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出脑-体-万物(B2X)网络概念,通过分布式与集中式脑架构,重新设计上下行通信以平衡传输性能与控制质量,实现无线网络与具身智能的融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01179 2026-07-02 cs.LG cs.CL 新提交 62%

QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling

QuasiMoTTo: 准蒙特卡洛测试时扩展

Michael Y. Li, Anthony Zhan, Kanishk Gandhi, Noah D. Goodman, Emily B. Fox

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出QuasiMoTTo方法,利用准蒙特卡洛相关采样替代独立同分布采样,在推理和强化学习中减少冗余,以更少样本达到相同性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00871 2026-07-02 cs.AI cs.CL 新提交 62%

Self-Evolving Agents with Anytime-Valid Certificates

具有任意时间有效证书的自我进化智能体

Biswa Sengupta

机构 * LLM Suite Team, JPMorgan Chase & Co.(摩根大通LLM Suite团队)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出SEA架构,通过冻结基础模型和任意时间有效门控机制,在固定错误预算内实现可控自我修改,在SWE-bench验证集上提升性能并防止退化。

详情

展开后加载摘要…

URL PDF HTML 收藏