arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3200 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3200 篇

2403.00420 2026-06-10 cs.LG cs.AI 版本更新 73%

Robust Deep Reinforcement Learning Through Adversarial Attacks and Training : A Survey

通过对抗攻击和训练实现鲁棒深度强化学习:综述

Lucas Schott, Josephine Delas, Hatem Hajri, Elies Gherbi, Reda Yaich, Nora Boulahia-Cuppens, Frederic Cuppens, Sylvain Lamprier

机构 * Institut de Recherche Technologique SystemX(技术研究 institute SystemX)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了深度强化学习中的对抗攻击与训练方法,系统分类并比较其目标与机制,以提升模型对环境变化和扰动的鲁棒性。

Comments 83 pages, 17 figues, 3 table, 15 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09800 2026-06-09 cs.SE cs.AI cs.MA 新提交 73%

FASE: Fast Adaptive Semantic Entropy for Code Quality

FASE: 用于代码质量的快速自适应语义熵

Shizhe Lin, Ladan Tahvildari

机构 * University of Waterloo(滑铁卢大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07681 2026-06-09 cs.SE cs.AI cs.CE cs.MA 新提交 73%

Systematic LLM Translation of Legacy Scientific Code to Differentiable Frameworks: Application to a Land Surface Model

将遗留科学代码系统性地LLM翻译为可微分框架:以陆面模型为例

Aya Lahlou, Linnia Hawkins, Pierre Gentine

机构 * University of California, Los Angeles(加州大学洛杉矶分校) NASA Goddard Space Flight Center(国家航空航天局戈达德空间飞行中心)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出基于LLM的五阶段流水线,将遗留Fortran代码自动翻译为JAX可微分框架,在CLM-ml-v2模型上实现完整雅可比矩阵计算和24倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10842 2026-06-09 cs.SE cs.AI 版本更新 73%

Resilient Write: A Six-Layer Durable Write Surface for LLM Coding Agents

抗挫写入:一种六层耐用写入表面用于大语言模型编码代理

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperixlabs, Ghana(塞普里克斯实验室,加纳) Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(库马西技术大学,加纳) VIA Cybersecurity Lab, Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(VIA网络安全实验室,库马西技术大学,加纳)

专题命中 软件智能体 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Resilient Write,通过六层耐用写入表面提升编码代理在文件写入时的容错能力,减少恢复时间并提高自我纠正率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07297 2026-06-08 cs.SE cs.CL 新提交 73%

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.CL、cs.SE

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08717 2026-06-08 cs.SE cs.AI 版本更新 73%

Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents

调试调试器:面向软件工程智能体的失败锚定结构化恢复

Chenyu Zhao, Shenglin Zhang, Yihang Lin, Wenwei Gu, Zhimin Chen, Yongqian Sun, Dan Pei, Chetan Bansal, Saravan Rajmohan, Minghua Ma

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Microsoft(微软)

专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出PROBE框架,通过遥测层、诊断层和指导门将运行时证据转化为结构化恢复指导,在代码修复、工作流恢复等场景中诊断准确率65.37%,恢复率21.79%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24511 2026-06-02 cs.LG cs.AI cs.CR 73%

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

Claudini: 自动研究发现针对LLM的最先进对抗攻击算法

Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

机构 * MATS ELLIS Institute(MATS ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Imperial College London(伦敦帝国理工学院)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自动研究循环,利用前沿AI代理(如Claude Code和Codex)自动发现针对大语言模型的新型对抗攻击算法,在白盒越狱和提示注入评估中达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13937 2026-06-02 cs.LG cs.SE 73%

iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML

iML: 可执行、问题驱动且广泛探索的代码驱动自动机器学习

Dat Le, Duc-Cuong Le, Anh-Son Nguyen, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

AI总结 提出iML多智能体框架,通过任务分析、数据剖析、结构化蓝图生成和模块化代码合成,实现可执行、问题驱动且广泛探索的代码驱动AutoML,在MLE-BENCH和iML-BENCH上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16187 2026-06-01 cs.SE cs.LG 73%

MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair

MatchFixAgent: 语言无关的自主仓库级代码翻译验证与修复

Ali Reza Ibrahimzada, Brandon Paulsen, Reyhaneh Jabbarvand, Joey Dodds, Daniel Kroening

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) Amazon, Arlington, VA, USA(亚马逊公司,阿灵顿,弗吉尼亚州,美国) University of Oxford, Oxford, UK(牛津大学,牛津,英国)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

AI总结 提出基于大语言模型的多智能体框架MatchFixAgent,实现语言无关的仓库级代码翻译等价性验证与修复,在验证覆盖率和修复成功率上显著优于现有方法。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24631 2026-05-28 cs.SE cs.AI 73%

Coherence Collapse: Diagnosing Why Code Agents Fail After Reaching the Right Code

一致性崩溃:诊断代码智能体在到达正确代码后失败的原因

Myeongsoo Kim, Dingmin Wang, Siwei Cui, Farima Farmahinifarahani, Terry Yue Zhuo, Shweta Garg, Baishakhi Ray, Rajdeep Mukherjee, Varun Kumar

机构 * AWS AI Labs(AWS AI实验室) Monash University(墨尔本大学)

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 通过轨迹分解分析,发现代码智能体在定位正确后仍因编辑质量缺陷(尤其是“一致性崩溃”)而失败,并提出了无需参考的共识驱动改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04905 2026-05-21 cs.SE cs.CL 73%

Retrieval-Augmented Code Generation: A Survey with Focus on Repository-Level Approaches

检索增强的代码生成:聚焦于仓库级方法的综述

Yicheng Tao, Yuante Li, Yao Qin, Yepang Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.CL、cs.SE

AI总结 本文综述了检索增强的代码生成方法,重点探讨仓库级方法,分析了其在大规模代码生成中的挑战与解决方案,总结了现有方法的分类框架及关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18073 2026-05-19 cs.SE cs.AI 73%

A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback

A-ProS:通过多模型反馈实现可靠的自主编程

Anika Tabassum, Md Sifat Hossain, Md. Fahim Arefin, Tariqul Islam, Tarannum Shaila Zaman

机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。

Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02512 2026-05-19 cs.ET cs.AI cs.SE 73%

Human-Certified Module Repositories for the AI Age

面向AI时代的可信模块仓库

Szilárd Enyedi

机构 * Automation Department, Technical University of Cluj-Napoca, Romania(克卢日-纳波卡技术大学自动化系,罗马尼亚)

专题命中 软件智能体 :AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HCMR框架,通过人类监督与自动化分析结合,确保模块的可信度,为AI辅助开发提供安全可预测的模块组装方法。

Comments v4: acknowledged AI use for grammar and readability, added IEEE copyright notice; v3: 13 pages, new subsection about strong typed languages forcing AI to create more reliable code; v2: 12 pages, improved references; v1: 11 pages, 3 figures, 2 tables, prepared for AQTR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23106 2026-04-28 cs.SE cs.AI cs.MA 73%

No Test Cases, No Problem: Distillation-Driven Code Generation for Scientific Workflows

无测试用例,无问题:基于知识蒸馏的科学工作流代码生成

Siddeshwar Raghavan, Tanwi Mallick

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MOSAIC框架,通过知识蒸馏和结构化问题分解实现无测试用例的科学代码生成,提升准确性和执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07849 2026-04-23 cs.SE cs.AI cs.IR 73%

SweRank: Software Issue Localization with Code Ranking

SweRank: 代码排名用于软件问题定位

Revanth Gangi Reddy, Tarun Suresh, JaeHyeok Doo, Ye Liu, Xuan Phi Nguyen, Yingbo Zhou, Semih Yavuz, Caiming Xiong, Heng Ji, Shafiq Joty

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Salesforce Research(Salesforce 研究) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SweRank框架,通过高效的检索与重排序方法提升软件问题定位的准确性,实验表明其在SWE-Bench-Lite和LocBench上优于现有方法。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16021 2026-04-21 cs.SE cs.AI 73%

Neurosymbolic Repo-level Code Localization

神经符号层面的代码定位

Xiufeng Xu, Xiufeng Wu, Zejun Zhang, Yi Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出KA-LCL问题,引入KA-LogicQuery基准测试,展示现有方法在无命名提示下的性能下降,提出LogicLoc框架结合LLM和Datalog实现精确代码定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10300 2026-04-14 cs.SE cs.AI 73%

From Helpful to Trustworthy: LLM Agents for Pair Programming

从有益到可信:用于配对编程的LLM代理

Ragib Shahariar Ayon

机构 * Texas State University(德克萨斯州立大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究多代理LLM配对编程,通过外部化意图和工具迭代验证,提升代码可靠性、可审计性和可维护性。

Comments Accepted in 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28013 2026-04-13 cs.CR cs.AI cs.LG 73%

Kill-Chain Canaries: Stage-Level Tracking of Prompt Injection Across Attack Surfaces and Model Safety Tiers

Kill-Chain Canaries: 阶段级跟踪跨攻击表面和模型安全层级的提示注入

Haochuan Kevin Wang, Zechen Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Chicago(芝加哥大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过跟踪加密令牌四个阶段,揭示提示注入是管道-架构问题,发现写节点位置是最高安全决策,所有防御因通道不匹配失效,且隐形白字体PDF负载可匹配或超越可见文本ASR。

Comments 10 pages, 8 figures. Benchmark code and run logs released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05744 2026-04-13 cs.CL cs.SE 73%

CodeScout: Contextual Problem Statement Enhancement for Software Agents

CodeScout: 为软件代理提供上下文化的问题陈述增强

Manan Suri, Xiangci Li, Mehdi Shojaie, Songyang Han, Chao-Chun Hsu, Shweta Garg, Aniket Anand Deshmukh, Varun Kumar

机构 * University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services (AWS)(亚马逊云服务(AWS)) Databricks

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.CL、cs.SE

AI总结 CodeScout通过轻量级预探索将模糊请求转化为完整问题陈述,提升软件代理性能,实验表明其在解决率上提升20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06013 2026-04-08 cs.AI cs.CL 73%

Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis

知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议

Michael Cuccarese

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。

Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19894 2026-04-08 cs.SE cs.AI 73%

TransAgent: Enhancing LLM-Based Code Translation via Fine-Grained Execution Alignment

TransAgent:通过细粒度执行对齐增强基于LLM的代码翻译

Zhiqiang Yuan, Weitong Chen, Hanlin Wang, Xin Peng, Zhenpeng Chen, Yiling Lou

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 TransAgent通过细粒度执行对齐本地化错误代码块,提升LLM代码翻译的准确性与修复性能,优于现有方法33.3%和56.7%。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17581 2026-04-07 cs.SE cs.AI 73%

How AI Coding Agents Modify Code: A Large-Scale Study of GitHub Pull Requests

AI代码代理如何修改代码:对GitHub拉取请求的大型研究

Daniel Ogenrwot, John Businge

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究通过分析GitHub拉取请求中的代码修改,探讨AI代理与人类贡献在提交数量、文件修改和描述一致性上的差异。

Comments Accepted at the 23rd IEEE/ACM International Conference on Mining Software Repositories - Mining Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24738 2026-03-27 cs.DC cs.AI cs.LG cs.MA 73%

Decentralized Task Scheduling in Distributed Systems: A Deep Reinforcement Learning Approach

分布式系统中的去中心化任务调度:一种深度强化学习方法

Daniel Benniah John

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度强化学习的去中心化多智能体框架,用于解决异构分布式系统中的任务调度问题,通过轻量级架构提升效率与资源利用率。

Comments 12 pages, 8 figures. Under review. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24284 2026-03-26 cs.SE cs.AI cs.MA 73%

The Specification Gap: Coordination Failure Under Partial Knowledge in Code Agents

规范鸿沟:在代码代理中部分知识下的协调失败

Camilo Chacón Sartori

机构 * Catalan Institute of Nanoscience and Nanotechnology (ICN2), CSIC and BIST(加泰罗尼亚纳米科学与纳米技术研究所(ICN2),西班牙国家科研 council(CSIC)和巴塞罗那技术研究所(BIST))

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 研究代码代理在部分知识下的协调失败问题,发现规范鸿沟导致两代理整合准确率下降,信息不对称和协调成本是主要因素,支持以规范为导向的多代理代码生成观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21178 2026-03-24 cs.SE cs.AI 73%

LLM-based Automated Architecture View Generation: Where Are We Now?

基于LLM的自动架构视图生成:我们目前处于什么位置?

Miryala Sathvika, Rudra Dhar, Karthik Vaidhyanathan

机构 * Software Engineering Research Centre(软件工程研究中心) IIIT Hyderabad, India(海得拉巴印度理工学院)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究评估了LLM和代理方法在从源代码生成架构视图的能力,发现提示策略略有提升,定制代理在清晰度和细节水平上表现最佳,但仍存在粒度不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18740 2026-03-20 cs.SE cs.AI cs.CR 73%

Measuring and Exploiting Confirmation Bias in LLM-Assisted Security Code Review

衡量和利用LLM辅助安全代码审查中的确认偏见

Dimitris Mitropoulos, Nikolaos Alexopoulos, Georgios Alexopoulos, Diomidis Spinellis

机构 * University of Athens(雅典大学) National Infrastructures for Research(研究与技术国家基础设施) Athens University of Economics and Business(雅典经济与商业大学)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 研究LLM在安全代码审查中是否存在确认偏见及其对漏洞检测的影响,并通过实验验证偏见在软件供应链攻击中的可利用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI 73%

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 73%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 软件智能体 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21668 2026-03-05 cs.AI cs.CL cs.SC 73%

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理

Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan

机构 * MIT / Harvard(麻省理工学院/哈佛大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) MIT(麻省理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Harvard(哈佛大学)

专题命中 软件智能体 :tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 R1-Code-Interpreter通过监督学习和多阶段强化学习提升LLM的代码推理能力,实现对多样化任务的高效处理,显著提升模型性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15863 2026-03-03 cs.CL cs.AI 73%

PolySkill: Learning Generalizable Skills Through Polymorphic Abstraction

PolySkill: 通过多态抽象学习通用技能

Simon Yu, Gang Li, Weiyan Shi, Peng Qi

机构 * Northeastern University(东北大学) Uniphore

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 PolySkill通过多态抽象方法使智能体能学习通用且可组合的技能,提升技能重用性和成功率,减少步骤并增强自我探索能力。

Comments 29 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏