arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

2605.13357 2026-05-14 cs.SE cs.AI 62%

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

AIHarness工程:一种用于基础模型软件代理的运行时基质

Hailin Zhong, Shengxin Zhu

机构 * Hong Kong Baptist University(香港 Baptist大学) Beijin Normal University(北京师范大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AIHarness工程,通过运行时基质提升软件代理的工程能力,定义了十一项核心职责,并提出四层 ladder 框架和基于追踪的评估协议,以验证模型-基质-环境系统生成可验证、可归因和可维护的变更。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07001 2026-05-13 cs.SE cs.CL 62%

SmellBench: Evaluating LLM Agents on Architectural Code Smell Repair

SmellBench:评估LLM代理在建筑代码异味修复上的表现

Ion George Dinu, Marian Cristian Mihăescu, Traian Rebedea

机构 * University of Craiova(克劳索瓦大学) NVIDIA(NVIDIA公司) University Politehnica of Bucharest(布加勒斯特理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本文提出SmellBench框架,用于评估LLM代理在修复建筑代码异味方面的性能,通过专家验证发现最佳代理修复率为47.7%,但修复 aggressiveness 与代码库质量呈负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11720 2026-05-13 cs.SE cs.AI cs.MA 62%

A Research Agenda on Agents and Software Engineering: Outcomes from the Rio A2SE Seminar

关于智能体与软件工程的研究议程:来自里约A2SE研讨会的成果

Davide Taibi, Henry Muccini, Karthik Vaidhyanathan, Marcos Kalinowski, Michele Albano, Antonio Pedro Santos Alves, Renato Cerqueira, Mateus Devino, Matteo Esposito, Rodrigo Falcão, Vinicius Henning, Foutse Khomh, Valentina Lenarduzzi, Qinghua Lu, Matías Martínez, Henrique Mello, Daniel Mendez, Lucas Romao

机构 * University of Southern Denmark(丹麦南方大学) Software Engineering Research Center, IIIT Hyderabad(IIIT海得拉巴软件工程研究中心) Pontifical Catholic University of Rio de Janeiro(里约热内卢天主教大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文基于智能体AI的兴起,探讨其对软件工程的影响,提出六个主题领域及短期和长期研究方向,为软件工程社区提供协调努力的结构化基础。

Comments 6 pages, 1 table, A2SE meeting, https://sites.google.com/view/a2se2026/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10597 2026-05-12 cs.SE cs.AI 62%

CrackMeBench: Binary Reverse Engineering for Agents

CrackMeBench:用于代理的二进制逆向工程

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 CrackMeBench旨在评估语言模型代理在教育类CrackMe逆向工程任务中的能力,通过确定性二进制验证问题,结合公开校准CrackMe和生成任务,测试代理在无网络LinuxDocker沙箱中的表现,提供可重复的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16349 2026-05-12 cs.IR cs.AI cs.CL 62%

Benchmarking Real-Time Question Answering via Executable Code Workflows

通过可执行代码工作流基准测试实时问答

Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

机构 * Li Auto Inc(利亚 Auto 公司) Minzu University of China(民族大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RT-QA框架,通过可执行代码工作流实现动态评估,发现现有模型在实时适应性上存在显著不足,主要问题包括懒惰检索和时间混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07833 2026-05-12 cs.LG cs.AI 62%

MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation

MURPHY:具有回顾性信用分配的反馈感知GRPO用于多轮代码生成

Chanakya Ekbote, Vijay Lingam, Sujay Sanghavi, Jun Huan, Behrooz Omidvar-Tehrani, Anoop Deoras, Stefano Soatto

机构 * Massachusetts Institute of Technology(麻省理工学院) AWS AI(AWS人工智能)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 MURPHY通过构建反馈条件化的rollout树,实现多轮自修正代码生成,采用最大奖励和平均奖励策略,并引入post-rollout剪枝机制,提升多轮优化效率。

Comments 21 pages, 2 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02184 2026-05-12 cs.AI cs.DC cs.PL cs.SE 62%

Leveraging LLMs to Automate Energy-Aware Refactoring of Parallel Scientific Codes

利用LLM自动化能源感知的并行科学代码重构

Matthew T. Dearing, Yiheng Tao, Xingfu Wu, Zhiling Lan, Valerie Taylor

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM能否在经验执行反馈指导下生成能源高效的并行科学代码,提出LASSI-EE框架,通过多阶段迭代方法结合运行时功耗分析、能源感知提示、自纠正反馈循环和LLM作为裁判代理,实现代码重构。

Comments 12 pages, 5 figures, version under review at a peer-reviewed conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08366 2026-05-12 cs.LG cs.SE 62%

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

SWE Atlas:超越问题解决的编码代理基准测试

Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14018 2026-05-11 cs.SE cs.AI 62%

PerfCoder: Large Language Models for Interpretable Code Performance Optimization

PerfCoder:用于可解释代码性能优化的大型语言模型

Jiuding Yang, Shengyao Lu, Hongxuan Liu, Shayan Shirahmad Gale Bagi, Zahra Fazel, Tomasz Czajkowski, Di Niu

机构 * University of Alberta(阿尔伯塔大学) University of Victoria(维多利亚大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 PerfCoder通过可解释的定制化优化生成高性能代码,优于现有模型,在代码性能基准上实现更高效的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06445 2026-05-08 cs.SE cs.AI 62%

Constraint Decay: The Fragility of LLM Agents in Backend Code Generation

约束衰减:后端代码生成中LLM代理的脆弱性

Francesco Dente, Dario Satriani, Paolo Papotti

机构 * EURECOM University of Basilicata(巴利卡塔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了LLM代理在多文件后端生成中处理结构约束的能力,发现随着约束累积,性能显著下降,且框架敏感性导致不同环境下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16746 2026-05-08 cs.SE cs.CL 62%

SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents

SWE-Pruner: 为编码代理设计的自适应上下文修剪

Yuhang Wang, Yuling Shi, Mo Yang, Rongrui Zhang, Shilin He, Heng Lian, Yuting Chen, Siyu Ye, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本文提出SWE-Pruner,一种针对编码代理的自适应上下文修剪框架,通过任务感知的动态修剪策略减少长上下文影响,提升代码生成效率与准确性。

Comments Code available at https://github.com/Ayanami1314/swe-pruner

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05700 2026-05-08 cs.SE cs.AI 62%

An Empirical Study of Proactive Coding Assistants in Real-World Software Development

对现实软件开发中主动编码助手的实证研究

Lehui Li, Ruixuan Jia, Guo-Ye Yang, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Fitten Tech Co., Ltd.(Fitten科技有限公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文通过大规模实证研究,分析了模拟与现实数据在主动意图预测中的差异,提出ProCodeBench基准,并指出模拟数据无法替代真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01104 2026-05-05 cs.SE cs.CL cs.HC 62%

RECAP: An End-to-End Platform for Capturing, Replaying, and Analyzing AI-Assisted Programming Interactions

RECAP:一个端到端的平台,用于捕捉、回放和分析AI辅助编程交互

Keyu He, Qianou Ma, Valerie Chen, Wayne Chi, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.CL、cs.SE

AI总结 RECAP通过记录和回放开发者与AI编程助手的交互,分析其行为模式和策略演变,为软件工程教育提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00938 2026-05-05 cs.LG cs.AI 62%

Fusing Urban Structure and Semantics: A Conditional Diffusion Model for Cross-City OD Matrix Generation

融合城市结构与语义:一种基于条件扩散模型的跨城市OD矩阵生成方法

Bin Chen, Zhuoya Meng, Fang Yang, Runkang Guo, Jingtao Ding, Yin Zhang, Chuan Ai, Zhengqiu Zhu

机构 * Institute of Intelligent Computing, University of Electronic Science and Technology of China (UESTC)(电子科技大学智能计算研究所) College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist)(信息科学与技术国家研究中心电子工程系) School of Information and Communication Engineering, University of Electronic Science and Technology of China (UESTC)(电子科技大学信息与通信工程学院)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SE DAN模型,通过融合城市语义与空间约束生成跨城市OD矩阵,实验显示其在RMSE上优于现有方法,并在不同城市场景中保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07179 2026-05-01 cs.LG cs.AI 62%

Efficient Traffic Forecasting on Large-Scale Road Network by Regularized Adaptive Graph Convolution

通过正则化自适应图卷积实现大规模道路网络高效交通预测

Kaiqi Wu, Weiyang Kong, Sen Zhang, Zitong Chen, Yubao Liu

机构 * School of Computer Science and Engineering, Sun Yat-Sen University, China(中山大学计算机科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University, China(中山大学人工智能学院) Guangdong Key Laboratory of Big Data Analysis and Processing, China(广东大数据分析与处理重点实验室)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出正则化自适应图卷积模型,通过高效余弦操作和残差差分机制提升大规模交通网络预测效率与精度,实验表明其在多个真实数据集上均优于现有方法。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25067 2026-04-30 cs.MA cs.AI cs.LG 62%

Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

前沿编码代理如今可以实现一个AlphaZero自博弈机器学习流水线用于连接四游戏,其性能可与外部求解器相媲美

Joshua Sherwood, Ben Aybar, Benjamin Kaplan

机构 * Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准测试,评估前沿编码代理自主实现AlphaZero式机器学习流水线的能力,通过简洁任务描述而非完整前序工作参考,评估连接四游戏AI性能,发现Claude Opus 4.7在七次试验中胜过Pons求解器,其他代理表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23251 2026-04-28 cs.SE cs.AI 62%

AI-Assisted Code Review as a Scaffold for Code Quality and Self-Regulated Learning: An Experience Report

AI辅助代码审查作为代码质量和自主学习的支架:经验报告

Eduardo Oliveira, Michael Fu, Patanamon Thongtanunam, Sonsoles López-Pernas, Mohammed Saqr

机构 * The University of Melbourne(墨尔本大学) University of Eastern Finland(东芬兰大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了AI辅助代码审查在软件工程教育中的应用,通过混合方法设计分析了学生自主学习过程,发现工具优化后技术问题显著减少,且AI审查的响应率稳定,提出了AI审查在教育中的设计和教学建议。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20938 2026-04-24 cs.LG cs.AI 62%

HARBOR: Automated Harness Optimization

HARBOR:自动化Harness优化

Biswa Sengupta, Jinhua Wang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HARBOR框架,通过约束噪声贝叶斯优化解决Harness配置问题,强调自动化配置优于手动堆叠,并在生产编码代理中实例化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19825 2026-04-23 cs.SE cs.AI 62%

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距

Woojin Lee, Jin-Xia Huang

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE

AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。

Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18571 2026-04-22 cs.SE cs.AI 62%

Debug2Fix: Can Interactive Debugging Help Coding Agents Fix More Bugs?

Debug2Fix: 交互式调试能否帮助编码代理修复更多错误?

Spandan Garg, Yufan Huang

机构 * Microsoft(微软)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Debug2Fix框架,通过集成交互式调试子代理,提升编码代理在bug修复中的性能,实验显示在某些模型上性能提升超过20%,并证明更好的工具设计比切换更昂贵的模型更重要。

Comments In Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 62%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15075 2026-04-17 cs.SE cs.LG 62%

Atropos: Improving Cost-Benefit Trade-off of LLM-based Agents under Self-Consistency with Early Termination and Model Hotswap

Atropos:通过早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡

Naryeong Kim, Shin Yoo

机构 * KAIST(韩国明知大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出Atropos技术,通过预测早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡,实验表明其能将性能提升至闭合LLM的74.35%,成本降低至23.9%。

Comments Will appear at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13206 2026-04-16 cs.AI cs.LG cs.NA math.NA 62%

Numerical Instability and Chaos: Quantifying the Unpredictability of Large Language Models

数值不稳定性与混沌:量化大型语言模型的不可预测性

Chashi Mahiul Islam, Alan Villarreal, Mao Nishino, Shaeke Salman, Xiuwen Liu

机构 * Department of Computer Science, Florida State University, Tallahassee, USA(佛罗里达州立大学计算机科学系,塔拉希西亚,美国) Department of Mathematics, Florida State University, Tallahassee, USA(佛罗里达州立大学数学系,塔拉希西亚,美国)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型中数值不稳定性导致的不可预测性,揭示了浮点精度限制下误差传播机制,识别出混沌效应及三种不同行为模式。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13114 2026-04-16 cs.SE cs.AI 62%

The Code Whisperer: LLM and Graph-Based AI for Smell and Vulnerability Resolution

代码低语者:结合图神经网络和大语言模型的代码和漏洞解决方法

Mohammad Baqar, Raji Rustamov, Alexander Hughes

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Code Whisperer框架,结合图分析与大语言模型,统一检测和修复代码维护性和安全性问题,提升检测性能和修复建议实用性。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13108 2026-04-16 cs.SE cs.AI 62%

Formal Architecture Descriptors as Navigation Primitives for AI Coding Agents

形式架构描述符作为AI编码代理的导航原语

Ruoqi Jin

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了通过提供形式架构描述符减少AI编码代理在代码库探索中的导航开销,通过实验和观察证明了架构描述符在导航效率和错误检测方面的显著提升。

Comments 4 pages, 4 tables, preprint. Code and data: https://doi.org/10.5281/zenodo.19500105

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13102 2026-04-16 cs.SE cs.AI 62%

CCCE: A Continuous Code Calibration Engine for Autonomous Enterprise Codebase Maintenance via Knowledge Graph Traversal and Adaptive Decision Gating

CCCE:一种基于知识图谱遍历和自适应决策门控的连续代码校准引擎,用于企业代码库的自主维护

Santhosh Kusuma Kumar Parimi

机构 * Independent Researcher(独立研究员)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出CCCE,通过知识图谱遍历和自适应决策门控技术,实现企业代码库的自主维护,减少修复时间并提供端到端可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29088 2026-04-16 cs.SE cs.AI 62%

WybeCoder: Verified Imperative Code Generation

WybeCoder:验证性 imperative 代码生成

Fabian Gloeckle, Mantas Baksys, Darius Feher, Kunhao Zheng, Amaury Hayat, Sean B. Holden, Gabriel Synnaeve, Peter O'Hearn

机构 * CERMICS, ENPC, Institut Polytechnique de Paris, CNRS(CERMICS,ENPC,巴黎理工学院,CNRS) Computer Lab, University of Cambridge(剑桥大学计算机实验室) Korea Institute for Advanced Study(韩国高级研究院) FAIR, Meta(FAIR,Meta) University College London(伦敦大学学院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 WybeCoder 提出了一种验证性 imperative 代码生成框架,通过证明与生成同步的方式,实现代码、不变式和证明的共同进化,提升了复杂算法的验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14420 2026-04-15 cs.CL cs.AI 62%

Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following

指令即一切:用于指令遵循的自监督强化学习

Qingyu Ren, Qianyu He, Powei Chang, Jie Zeng, Zeye Sun, Fei Yu, Jiaqing Liang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(上海数据科学 key laboratory,复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种无需外部监督的自监督强化学习框架,通过直接从指令中生成奖励信号和伪标签来解决多约束任务中稀疏奖励问题,实验表明其在多个领域数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10923 2026-04-14 cs.CL cs.AI 62%

Mem$^2$Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation

Mem$^2$Evolve:通过共进化能力扩展与经验蒸馏实现自进化智能体

Zihao Cheng, Zeming Liu, Yingyu Shan, Xinyi Wang, Xiangrong Zhu, Yunpu Ma, Hongru Wang, Yuhang Guo, Wei Lin, Yunhong Wang

机构 * Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Independent Researcher(独立研究者) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Edinburgh(爱丁堡大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Mem$^2$Evolve框架,通过共进化能力扩展与经验蒸馏实现自进化智能体,实验显示其在多个任务和基准上的性能显著优于传统方法。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03088 2026-04-14 cs.SE cs.LG 62%

SkVM: Revisiting Language VM for Skills across Heterogenous LLMs and Harnesses

SkVM:重新审视跨异构LLM的技能语言虚拟机

Le Chen, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本文提出SkVM,通过将技能视为代码并利用LLM作为异构处理器,解决技能在不同平台间执行不一致的问题,提升技能可移植性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏