SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
SWE Atlas:超越问题解决的编码代理基准测试
Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He
专题命中
软件智能体
:agentic(abstract);分类 cs.LG、cs.SE
AI总结
SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。
SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment
SafeHarness:面向LLM代理部署的生命周期集成安全架构
Xixun Lin, Yang Liu, Yancheng Chen, Yongxuan Wu, Yucheng Ning, Yilong Liu, Nan Sun, Shun Zhang, Bin Chong, Chuan Zhou, Yanan Cao
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)
;
Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究所)
;
Peking University(北京大学)
机构
*
Fudan University(复旦大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Meta AI
;
AI Research Institute, Squirrel Ai Learning(Squirrel Ai Learning人工智能研究院)
;
Monash University(墨尔本大学)
;
Shanghai Academy of AI for Science(上海人工智能科学研究院)
HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph Evolution
HAGE: 通过RL驱动的加权图进化利用代理记忆
Dongming Jiang, Yi Li, Guanpeng Li, Qiannan Li, Bingzhe Li
机构
*
Department of Computer Science, The University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系)
;
Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系)
;
University of California, Davis(加州大学戴维斯分校)